Несбалансированные наборы данных распространены во многих реальных приложениях, таких как обнаружение мошенничества, медицинская диагностика и обнаружение аномалий. Решение проблемы дисбаланса имеет решающее значение для построения эффективных моделей машинного обучения. В этой статье рассматриваются практические методы, поддерживаемые математическими принципами для эффективного управления несбалансированными данными.

Понимание дисбаланса данных

Дисбаланс данных возникает, когда число экземпляров в одном классе значительно превышает число экземпляров в другом. Этот дисбаланс может смещать модели в сторону класса большинства, уменьшая их способность обнаруживать экземпляры класса меньшинства. Математически, если N является общим количеством образцов и Nменьшинство является числом образцов класса меньшинства, соотношение дисбаланса составляет IR = N/Nменьшинство.

Методы для устранения дисбаланса

Некоторые методы могут смягчить последствия дисбаланса данных. Эти методы можно в целом классифицировать на основе подходов на уровне данных и алгоритмов.

Методы уровня данных

  • Образцы: Увеличение выборки классов меньшинств, часто с использованием методов, таких как SMOTE, который генерирует синтетические точки данных на основе существующих образцов меньшинств.
  • Подборка выборки: Сокращение выборки классов большинства для балансировки набора данных, что может привести к потере ценной информации.
  • Гибридные подходы: Комбинирование избыточной выборки и недостаточной выборки для оптимизации баланса данных.

Методы алгоритмического уровня

  • Особое обучение: Присвоение более высоких затрат на неправильное классификацию ошибкам класса меньшинства, чтобы повлиять на фокус модели.
  • Методы сборки: Использование методов, таких как повышение эффективности обнаружения классов меньшинств.
  • Корректировка порогов принятия решений: Изменение порога вероятности в пользу прогнозов класса меньшинств.

Математические основы

Многие методы основаны на статистических и математических концепциях. Например, SMOTE создает синтетические образцы путем интерполяции между точками классов меньшинств:

xnew = xi + lambdaj — xi

где xi и xj] являются выборками классов меньшинств, и lambda является случайным числом между 0 и 1. Такой подход гарантирует, что синтетические данные находятся в пространстве признаков класса меньшинства, сохраняя целостность распределения данных.