Для составления прогнозов на основе меченых данных используются модели обучения под контролем. Для создания эффективных моделей необходимо достижение баланса между переобучением и недообучением. В данной статье рассматриваются эти концепции и предлагаются стратегии проектирования для оптимизации производительности модели.

Переобучение в контролируемых моделях

Переобучение происходит, когда модель слишком хорошо изучает данные обучения, включая шум и выбросы. В результате она плохо работает с новыми, невидимыми данными. Переобученные модели имеют тенденцию быть сложными и имеют высокую дисперсию.

Недостаток в контролируемых моделях

Недостаточная подгонка происходит, когда модель слишком проста для захвата базовых моделей в данных. Это приводит к плохой производительности как на обучающих, так и на тестовых наборах данных. Неподгоняемые модели имеют высокую смещенность и низкую дисперсию.

Стратегии предотвращения переобучения

  • Регуляризация: Такие методы, как L1 и L2, добавляют штрафы к сложности модели.
  • Перекрестная проверка: Использование наборов проверки помогает настроить гиперпараметры и обнаружить переобучение.
  • Обрезка: Упрощение моделей, таких как деревья решений, снижает ненужную сложность.
  • Раннее прекращение: Прекращение обучения до того, как модель перевыполнит данные.

Стратегии предотвращения недоработки

  • Увеличение сложности модели: Использование большего количества функций или сложных алгоритмов.
  • Инженерные характеристики: Создание новых функций для лучшего представления шаблонов данных.
  • Снижение регуляризации: Минимизация штрафов, ограничивающих гибкость модели.