Цивільно-імперські послуги; структурне будівництво
Практичні підходи до обробки даних, що містяться в машинному навчанні
Table of Contents
Обробка незбалансованих даних є загальним завданням в машинному навчанні. Коли один клас істотно незрівнянний, моделі можуть бути упереджені, що призводить до бідної продуктивності на неповнолітніх класих. Реалізація практичних стратегій може підвищити точність моделі та справедливість.
Розуміння даних, що містяться в імбалансованих даних
Небалансований датасет виникає, коли розподіл занять нерівномірно. Наприклад, при виявленні шахрайства, шахрайські операції є рідкісними порівняно з законними. Визначте цей недолік є першим кроком, щоб ефективно вирішувати його.
Методика Data-Level
Методики обробки даних змінюють дані, що зберігаються у розподілі класу балансу. До загальновідомих методів відносяться:
- Повершено:] Збільшення кількості зразків класу меншості, часто використовують методи, такі як SMOTE.
- Універсал: Зменшення більшості зразків класів для узгодження розміру класу меншості.
- Data Augmentation: Створення нових зразків синтетичних для підвищення рівня меншості.
Алгоритм-Level Стратегії
Налаштування алгоритму навчання також може звернутися до класної дисбаланси. До послуг відносяться:
- Кост-чутливе навчання: Присвоєння більших витрат на визначення рівня меншості до помилок класу.
- Налаштування ваги класу: Зміна значення занять під час проведення моделювання.
- Ексмаральні методи: Комбінування декількох моделей для поліпшення виявлення класів меншості.
Оцінка метрики
Використання відповідних метриків є важливим для оцінки продуктивності моделі на небалансованих даних. До складу метрики відносяться:
- Порада:] Пропорція істинних позитивних відгуків серед прогнозованих позитивів.
- Recall: Пропорція фактичних позитивних результатів правильно визначено.
- F1 Оцінка:] // гармонічний засіб прецизії та згадування.
- AUC-ROC: Заходи можливості моделі для розрізнення між класичними класиками.