Математичне моделювання в машинобудуванні
Розрахунок впливу на захист даних на моделі супервізійного навчання
Table of Contents
Неправомірність даних відбувається при розподілі класів в даних, що є нерівномірним. Це може істотно вплинути на виконання керованих моделей навчання, що призводить до зміщених прогнозів і зниженої точності для занять меншин.
Розуміння даних
У багатьох сценаріях реального світу деякі класи більш поширені, ніж інші. Наприклад, при виявленні шахрайства, шахрайські операції є рідкісними порівняно з законними. Цей недолік може викликати моделі на користь більшості класу, ігноруючи рівень меншості.
Вимірювання впливу
Для оцінки якості дисбалансу даних впливає на модель, можна використовувати кілька метриків:
- Accuracy: може бути введене в оману в об'єктивних даних, оскільки висока точність може бути досягнута завжди прогнозування більшості клас.
- Повага і Нагадаємо: Забезпечити уявлення про можливість моделі визначити позитивні випадки.
- F1 Оцінка: Комбіновані точність та згадка для надання збалансованого виміру.
- ROC-AUC: Заходи можливості моделі розрізняти між класами по пороги.
Розрахунок впливу
Один підхід до кількісного визначення впливу на дисбаланс даних полягає у порівнянні продуктивності моделі на збалансовані суперечки, що небалансовані дані. Методи включають:
- Застосування методів перезволоження, таких як перезволоження або підводне плавання.
- Використання синтетичних даних, таких як SMOTE.
- Оцінювання метрики до і після балансування техніки.
- Аналіз змін у точності, згадка, а також F1 бал.
За допомогою вимірювання цих показників, практикуючим може оцінити, скільки впливів на моделі, прогнози та визначити відповідні стратегії знешкодження.