Table of Contents
Seturile de date dezechilibrate sunt comune în multe aplicații din lumea reală, cum ar fi detectarea fraudei, diagnosticarea medicală și detectarea anomaliei. Abordarea dezechilibrului este esențială pentru construirea unor modele eficiente de învățare a mașinilor. Acest articol explorează tehnici practice susținute de principii matematice pentru a gestiona în mod eficient datele dezechilibrate.
Înțelegerea dezechilibrului datelor
Dezechilibrul datelor apare atunci când numărul de cazuri dintr-o clasă depășește semnificativ pe cele dintr-o altă clasă. Acest dezechilibru poate înclina modelele către clasa majoritară, reducându-le capacitatea de a detecta cazurile din clasa minorităților. Matematica, dacă NNN Minoritate]] este numărul de eșantioane din clasa minorităților, raportul dezechilibru este IR = N=N= .
Tehnici de manipulare a dezechilibrului
Mai multe tehnici pot atenua efectele dezechilibrului datelor. Aceste metode pot fi clasificate în linii mari în abordări la nivel de date și la nivel de algoritm.
Metode la nivel de date
- Exemplare: Creşterea eşantioanelor de clasă minoritară, adesea folosind metode precum SMOTE, care generează puncte de date sintetice bazate pe mostrele minoritare existente.
- Subeșantionare: Reducerea eșantioanelor clasei majoritare pentru echilibrarea setului de date, care poate risca pierderea de informații valoroase.
- Abordări de hibrid: Combinând suprasamplerea și subeșantionarea pentru optimizarea echilibrului datelor.
Metode de nivel algoritm
- Învățare sensibilă la nivel de grup: Atribuirea costurilor mai mari de clasificare greșită erorilor de clasă minoritară pentru a influența concentrarea modelului.
- Metodele de asamblare: Utilizarea tehnicilor de stimulare a detecţiei clasei minoritare.
- Ajustarea pragurilor de decizie: Modificarea probabilității de întrerupere a previziunilor pentru clasa minoritară.
Fundaţii matematice
Multe tehnici sunt fundamentate în concepte statistice și matematice. De exemplu, SMOTE creează eșantioane sintetice prin interpolarea între punctele de clasă minoritare:
xnew[ = x[i + lambda (xj] - xi]]
unde xi[[ și xj] sunt eșantioane de clasă minoritară și lambda este un număr aleatoriu între 0 și 1. Această abordare asigură că datele sintetice se află în spațiul de caracteristici al clasei minoritare, menținând integritatea distribuției datelor.