נתונים מאוזנים הם אתגר משותף בלמידה של מכונות, שבו מחלקה אחת החוצה באופן משמעותי את מספר האחרים.חוסר איזון זה יכול להוביל למודלים מוטה כי ביצועים גרועים בכיתות מיעוט. יישום טכניקות יעילות יכול לעזור לשפר את ההוגנות המודל ואת הדיוק.

הבנת איזון נתונים

חוסר איזון נתונים מתרחש כאשר חלוקת המעמדות ב-Dataset אינה אחידה.לדוגמה, בגילוי הונאה, עסקאות אמיתיות מתוך מספר הונאה.חוסר איזון זה יכול לגרום למודלים לטובת המעמד הרוב, צמצום יכולתם לזהות מקרים של מיעוט.

טכניקות לטיפול ב-Im balance

ניתן להשתמש במספר שיטות כדי להפחית את חוסר האיזון בנתונים:

  • (ב) ,0) ,Resampling: 1FLT) מכוונן את הנתונים על ידי קבוצות מיעוט או שיעורי רוב מורדים.
  • (FLT:0)Synthetic Data Generation:FLT:1 השתמש באלגוריתמים כמו SMOTE כדי ליצור דוגמאות סינתטיות של קבוצות מיעוט.
  • (ב) מודלים של תעסוקה:0 (אלגוריתמיים: 1) מודלים של תעסוקה אשר הם בעלי עוצמה חסרת איזון, כגון שיטות הרכב.
  • (ב) למידה רגישה:0 (FLT:1) , כסימן גבוה יותר של עלויות הנאות לשיעורי מיעוט במהלך אימון.

שקיפות לשיפור ההוגנות

מסובכים כגון Precision, Recall ו-F1-Score עוזרים להעריך ביצועים במודל על נתונים לא מאוזנים. חישוב ה- G-mean ו- AUC-ROC מספק תובנות לתוך האיזון בין הרגישות והפרטים. חישובים אלה מנחים התאמות לשיפור ההוגנות.

לדוגמה, ה-F1-Score מחושב כ:

(ב) ויקרא (ב"ב) ויקרא (ב"ד)

אופטימיזציה של מדדים אלה מבטיחה שהמודל מבצע היטב בכל המעמדות, מקדם ההוגנות והאמינות.