נתונים לא מאוזנים הוא אתגר משותף בלמידה של מכונות.זה קורה כאשר שיעור אחד באופן משמעותי מספר אחרים, המשפיע על הביצועים של מודלים חיזוי. החלת טכניקות מתאימות יכול לשפר דיוק מודל ואמינות.

הבנה של נתונים מאוזנים

נתונים מאוזנים מאופיין על ידי הפצה לא פרופורציונלית של שיעורים.לדוגמה, בגילוי הונאה, עסקאות אמיתיות מתוך מספר הונאה.חוסר איזון זה יכול לגרום מודלים לטובת המעמד הרוב, צמצום גילוי של מקרים של מיעוט.

טכניקות מעשיות ל- Handling Imמאזן

מספר שיטות יכולות לטפל בחוסר איזון נתונים ביעילות:

  • (ב) ,0) ,Resampling: 1FLT) מכוונן את הנתונים על ידי קבוצות מיעוט או שיעורי רוב מורדים.
  • (FLT:0)Synthetic Data Generation:FLT:1 השתמש בטכניקות כמו SMOTE כדי ליצור דוגמאות מלאכותיות של קבוצות מיעוט.
  • (ב) מודלים של תעסוקה:0 (אלגוריתמיים: 1) מודלים של תעסוקה אשר הם בעלי עוצמה חסרת איזון, כגון שיטות הרכב.
  • (ב) למידה רגישה:0 (FLT:1) , נספח 1 עולה לשגיאות ייצוגיות מיעוט.

עקבו אחרי Im Balanced Data

הערכת מודלים על נתונים לא מאוזנים דורשת מדדים ספציפיים:

  • (ב) ,0) ,הקדמה: 1 (ב) שיעור התחזיות החיוביות האמיתיות בקרב כל התחזיות החיוביות.
  • (ב) ,0) , מדרש (ב) הוא ביטוי נכון.
  • (ב) ויקרא י"א: "ה': "ה'" (ב"ב) "המשמעות ההרמונית של דיוק וזיכרון".
  • (ב) ⁇ :0) ,U-ROC: FLT:1 מודד את יכולת המודל להבחין בין המעמדות על פני סף.