פיטולים נפוצים בסופר-ביודי למידה וכיצד לטפל בהם עם קלוריות
למידה על-ידי Supervised היא גישה למידה מכונה בשימוש נרחב הכולל מודלים הדרכה על נתונים מתוייגים. עם זאת, מתרגלים לעתים קרובות נתקלו במכשולים נפוצים שיכולים להשפיע על הביצועים והאמינות של המודלים שלהם.
overfitting and Underfitting
התאמה מתרחשת כאשר מודל לומד את נתוני האימון גם כן, כולל רעש, המוביל להכללה גרועה על נתונים חדשים.בהתאם להתאמה מתרחשת כאשר המודל הוא פשוט מדי כדי ללכוד דפוסים בסיסיים.
(ב) , השוואות בין טעות האימונים (EsentiFLT:0trainigtureFLT:1) וטעות אימות (Eph:2valFLT 3: 3) יכול להצביע על התאמה אם EcioFLT:4traincioFLT:5 הוא נמוך מאוד בעוד EFLT 6valFLT 7 הוא גבוה, שגיאות גבוהות, על שתי הרמזים תחת יעילות.
המונחים:
חוסר איזון הכיתה מתרחש כאשר חלק מהשיעורים מוצגים בנתוני ההתחלה, מה שמוביל למודלים מוטים. .קלוד אחוזי חלוקת המעמדות מסייע לזהות חוסר איזון.
נניח כי ל- 1000 דגימות יש 1000 דגימות, עם 900 השייכים ל- A ו- 100 לכיתת B. אחוז ההפצה בכיתה הם:
דרגה A: (900/1000) * 100=90%
דרגה B: (100/1000) * 100=10%
הערכת ביצועי המודל
מסובכים כגון דיוק, דיוק, זיכרון ו- F1-score חיוניים להערכת ביצועי המודל. Calculations כרוכים ברכיבי ממטריקס בלבול:
- חיובי אמיתי (TP)
- חיובי כוזב (FP)
- שלילית כוזבת (FN)
לדוגמה, הדיוק מחושב כמו:
המונחים: TP / (TP + FP)
עקבו אחרי Noisy Data
נתונים נוסיים יכולים לעוות את הכשרת המודל.קלוריות כגון יחסי רעש לחתימה עוזרות לכמת איכות נתונים.
נניח שהנתונים כוללים 100 דגימות רועשות מתוך 1000 דגימות הכוללות.יחס הרעש הוא:
Noise Ratio = (מספר הדגימות רועשות) / (דגימות הכוללות) = 100 / 1000 = 0 או 10%