עצי ההחלטות הם אבן הפינה של למידת מכונה מפרשית, המציעים מבנה ברור, מבוסס חוק המשקף את קבלת ההחלטות האנושית.למרות הפשטות והמשיכה החזותית שלהם, הם באים עם נפילה ידועה לשמצה: overfitting. עץ החלטה אשר מעלימות בעצם ממלמל את נתוני האימון, כולל רעשיה ומוזרות שלה, ולא ללמוד את הדפוסים הבסיסיים.

הבנה של עצים ברזולוציה

ההתעלות מתרחשת כאשר עץ ההחלטות הופך עמוק מדי או מורכב מדי, לכידת תנודות אקראיות במערכת האימונים במקום האות האמיתי. בפועל, זה מתבטא כעץ עם הרבה צמתים ומשאיר כי כל אחד מכיל רק דגימות מעט מאוד.דיוק האימונים של המודל מתקרב 100%, אבל אימות או דיוק הבדיקה שלו מתהפך רחוק מאחורי הפער הזה הוא המדד העיקרי של overfitting שורש השקרים in the recurive tree, כי אין תכונות כוח חיזוי, בעצם, כי אין זה יכול להיות אלגוריתם של ממש מתאים, כמו אלגוריתם של חומר זה, או דיוק, כי הוא בעצם, כי הוא האלגוריתם של רעש אמיתי, כי הוא בעצם, כי הוא האלגוריתם של חומר ניקוי או הדיוק של חומר זה הוא האלגוריתם של רעש, כי הוא בעצם, הוא האלגוריתם של חומר זה הוא בעצם, כי הוא בעצם, הוא האלגוריתם של חומר זה הוא האלגוריתם של חומר זה הוא האלגוריתם של חומר ניקוי או דיוק האלגוריתם של חומר ניקוי או דיוק האלגוריתם של חומר זה הוא בעצם, כי הוא בעצם, הוא האלגוריתם של רעש אמיתי, הוא האלגוריתם של ממש, הוא בעצם, הוא בעצם, הוא האלגוריתם של חומר זה הוא האלגוריתם של חומר זה הוא האלגוריתם של חומר זה הוא בעצם, הוא האלגוריתם של חומר זה הוא הפחתת כוח אלגוריתם של חומר

הסימפטומים של overfitting כוללים:

  • עצים עמוקים מאוד עם עשרות רמות.
  • להשאיר רק אחד או שניים מקרים של אימון.
  • רגישות גבוהה לשינויים קטנים בנתונים האימונים.
  • ביצועים עניים על אימות, גלגול צלב או בדיקות.

מבחינה מתמטית, התאמה יתר של השחלות הגבוהות בתחזיות המודל.שינוי קטן בקלט מוביל לשינוי גדול בתוצאות הצפויות.כתובת על התאמה היא אפוא על צמצום השחלות מבלי להקריב יותר מדי הטיה.המטרה היא למצוא את המקום המתוק שבו המודל לוכד את הדפוסים האמיתיים ללא רעש.

אסטרטגיות בסיסיות למניעת התאמה

כמה טכניקות מעשיות יכולות לרסן את ההתעלות בעצי ההחלטות.שיטות אלה נופלות לשתי קטגוריות: טרום אימון (עצירת גידול עץ מוקדם) ולאחר אימון (הגדלה של העץ באופן מלא לאחר מכן משילמת אותו).

« « « רוץ העץ

(השיטה היא השיטה הוותיקה והאינטואיטיבית ביותר.לאחר שגידול עץ לעומק המלא, אתה מסיר באופן סלקטיבי סניפים שמוסיפים ערך חיזוי קטן.הטכניקה הנפוצה ביותר היא עבירת עלות-מורכבות, הידועה גם כמשט חלש ביותר לקישורים.You compute a Complexplexs (לעתים קרובות deted as α) המענישת את העץ עבור מספר העלים שלה.

לדוגמה, דמיינו עץ החלטה שמתפצל על תכונה כמו "תעודת זהות אישית" שפיצול עשוי להפריד באופן מושלם דוגמאות לאימון נפרד, אך יהיה חסר תועלת בנתונים חדשים.הפעלת ענפים כה מעוררים, מה שחייב את המודל להסתמך על דפוסים משמעותיים.

הגבלת עץ

דרך פשוטה למנוע התאמה היא לכווץ את העומק המקסימלי של העץ. Depth שולט במספר הפיצולים ההצלחות מהשורש אל עלה העמוק ביותר.עצים עמוק יותר יכולים לעצב מערכות יחסים מורכבות יותר, אבל הם גם נוטים יותר להתאמה יתר. קביעת עומק מקסימלי פועל כמו מעצמת קשה על מורכבות.עבור נתונים רבים, עומק בין 5 ל-15 יצירות, אבל כדאי לך לכוון זה באמצעות מספר רב של חומרים פגיעים במיוחד כאשר הם בעלי תכונות מתוחכמות יחסית.

הגבלת עומק היא טכניקה קלאסית לפני אימון.זה מפסיק את העץ מיצירת פיצולים המבוססים על תת-קרקעיות זעירות, רועשות.כלל אצבע: להתחיל עם עומק מקסימלי של 3 עד 5, להתבונן בביצועי אימות, בהדרגה להגביר את העומק תוך מעקב אחר פער הביצוע.

דוגמאות מינימליות לפיצול ועוזבים

שיטה נוספת לפני אימון היא לדרוש מספר מינימלי של דגימות בצומת פנימי לפני שניתן לחלק אותו. בדומה לכך, ניתן להגדיר מספר מינימלי של דגימות עבור עלות. פרמטרים אלה להבטיח כי פיצולים נעשים רק כאשר יש מספיק נתונים כדי לתמוך במחלקים משמעותיים סטטיסטית.לדוגמה, הגדרת סעיף 1 פירושו כי כל צומת עם פחות מ 10 דגימות לא יהיה מחולק עוד יותר מאשר עם עלות 5 אלה עשוי להיות פחות גדול יותר מאשר כדי ללכוד את הדפוסים ספציפיים.

פרמטרים אלה שימושיים במיוחד במאגרי נתונים קטנים עד בינוניים שבהם overfitting הוא איום קבוע.הם להפחית השחלות בעלות של עלייה קלה בהטיה, לעתים קרובות מוביל רווח נטו בהכללה.

אפשרויות ל-Digitality Reduction

עצי ההחלטות חזקים יחסית לתכונות לא רלוונטיות, אבל כאשר מספר התכונות הוא גדול יחסית למספר הדגימות, העץ יכול בקלות להתאים על ידי איסוף של קורלציות מעוררות.

  • הסרת תכונות עם שוניות נמוכות או מתאם גבוה עם אחרים.
  • באמצעות בדיקות סטטיסטיות לא חיוניות (למשל, מידע צ'י-סקולי, מידע הדדי) כדי לבחור את התכונות המודיעיניות ביותר.
  • החלת קידוד תכונות חוזר (RFE) כדי לתקן תכונות פחות חשובות.

ניתוח משלים ראשי (PCA) יכול גם להיות מיושם כדי להפחית את המימדליות לפני אימון עץ החלטה, אם כי הפרשיות של העץ עלול לסבול מאז התכונות הופכות לשילובים ליניאריים של תכונות מקוריות. בפועל, באמצעות ידע דומיין כדי לשמור רק את התכונות הרלוונטיות ביותר הן להפחית את ההתאמה ומהירויות של אימון.

Cross-Validation for Hyperparameter Tuning

עבודת קרוס אינה טכניקה ישירה למניעת התאמה, אך חיוני למציאת היפרפרפרמטרים הנכונים.על ידי חלוקת נתוני האימון לקאפלים מרובים, אתה יכול להעריך כיצד המודל פועל על תת-קרקעיים בלתי נראים.זה נותן הערכה אמינה של טעות הכללה.אסטרטגיות של סגמנטורים נפוצים כוללות k-fold (בדרך כלל 5 או 10 מתקפלים), סטיות מרשימות (שיעור קטן מאוד).

כאשר כוונון היפרפרמטר כמו עומק מקסימלי, דגימות מינימום פיצול, או פרמטר α, סגירה חוצה-פעמי מונע ממך להתאים את מערכת אימות עצמו.לדוגמה, אם אתה מנסה 100 ערכים עומק ולבחור את זה עם השגיאה האימות הנמוך ביותר, אתה סיכון overfitting זה סט אימות.שימוש ממוצעי חצי-פעפיים של השגיאה חוצה, מניב הערכה כנה יותר.

טכניקות מתקדמות ל- Better Generalization

מעבר לאסטרטגיות הבסיסיות, מספר שיטות מתקדמות יכולות לשפר באופן דרמטי את הכללת מודלים של עץ ההחלטות, לעתים קרובות בעלות של פרשנות מסוימת.

שיטות להקות: Bagging ו-random Forests

למידה משותפת מפחיתה את השחלות על ידי שילוב של עצים מרובים.הגישה המפורסמת ביותר היא היער אקראי, אשר בונה עצי החלטות רבים על דגימות מפוספסים של הנתונים ומשתמשת בתכונות אקראיות עבור כל פיצול.התחזיות מכל העצים בממוצע (לחזרה מחדש) או הצביע (לסיווג) כי כל עץ מאומן על נתונים ותכונות מעטות, שגיאות נוטה לבטל, להוביל מודל כי הוא משפר את האינטראקציות פשוטות יותר מאשר יכולת איסוף עץ).

יערות אקראיים חזקים ולעתים קרובות הבחירה ללכת כאשר הפרשנות אינה חשובה.הם מטפלים במספרים גדולים של תכונות היטב והם פחות רגישים לבחירות היפר-פרפרמטר.המסחר הוא אובדן תהליך קבלת ההחלטות השקופה: אתה יכול לראות חשיבות תכונה אבל לא דרך החלטה ברורה אחת.

שיפור וסדיר

אלגוריתמים כמו Gradient Boosted Trees (למשל, XGBoost, LightGBM) בונים עצים באופן שווה, עם כל עץ חדש המתמקד לתיקון שגיאות של הקודם, בעוד חיזוק יכול גם להתאים יתר אם מותר לגדל יותר מדי עצים, יישומים מודרניים כוללים פרמטרים קבועים בנוי כגון שיעור למידה, יחסי תת-קרקעי, ו-L1 / L2 קנסות על גבי דיוק רגיל.

הפסקת מוקדם

כאשר מודלים של הרכב אימון (במיוחד הגדלת), עצירה מוקדמת היא דרך מעשית להימנע מהתאמה יתר. אתה לפקח על השגיאה אימות כפי שאתה מוסיף יותר עצים, לעצור אימון כאשר טעות אימות מפסיק לשפר (או מתחיל להגדיל) זה אנלוגי להגביל את מספר ההאקרים ברשתות עצביות.מספר העצים האופטימלי מגיע רק לפני התאמה יתר של הספרות מתחיל מוקדם לעצור עם סבלנות כי כמה פרמטרים לפני כמה פעמים לפני הפסקות עגולות.

זרימת עבודה מעשית עבור Generalization

זרימת עבודה שיטתית יכולה לעזור לך לבנות מודלים של עץ החלטות אשר באופן כללי לעקוב אחר השלבים האלה:

  1. (FLT:0) קל:0) פשוט:0 (Start פשוט:FLT:1) מאמן עץ החלטות לא מומן כדי לראות ביצועים בסיסיים.
  2. (FLT:0) ליתר דיוק מגבלות: ההרחבה 1 (איור 1) מציבה עומק מקסימלי (למשל, 5), דגימות מינימום פיצול (למשל, 10), ועלות דגימות מינימליות (למשל, 5).
  3. (FLT:0)Perform cross-validation Network Search:BuildFLT:1) השתמש ב- 5 כפול stratified cross-validation כדי לבדוק שילובים של עומק, Min samples split, min samples leaf, ו- pruning פרמטרים. בחר את השילוב עם הציון האימות הגבוה ביותר.
  4. (ב) אם השתמשת בעץ מלא בהתחלה, השתמשת בעומס עלות (עם ריצוף צלב כדי לבחור α) זה לעתים קרובות מניב מודל מעט יותר טוב מאשר לפני אימון לבד.
  5. (FLT:0)רכבי טרי: 1FLT אם אתה צריך ביצועים מקסימליים, לעבור ליער אקראי או Gradient Boosting מודל. Tune-specific hyperparameters (מספר העצים, עומק מקסימלי לעץ, שיעור למידה וכו ').
  6. (FLT:0)Validate על מבחן של ההרחבה: ההרחבה 1:1 לאחר כל הכוונון, להעריך את המודל הסופי על סט מבחן נפרד שלא שימש מעולם במהלך הפיתוח.

במהלך תהליך זה, תמיד לשמור על עין על סחרחורת השחלות.המודל הפשוט ביותר עם טעות אימות הנמוך ביותר הוא בדרך כלל הגנרליצר הטוב ביותר עבור הנתונים הנתונים.

אבחון יתר עם למידה Curves

עקומות למידה הן כלי אבחון מעולה.אימון מזימה ואימות (או cross-validation) ציוני נגד מספר דגימות הכשרה.בתסריט מתאים, עקומת האימונים נשארת גבוהה בעוד עקומת אימות היא נמוכה משמעותית, הפער אינו מתכווץ כמו דגימות נוספות מתווספים.אם הפער נשאר גדול מדי, זה מצביע על כך שהמודל מורכב מדי וזקוק לסדירזציה חזקה יותר או יותר, אך במעט יותר דיוק נמוך, אך הוא מרמז על כך פשוט יחסית.

עקומות למידה יכולות גם להנחות החלטות לגבי איסוף נתונים.אם הוספת דגימות אימון מופחתת משמעותית את הפער בין אימונים וציוני אימות, ולאחר מכן איסוף נתונים נוספים עשוי להיות הפתרון הטוב ביותר להתאמה.

דוגמה אמיתית לעולם: חיזוי הלוואות

כדי להמחיש, לשקול בעיה סיווג שבו בנק רוצה לחזות אם מבקש הלוואה כברירת מחדל.הנתונים יש 10,000 דוגמאות ו 50 תכונות (הכנסה, ציון אשראי, יחס חוב הכנסה, וכו ') עץ החלטה לא מומן משיג דיוק הכשרה 99.8%, אבל רק 78% על סט מבחן שנערך ללא מבחנים. העץ יש עומק 35 ועולים רבים עם פחות מ 10 דגימות.

יישום האסטרטגיות:

  • הגדרת מקסימום עמיקה ל-8 - דיוק אימות קופץ ל-85%.
  • הגדרת מינוס samples split עד 20 - דיוק אימות משתפר ל-87%.
  • החל עלות-מורכבות של ריצה עם validation; בחר α=0.002 מניב עומק 10 ודיוק אימות 88%.
  • לבסוף, יער אקראי עם 200 עצים (מקס עמיק=12) משיג דיוק מבחן 91%, מה שמוציא את העץ הבודד.

התקדמות זו מראה כיצד מגבלות מכוונים הופכות למודל מתאים לחיזוי אמין.

משאבים חיצוניים וקריאה נוספת

למי שרוצה לצלול עמוק יותר, הנה משאבים סמכותיים:

  • (ב) ,0) ,995t-learnance Tree Documentation of Law Reduction 1 (בתרגום חופשי:2)
  • (ב) ⁇ :0 (ויקיפדיה: מעל ל"מ"ד) - מספק נקודת מבט סטטיסטית רחבה.
  • (ב) ⁇ :0) ,(ב) , ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
  • (ב) ,0) למד קרוס-אל-לימוד (Cal-learnation Guidedation GuideFLT) 1:1 - למד כיצד להשתמש בצלב-validation עבור בחירת מודל כראוי.
  • (ב) [המכונה:] ⁇ ⁇ : [ה], [ה], [ה], [ה], [ה], [ה], [ה], [ה]]], [התורה], [התורה], [התחילה], [התחילה] [ה] [ה] [התת], [ה]] [התת]] [ה]] [ה] [ה] [ה]]]] [התתתתתתתתתתתת], [ה[ה[ה], [ה], [ה], [ה], [ה], [ה], [ה]]], [ה],], [התחילה]], [ה], [הת], [ה], [ה], [ה], [ה], [ה], [ה], [ה], [ה],],],], [ה], [ה], [ה], [ה],]]]]], [ה], [ה]]], [ה]

מסקנה

Overfitting הוא סיכון חד-משמעי בעת שימוש בעצי החלטות, אבל זה יכול להיות מטופלים באופן שיטתי באמצעות שילוב של טרום-ריצה, לאחר אימון, בחירה תכונה, ו hyperparameter קפדני באמצעות ריצוף חוצה-הכללה. עבור הכללה חזקה יותר, שיטות הרכב כמו יערות אקראיים וגרדנט Boosting לספק אמצעי הגנה חזקים יותר על ידי שילוב של ce של עצים בודדים על ידי הבנה של מודל אמיתי וחיזוי מדויק של נתונים, אשר יכול לספק חיזוי ברור על ידי התחלה ללא מורכבות.