Table of Contents
עצי ההחלטות נשארים אחד האלגוריתמים המפרשים ביותר של למידת מכונה, העדיפו את יכולתם לעצב גבולות החלטה מורכבים תוך מתן הסברים ברורים, מבוססים על הכלל.למרות הערעור שלהם, עץ החלטות אשר לומד כל קצבה של נתוני האימון לעתים קרובות מדי לא מצליח להכללת תשואות חדשות, בלתי נראות יותר, תופעה זו - ראוי - הוא האתגר העיקרי כאשר עובד עם מודלים המבוססים על עץ הוא חיוני יותר מאשר שיטות ניקוי דיוק, לעתים קרובות יותר, אשר מנבאת את המורכבות של דיוק.
מדריך זה מספק הליכה מפורטת של עץ ההחלטה, מן התיאוריה הבסיסית ועד שלבים יישום מעשי.אם אתה בונה עץ מאפס או כוונון מודל בספריה כמו scikit-learning, הבנה מתי וכיצד ל-prune הוא קריטי להשגת ביצועים אמינים.We יכסה את שני pre-pruning ופוסט-pruning, עמוק לתוך עלות גבוהה ptraity pruning (השיטות הנפוצות ביותר), כדי למנוע הערכה טובה ביותר, כדי למנוע את הטוב ביותר, כדי למנוע את המלכודת של שביתה טובה ביותר, כדי למנוע את הפחתת ביצועים טובים ביותר, ואסטרטגיות הנכונות, כדי למנוע את זה יהיה מסוגלות, כדי למנוע את הפחתת ביצועים טובים יותר, כדי למנוע את זה יהיה מסוגלות, כדי למנוע את הפחתת ביצועים טובים יותר, כדי למנוע את זה מכבר, ופוסט-פענוח, ופוסט-פענוח, כדי למנוע את זה יהיה קשה, לחץ על ידי שימוש באופן נרחב, כדי למנוע את זה יכול להיות מסוגל לעשות זאת, כדי למנוע את זה יכול להיות מסוגל לעשות זאת, כדי למנוע את זה יכול להיות מסוגל לעשות שימוש נרחב, כדי למנוע את זה יכול להיות מסוגל לעשות זאת, כדי למנוע את זה יכול להיות מסוגל לעשות זאת, כדי למנוע את זה יכול להיות מסוגל לעשות זאת באופן נרחב, כדי למנוע את זה מכבר
הבנת עץ ההחלטה
יזום הוא תהליך של צמצום גודל עץ ההחלטות על ידי חיתוך סניפים בעלי כוח חיזוי נמוך.המטרה היא לפשט את העץ כך שהוא לוכד רק את הדפוסים החשובים ביותר בנתונים, ובכך לשפר את יכולתו להכלל.ללא ריצוף, עץ שגדל לעומק המקסימלי שלו - שבו כל עלה מכיל דוגמא אימונים אחת או כאשר לא פיצול נוסף אפשרי - הוא מושלם ייצוג של עץ רעוע, אך הוא בעל אותות משקף גבוה, עם צליל גבוה, או משקף, עם צליל גבוה, או משקף, עם סימן כזה, או משקף, עם ביצועים מתקדמים, או משקף, או משקף, עם ביצועים גבוהים, עם ביצועים גבוהים, עם ציון גבוה, עם ציון גבוה, עם הדבקה, או משקף, עם צליל גבוה, או משקף, עם סימן, עם ביצועים גבוהים, עם ביצועים גבוהים, או משקף, עם סימן גבוה, עם השפעה גבוהה, עם ביצועים מתקדמים, עם ביצועים גבוהים, עם ביצועים גבוהים, עם ביצועים גבוהים, עם ביצועים גבוהים, עם ביצועים גבוהים, עם ביצועים גבוהים, עם הדבקה, עם הדבקה, עם הדבקה, עם הדבקה, או משקף, עם ביצועים גבוהים יותר, או משקף, עם ביצועים גבוהים יותר, עם ביצועים גבוהים, עם ביצועים גבוהים, עם ביצועים גבוהים יותר, אם זה, אם
הפעלת קרבות החלים על ידי הגדלת הטיות במכוון (כיוון מודל פשוט יותר עשוי להחמיץ כמה דפוסים עדינים) תוך ירידה בשחלות.החוק האופטימלי משיג את הטעות ההכללה הנמוכה ביותר האפשרית על ידי המסחר בשני מקורות שגיאה אלה.זה סחר חליפין הטיות-חלורציה הוא מרכזי לכל הלמידה של המכונה, ו pruning הוא אחת הדרכים הישירות ביותר לנהל אותו במודלים המבוססים על עץ.
למה דווקא מחיר העודף?
עץ החלטות לא מנוסח יכול לגדול עמוק מאוד, יצירת מאות פיצולים על נתונים אפילו בינוניים בגודל בינוני.כל פיצול מגביר את המורכבות של המודל על ידי חלוקת המרחב המאפיין לאזורים קטנים יותר. בעוד זה מאפשר לעץ להתאים את נתוני האימון כמעט באופן כמעט מושלם, זה גם הופך את המודל רגיש מאוד לתנודות קטנות בנתונים. סימפטום קלאסי של התאמה הוא כי הדיוק של העץ על אימון הוא הרבה יותר מאשר פיזור מקרים של תקפים על ידי תקפים.
גם אי-הסתברות סובלת מעצים גדולים יותר.עץ עם רמות רבות וענפים הופך קשה לדמיין, להסביר, או להצדיק בעלי העניין. Prun מייצרת עץ קומפקטי יותר אשר שומר על לוגיקה ההחלטה החיונית תוך מחיקת ענפים המציעים שיפורים שוליים. עבור יישומים רבים בעולם האמיתי, עץ קטן יותר ומדויק מעט יותר הוא הרבה יותר יקר מאשר עץ ענק שחור-box.
סוגי Pruning: Pre-Pruning vs. Post-Pruning
ישנן שתי אסטרטגיות רחבות לעצי החלטות: לפני אימון (הנקרא גם הפסקת מוקדם) ולאחר אימון (נקרא גם קיצוץ או חיתוך אחורי) הבנת ההבדלים שלהם היא המפתח לבחירת הגישה הנכונה לבעיה שלך.
- (FLT:0) קדם-פריון (Pre-pruning) 1:1: העץ מונע מלהגדל מעבר לנקודה מסוימת במהלך אימון.קריטריונים למניעת עצירה משותפת כוללים עומק מקסימלי, מספר מינימלי של דגימות הנדרש כדי לחלק צומת פנימי, מספר מינימלי של דגימות עלה, או מינימום של ירידה בפזורה.
- (ה-FLT:0) לאחר מכן, עץ גדל לראשונה לגודלו המלא (עד שכל העלים טהורים או בלתי אפשריים לפיצול בהמשך), ענפים שאינם משפרים את הכללה מתרחקים. Post-pruning הוא יקר יותר חישובי (כיוון שהעץ המלא בנוי ראשון) אך נוטים לייצר תוצאות טובות יותר, משום שהחלטות החיתוך מתקבלות עם היתרון של ראיית פסטורלציה מופחתת, וצמצום כל השיטות הפשטות, הן מורכבות, אך נוטה לייצר תוצאות טובות יותר.
בפועל, לאחר אימון (במיוחד עלות-מורכבות pruning) היא הטכניקה הפופולרית יותר כי זה פחות רגיש לסף עצירה שרירותית ולעתים קרובות מניבה סחרחורת הטיה טובה יותר - ספריות רבות ליישם לאחר אימון על ידי כך לאפשר לך ל tune פרמטר מורכבות השולטת כיצד סניפי אגרסיביות חותכות.
The Mechanics of Post-Pruning: A Step-by-Step Guide
לאחר אימון כרוך בתהליך שיטתי של גידול עץ מלא, הערכת הביצועים שלו, ולאחר מכן הסרת ענפים באופןסלקטיבי.צעדים הבאים מתווה את ההליך המשמש ברוב אלגוריתמים לאחר אימון, עם דגש מיוחד על על על על עלות מורכבות pruning. אנו נניח שיש לך סט נתונים מודבק מחולק לאימון ואימות (או באמצעות cross-validation).
שלב 1: גדל עץ החלטות מפותח
הצעד הראשון הוא להכשיר עץ החלטה על נתוני האימון ללא מגבלות על עומק או עלות גודל.אפשר לעץ לגדול עד שכל עלה טהור (או טהור ככל האפשר) או עד שפיצול נוסף לא יוכל להפחית את מדד ההנעה (כגון אימפולסי או אנטרופיה) עץ "מקסימלי" זה יהיה הרבה עליות פנימיות ועוזבים.זה כמעט ללא ספק על פני המידע המתאים, אך מקובל על זה צעד נכון.
במהלך הצמיחה, כל פיצול נבחר למזער את הכדאיות.עבור סיווג, אמצעי נחיתות נפוצים הם גסות גויני ו entropy; עבור רגרסיה, הפחתה של השחלות היא אופיינית. העץ ממשיך לפצל מחדש באופן רציונאלי עד שהוא פוגש אחד תנאי העצירה (אין שיפור באסון, כל הדגימות בצומת שייכות לאותו המעמד, או לאד מכיל פחות מדגימות מינימליות אם ננקט כאן).
שלב 2: להעריך את הביצועים של העץ המלא
ברגע שהעץ בנוי, להעריך את הביצועים שלו על סט אימות (או באמצעות ריצוף) מדדי שיא כגון דיוק (לסיווג), פירוש טעות מרובע (לחזרה), ומספר הצמתים או העלים. קו הבסיס הזה יהיה השווה נגד גרסאות מוכות.החוק צריך להיות נפרד מהנתונים האימונים - אף פעם לא ליזום החלטות על אימון, כמו זה יוביל להמשך.
כמו כן, מומלץ לבחון את מבנה העץ: לעצים גדולים יש לעתים קרובות סניפים רבים הנתמכות רק על ידי קומץ דוגמאות הכשרה.ענפים אלה הם מועמדים ראשוניים עבור ריצה כי הם צפויים לתפוס רעש.לדמיין את העץ (אפילו כייצוג טקסט) יכול לעזור לזהות ענפים חלשים כאלה.
שלב 3: רוץ העץ באמצעות עלויות-מורכבות
עלות-מורכבות יזום (הידועה גם כ-חלש ביותר לקישור) היא שיטת הדואר הסטנדרטית המשמשת בספריות כגון scikit-learning ו- R's rpart.It פועלת על ידי הצגת עונש על מורכבות עץ.עבור עץ נתון T, מגדירה את העלות-complexity Measure RFLT:0αFLT:1(T) = R(T) = R(T))) {\displaystyle R(T)})} t.
תהליך החיתוך מתחיל עם העץ המלא (α=0), הוא מזהה את "הקישור המפחיד ביותר" - הצומת הפנימי שהסירתו מניבה את העלייה הקטנה ביותר ב-R(T) לעלים.הצומת הזה ננקט (הופנה מהדף α), והעץ החדש מתועדו.
כדי לבחור את α הטוב ביותר (ולכן המשנה הטובה ביותר), הסגידה חוצה היא חיונית.אותה נתיב יזום נוצר על נתוני האימון, אבל אז כל אחד מהמועמדים תת-קרקעי מוערכ על סט אימות. α אשר מניב את השגיאה האימות הנמוכה ביותר הוא נבחר, והעץ המתאים הוא הופך למודל הסופי.
דוגמה מעשית
ב[[1924]], [[1924]], [[1924]]]], [[1924]]]], [[1924]]]]]], [[1924]]]]]], [[1924]]]]]]]]]], [[1924]]]]]]]], [[1924]]]]]]]]]]]]]]]], [[1924]]]]]]]]]]]]]], [[1924]]]]]]]]]]]], [[1924]]]]]]]]]]]]]]]]]], [[1924]]]], [[1924]]]]]]]]]]]]]], [[1924]]]]]]]]]]]]]]]]]], [[1924]], [[1924]]]]]], [[1924]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]
שלב 4: תקנו את העץ
לאחר בחירת α אופטימלי, להכשיר את העץ הסופי על סט הכשרה מלאה (או רכבת משולבת +val אם השתמשת בחלוקה אימות יחיד) באמצעות α. ולאחר מכן להעריך את הביצועים שלה על סט מבחן נפרד שמעולם לא שימש לקבלת החלטות החלול.זה הערכה סופית נותן לך הערכה לא מוטה של כמה טוב העץ המורגל יהיה כללי בייצור.
ראוי לציין כי תקרת צלב יכולה לשמש גם בתוך תהליך הניקוי: עבור כל מועמד α, לבצע ריצוף כפול על נתוני האימון ולממוצע את טעות אימות. גישה זו מפחיתה את השחלות של הערכת השגיאה ולעתים קרובות מובילה לבחירות נוקשות יותר.
עלויות מורכבות Pruning בפירוט
בגלל שריצה עלות-מורכבות היא השיטה הדומיננטית שלאחר אימון, ראוי לה מבט מקרוב. האלגנטיות של האלגוריתם טמונה ביכולתו לייצר רצף מלא של עצים מזוינים, מהעץ המקסימלי ועד לצומת שורש יחיד.כל עץ ברצף מתאים ל-α שונה, והרצף מאפשר לך לבדוק את עקומת הסחר של השגיאה מול המורכבות.
(ה) [ה]]] [ה]]] [ה]] [ה]]] [ה]]] [ה]]]] [ה]]] [ה]]]][ה]]]]], [ה[[המאה ה'], ו[ה[[המאה ה-20] לא הייתה] אלא [15].
שיטה זו יש יסודות תיאורטיים חזקים.זה מבטיח כי רצף של תת-כוכבי הוא אופטימלי במובן כי עבור כל α, תת-קרקעי הממזער RIRFLT:0αFLT:1(T) ניתן למצוא על ידי מעקב אחר נתיב קידוד חלש זה.In בפועל, מתרגלים לעתים קרובות מבססים טעות נגד log(α) כדי לזהות את האזור שבו ייצובs.
בחירת אלפא עם Cross-Validation
דרך חזקה לבחור α היא להשתמש בהגדרה חוצה נתונים של אימון.עבור כל קפל, למקם את העץ המלא ואת הנתיב המתפתל שלו, ולאחר מכן להעריך כל תת-עץ על ה-Fol-out ה-CT.ממוצע שגיאות אימות על פני קפפלים לכל ערך α, ולאחר מכן לבחור את α כי מצמצם את השגיאה הממוצעת. A משותף הוא לבחור את הגדול ביותר בתוך אחד השגיאה הרגילה של תקן זה (SE) במיוחד על פני השגיאה פשוטה יותר מאשר את ה-זמנית (כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כדוגמה פשוטה יותר, כלומר, כלומר, כלומר, כלומר, כלומר, כדוגמה פשוטה יותר קל יותר יעיל יותר, כאשר הוא יעיל יותר, על ידי הגנה על ידי תקן אחד, על ידי תקן אחד).
לאחר בחירת α, לגלגל את העץ על כל האימונים שנקבעו עם זה (FLT:4 עץ התוצאה יהיה הדגם הסופי, מחוספס.ההליך זה ייושם בספריות למידה סטטיסטית רבות; לדוגמה, ⁇ :0 an Introduction to StatationFLT:1 מספק טיפול מעולה של עלות מורכבות מתפתלת עם דוגמאות ב R.
« « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « «
הערכת עץ מחוספסת מעבר רק לבדוק את הדיוק שלו על סט הבדיקה.עליכם גם להעריך את יציבותו, הפרשנות שלה וביצועים על פני תת-תחומי נתונים שונים.הדברים הבאים הם שיטות הערכה מומלצות:
- (ב) [ה]התערות נגד עץ מלא: דוח הן העץ המלא והן ביצועי העץ המנוצלים על ערכת הניסוי.עץ המנוצל צריך להראות פער קטן יותר בין אימון לבין דיוק מבחן (למציין ירידה במגיפה) אם העץ המנוצל מבצע גרוע יותר מהעץ המלא על הסט, ייתכן שהעץ המנוצל היה אגרסיבי מדי.
- (FLT:0) עקומות למידה של למידה (Use Learning מעוקלות) 1: אימון פשטות וטעייה אימות כתפקוד בגודל עץ או α. פער רחב בין שני המשטחים על פני התאמה; ריצה צריכה לסגור את הפער הזה.
- (ב) ,0) מערכי ערך מורכבים ישירות FLT:1: לספור את מספר העלים ואת העומק של העץ הסופי.עץ מחוספס היטב עשוי להיות, למשל, 20 עלים במקום 200, מה שהופך אותו הרבה יותר קל להסביר.
- (FLT:0)Validate על מספר רב של פיצולים אקראיים: משום שהחלטות יזום מושפעות מפיצולי הכשרה / אימות, נסה מספר רב של פיצולים אקראיים או חזרות על הצלב.אם α אופטימלי משתנה באופן נרחב, הנתונים עשויים להיות רועשים מדי, ואתה צריך לשקול גישות דוגמנות אחרות.
עקבו אחרי The Pruned Tree
אחד היתרונות הגדולים ביותר של עצי ההחלטות המנוצלים הוא הפרשיות.לאחר ריצה, העץ מכיל רק פיצולים אשר מפוצצים על ידי מספיק נתונים כדי להיות בעל משמעות סטטיסטית.ניתן לעקוב אחר כל חיזוי משורש לעל כמערך פשוט של אם-אז כללים.שקיפות זו אינה ראויה לחקיקה בתעשיות (בריאות, מימון) שבו החלטות מודל חייב להיות ביקורתי.
שיטות יעילות עבור יעילות
כדי למקסם את היתרונות של יזום, בצע את ההנחיות מבוססות ראיות אלה:
- (FLT:0) תמיד להשתמש במערכת אימות נפרדת או צלב-סולמנטציה 1:1 כאשר אימון אף פעם לא להשתמש בביצועים שנקבעו כדי להחליט כמה כדי לתקן; זה יוביל להטיה אופטימית.
- (FLT:0) Experiment with Both pre-pruning and post-pruning: (בעוד שלאחר אימון הוא בדרך כלל עליון, שילוב של גבול טרום-ריצה עדין (למשל, דגימות מינימום עלות של 5-10 עם לאחר ביצוע שלאחר אימון יכול להפחית את זמן האימון ללא להקריב איכות.
- (FLT:0) מורכבות ודיוקן דיוקים (FLT:1) המטרה אינה להשיג את הדיוק הגבוה ביותר האפשרי על מערכת האימונים, אלא למזער את השגיאה הכללה. השתמש בעובי אימות כדי למצוא את הנקודה שבה מוסיפים יותר צמתים מניבים החזרות מופחתות.
- (ב) [ב]"ה', [ב]"ה' [ב[[המאה ה-20]], [[1924]], [[1924]]]], [[1924]]]]]]]]]], [[1924]]]]]]]], [[1924]]]]]]]]]]]], [[1924]]]]]]]]]]]], [[1924]]]]]]]]]]]]]]]]]], [[1924]]]]]]]]]]]]]]]]]]]], [[1924]]]], [[1924]]]]]]]]]]]]]]]], [[1924]]]]]]]]]]]]]]]]]]]]]], [[1924]]]]]]]]]], [[1924]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]
- (FLT:0) ידע התחום כאשר זמיןFLT:1rea אם תכונות מסוימות ידועות להיות לא רלוונטי או לא אמין, אתה יכול להוציא אותם באופן ידני מהמועמדים המפוזרים.
- (FLT:0) ביצוע האסטרטגיה המריצה של ההרחבה:1 במערכות ייצור, להקליט את α שנבחר, מספר העלים, ואת תוצאות ההגשמה. תיעוד זה עוזר עם מעקב מודלים ושיקום מחזורים.
מלכודות נפוצות בעץ ההחלטות
אפילו מתרגלים מנוסים יכולים ליפול למלכודת כאשר הם ממריצים את המודעות למכשולים אלה יעזור לך להימנע מהם:
- (FLT:0)הפעלת ללא כלול צלב-אלטרף 1: השימוש בהגדרה אחת כדי להנחות את החיתוך יכול להוביל להתאמה של מערכת אימות זה (לעיתים נקרא "הסתירה שנקבעה על פני השטח") צלב-סולדציה מפחיתה את הסיכון הזה על ידי ניצול על פני מספר רב של פיצולים.
- (FLT:0) אבחון נתיב הדחיסות עלות-התערות: קפיצה ישירות ל-α מסוים מבלי לבחון את הנתיב המתפתל כולו עלולה לגרום לך להחמיץ תת-קרקעית טובה יותר, תמיד ליצור את הרצף המלא של אלפאים ולהעריך כל אחד.
- (FLT:0) ביצוע קידוד נתונים קטנים ביותר (איור 1): כאשר נתונים הם נדירים, כל פיצול עשוי להיות לא אמין.חשב באמצעות טרום-ריצה (עץ רדוד) במקום לאחר אימון, או להשתמש במודל חלופי שמטפלים בדגימות קטנות יותר.
- (FLT:0) שימוש באמצעי אי-השוויון הבלתי-מתאיים: גיני ו- entropy בדרך כלל נותנים תוצאות דומות, אך לעצי רגרסציה, הפחתה של השחלות היא סטנדרטית.
- (FLT:0) כדי לרסן לאחר runingtureFLT:1: לאחר בחירת α באמצעות validation, עליך לגלגל את העץ על כל נתוני האימון עם זה α. חלק מהמתרגלים משתמשים בטעות subtree מתקפל צלב אחד, אשר מציג הטיה.
טעות נוספת היא טיפול בריצה כפתרון בגודל אחד לכל.עבור נתונים ללא איזון גבוה או בעיות עם עלויות שונות מאוד של שיבושים, יזום סטנדרטי לא יכול להיות מתאים.במקרים כאלה, התאמת משקולות מעמדיות או שימוש באמצעי נחיתות רגישים עלות לפני יזום יכול להוביל לתוצאות טובות יותר.
מסקנה
ריצה היא טכניקה חיונית לבניית עצי החלטה שמגדילים היטב. על ידי הגדלת עץ מלא ולאחר מכן הסרת סניפים חלשים באמצעות עומס עלות-מורכבות, אתה יכול להשיג מודל שהוא גם מדויק וגם מפרש.תהליך שלב-שלב-על-ידי-שלב - החל באופן מלא, להעריך, לבלוט באמצעות נתיב מורכבות עלות, לאמת את הסגידה, ושיקום - מוכח - מספק עבודה אמינה ביותר עבור משימות הסתגלות ותיקון.
היתרונות של ריצה להרחיב את הדיוק: עצים קטנים יותר מהירים להעריך, קל יותר לפרוס, ואמין יותר בסביבות בעלות גבוהה.יתר על כן, תהליך של יזום כוחות אתה להתעמת עם הטיות-חלורציה ישירות, להעמיק את ההבנה שלך של איך המודל מתנהג.כפי שאתה מקבל ניסיון, אתה לפתח אינטואיציה עבור הרמה הנכונה של יזום, אבל תמיד להסתמך על אימות נתונים כדי לאשר את האפשרויות שלך.
זכור כי ריצה היא לא פעילות חד פעמית.כאשר אתה מעדכן את נתוני האימון שלך או להוסיף תכונות חדשות, מבנה העץ האופטימלי עשוי להשתנות. מעת לעת re-evaluate ו re-prune עצי ההחלטות שלך כדי להבטיח שהם ממשיכים לבצע היטב. בשילוב עם הנדסה נאותה ודימום יתרתפרמטר, יזום יעזור לך להפיק את הערך החיזוי המקסימלי ממודלים המבוססים על עץ ללא יכולת הדבקה.