הבנת הגבלת עץ

עצי ההחלטות הם אבן הפינה של למידת מכונה בשל המבנה האינטואיטיבי שלהם וקלות הפרשנות. עץ בודד מחלק את הנתונים על בסיס סף תכונה, יצירת סדרה של כללים אם-אז ניתן לדמיין ולהבין על ידי לא- ⁇ s. עם זאת, פשטות זו מגיעה עם בעיות משמעותיות יותר של נתונים, במקום זאת עץ החלטות בודד רגיש מאוד לריאציות קטנות בנתונים; פיצול ליד השורש שונה יכול לעתים קרובות להוביל דפוסים שונים של עץ חסר יכולת חשיבה.

מה הם שיטות של להקות?

שיטות אנסמבל משלבות כמה מודלים בסיסים - במקרה זה, עצי החלטות - למערכת חיזוי יחיד.עיקרון הליבה הוא כי קבוצה של לומדים חלשים (מודלים המבצעים רק מעט יותר טוב מאשר הזדמנות אקראית) ניתן לשלב בין לומד חזק.גישה זו מנצלת את החוכמה של הקהל: מודלים בודדים עשויים לעשות טעויות, אבל אם שגיאות אלה אינן קשורות, הצבעה או מודלים רבים מעבר להפחתה של שיטות פעולה: ALT2F) הם מספר שיטות פעולה של 2.

Bagging ו-random Forest: Reducing Variance

מכניקה של Bagging

מגרד עובד על ידי אימון עצי החלטות מרובים על תת-תחומים אקראיים שונים של נתוני האימון.אלה תת-קרקעיים נוצרים באמצעות מגפיים - דגימה עם תחליף - כך שכל עץ רואה פרוסה מעט שונה של תחילת הנתונים. כי עצים הם עמוקים (לעתים קרובות גדל ללא יזום), כל עץ בודד יש חיתולים גבוהים ודעה קדומה נמוכה מאוד.

« יער אקראי: גרד עם תכונה

היער אקראי מתפרסמת על ידי הצגת שכבה נוספת של אקראיות.בשקות סטנדרטיות, כל עץ רואה את כל התכונות הזמינות בעת ביצוע פיצול. Random Forest, מצד שני, מגביל כל פיצול למצע אקראי של תכונות.עצים אלה להיות אפילו יותר מגוון - הם לא תמיד יכולים להסתמך על החיזוי החזק ביותר, כך הם לומדים דפוסים חלופיים.

(ב) [15] ,5 ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇

« « הפחתה: הפחתה של ביסאס

איך לשפר את העבודה

בניגוד לשקיקה, אשר מאמן עצים במקביל, מגביר את הבנייה של העצים באופן משמעותי.העץ הראשון מאומן על ההתחלה המלאה.לאחר אימון, האלגוריתם מזהה מקרים לא מסווגים (או שאריות גדולות בתוקפנות) ומגביר את משקלם.העץ הבא מאומנים עם מיקוד במקרים קשים-לכאורה, תוך למידה יעילה מטעויות של תהליך זה ניתן לחזור על מספר קבוע של הטיה (אך) באופן הדרגתי, אם הוא מנסה להפחית את הטיות קצרות מדי).

AdaBoost (התחילה)

AdaBoost היה אחד האלגוריתמים הראשונים של חיזוק מעשי.זה מקצה משקולות לכל מקרה אימון, עדכון אותם לאחר כל עץ.החיזוי הסופי הוא הצבעה הרוב במשקל (או ממוצע משקל) שבו עצים עם שיעורי שגיאה נמוכים יותר מקבלים השפעה גבוהה יותר. AdaBoost רגיש נתונים רועשים ופרטים כי הוא מדגיש באופן קיצוני על נקודות לא מסווגות.

עקבו אחרי Gardient Boosting

Gradient Boosting generalizing להגביר את תפקוד אובדן שונה שרירותית. במקום להתאים משקולות מקרה כמו AdaBoost עושה, ⁇ שיפור מתאים כל עץ חדש ל ⁇ שלילית של תפקוד הפסד ביחס לחיזוי הנוכחי. עבור אובדן שגיאות מרובע, זה שווה ערך אופטימיזציה של Catadt. אלגוריתם מציעה גמישות עצומה - אתה יכול להתאים לתגובת רגרסנס, סיווג, דירוג, ואפילו מטרות מתקדמות, קונסולת עץ.

XGBOST

XGBoost (Extreme Gradient Boosting) הציגה את הסדירזציה (L1 ו-L2) ישירות לתוך הפונקציה האובייקטיבית, יחד עם עמודה תת-מדגימה ואלגוריתם של ספארי-מודע המנצל את הערכים החסרים.תבנית הגישה של cache-aware שלה ו- Out-of-core מחשוב לעשות זאת מהר מאוד. XGB שולט ב-Kogglet במשך שנים בגלל שילוב של דיוק, מהירות, מהירות מקסימלית, ו- gma pemperample)

(ב) ,0) מקורות: 1FLT:2XGBoost Parameters DocumentationFLT 3: מציע מדריך מקיף.

LightGBM

LightGBM משתמש בטכניקת פיצול המבוססת על ה-Gategram שמדלית תכונות מתמשכים לתוך קידודים, להאיץ באופן דרסטי את האימון תוך שמירה על דיוק.הוא מציג את Gradient-Side Sampling (GOSS) להתמקד במקרים עם ⁇ גדולים, ותכונות בלעדיות בלעדיות בונדלינג (EF) כדי להפחית את המימדיום הוא מיועד עבור נתונים בקנה מידה גדול ולעתים קרובות מייצר גידול מתאים במיוחד עבור תכונות גבוהות.

CatBoost

CatBoost (Categorical Boosting) מטפל תכונות קטגוריות עם שימוש בקידוד מטרה הורה, אשר נמנע דליפת היעד.זה בונה עצים סימטריים (צמיחה על-wise) ומשתמש באסטרטגיה המונעת על ידי מוטציות כדי להפחית את הטיה. CatBoost לעתים קרובות משיג ביצועים חזקים מחוץ ל-Cbox עם מינימום, במיוחד על נתונים עם תחליפיים רבים כולל גם הגדרות נוגדות ברירת מחדל.

הצצה אל מול Bagging: מתי להשתמש בכל אחד

שיטות מגרד כמו יער אקראי חזקים רעש וזריקות כי הם ממוצע עמוק, overfit עצים; הם לעתים רחוקות overfit את נתוני האימון מעבר לתקרת הביצועים. Boosting שיטות, במיוחד ⁇ , יכול להשיג הטיה נמוכה יותר ולעתים קרובות דיוק גבוה יותר אבל דורשים סדיר זהיר והפסקת מוקדם כדי למנוע התאמה יתר.עבור נתונים עם תכונות לא רלוונטיות רבות או רעש חזק, שקיות עשוי להיות מועדף עבור נקי, לעתים קרובות יותר, כי הוא צריך דיוק מקסימלי עבור אנשים מתחילים לחץ על ידי אופטימיזציה של נתונים מופעלת בדרך כלל.

קידוד ומיזוג: שילוב מודלים די הפוך

סטלינג (stacked generalization) הולך מעבר לרכיבים עץ על ידי שילוב תחזיות מסוגים שונים של מודלים. a טיפוסי ערימה ערימה של ערימה למידה ההתקנה משתמשת קבוצה של מודלים בסיס (למשל, יער אקראי, XGBoost, תוקפנות לוגיסטית, ורשת עצבית) מאומנים על בסיס אימון מלא נתונים.

טיפים מעשיים לשיפור ביצועים

להבטיח את המגוון בין העצים

שיטות אנסמבל הן רק חזקות כמו מגוון של רכיבים שלהם.אם כל העצים לעשות תחזיות זהות, אין תועלת משלב אותם.גיוון נובע משימוש subsets נתונים שונים (דוגמיות בולים), תכונות שונות, ומעמקי עץ שונים.בזרומים אקראיים, צמצום הגודל של תת-הצורה (מקסימום features) גדל אך גם עשוי להגדיל את הטיה - סחר-המת אתה חייב במהירות להגביר את תהליך החיתוך, אך ורק אם הוא איבד את המאפיין גבוה מדי, אך הוא יכול להגביר את רמת המאפיין גבוה מדי, אך הוא גבוה מדי, אך הוא יכול להגביר את רמת המאפיין גבוה מדי, אך הוא יכול להגביר את רמת המאפיין, אך הוא יכול להגביר את רמת המאפיין גבוה מדי, אך הוא יכול להגביר את רמת המאפיין גבוה מדי, אך הוא יכול להגדיל את רמת השגיאה גבוהה מדי, אם הוא יכול להגדיל את רמת המאפיין גבוה מדי, אך הוא יכול להגביר את רמת המאפיין, אם הוא יכול להגביר את רמת המאפיין גבוה מדי, אך גם עלייה גבוהה מדי, אם הוא יכול להגדיל את רמת המאפיין, אם הוא יכול להגדיל את רמת המאפיין, אם הוא יכול להגדיל את רמת המאפיין, אם הוא יכול להגביר את רמת המאפיין גבוה מדי, אם הוא יכול להגדיל את המאפיין גבוה מדי,

Hyperparameter Tuning

לכל שיטת האנסמבל יש קבוצה משלה של היפרפרמטרים קריטיים.לזרות אקראית, מספר העצים פחות חשוב מהמתחם והמאפיין שבריר.לחיזוק, שיעור הלמידה (שטיפה) ומספר העצים קשורים באופן אינטימי: שיעור למידה קטן יותר דורש לעתים קרובות יותר עצים אך מקטין את הסיכון לדלקת יתר.2 Lol il Lol Lol Lol Lol Lol Lol Lol Lol Lol Lol Lol Lol Lol Llamtol Lol Lol Lol Lol Lol Lol Llamt Llamt Lol Lol Lolf Lol Lol Lol Lolp Lol Lol Lol Lol Lol Lol Lol Lol Lol Lol Lol-Lol Lol Lol Lol Llaming סיכונים.com Lol-Lol-Lilfitting Overfitting Overfitting Overfitting בסיכון.com Lolf Lol-Lamcuptp L

Cross-Validation and Assessment

לעולם אל תעריכו את האנסמבל על אותו נתונים המשמשים להכשיר אותו. השתמש ב- k-fold cross-validation (k=5 או 10) כדי להעריך את הביצועים של ה-Smple. בהגדלת, לשלב עצירה מוקדמת על ידי ניטור מדד אימות במהלך אימון - להפסיק להוסיף עצים כאשר המדד אינו מצליח לשפר עבור מספר מוגדר של סיבובים.

הנדסה ובחירת

שיטות אנסמבל חזקות לתכונות לא רלוונטיות, אבל הסרת עמודות גבוהות עדיין יכול לשפר את הביצועים ולהקטין את זמן האימון. השתמש בציוןים חשובים מאבן אקראית ראשונית או ⁇ שיפור מודל לסינון תכונות.חשב יצירת תכונות אינטראקציה, תכונות בינאריות, או שינויים ספציפיים דומיין כי העצים עשויים אחרת להחמיץ.

שגרה והפסקת מוקדם

Boosting הוא נוטה overfitting עם יותר מדי חומרים או עצים מורכבים מדי.שימוש כווץ (לימוד קצב <0.1), להגביל עומק עץ (3-6 עבור רוב הבעיות), ולהגדיר מספר מינימלי של דגימות על עלה. פרמטר gamma של XGBoost דורש ירידה מינימלית עבור כל פיצול, פועל כמו קבוע.

מחיר פיצוי

אקראית יערות רכבות בקלות במקביל כי העצים הם עצמאיים - להשתמש בכל ליבות זמין. Boosting הוא בעל ערך מטבעו, אבל יישומים כמו LightGBM ו XGBoost מציעים הכשרה מבוזרת ו- GPU-accelerated הכשרה כדי להפחית את זה.אם זמן אימון הוא קריטי, להתחיל עם אלגוריתם מהיר יותר של LightGBM של שלו-upability. אם הפרשות היא חשובה יותר, ואתה צריך מודל לבן לחלוטין, רק 10 קפסולת טובה, אבל עדיין יכול לספק רק 10.

שיקולים אמיתיים ומסחר

שיטות אנסמבל לשפר באופן דרמטי את הדיוק אבל לבוא עלות של הפרשיות. עץ החלטה יחיד יכול להיות ויזואלי והוסבר לבעלי העניין; יער אקראי של מאות עצים לא יכול.עבור תעשיות מוסדרות שבו המודל להסביריות הוא חובה (למשל, ניקוד אשראי, בריאות), ייתכן שיהיה צורך ללכוד מודלים חלופיים או להגביל את גודל האנסמבל.

לבסוף, האנסמבלים הם יותר רגישים לזיכרון איטי יותר לשרת בייצור כי כל עץ חייב להעריך את קלט.טכניקות כמו ריצוף מודל (העברת עצי זיכרון נמוכים), באמצעות עצים קטנים יותר, או להמיר את ההרכב לעץ החלטה יחיד באמצעות השקיה יכול לעזור.עבור באינטרנט עם דרישות שקיפות קפדניות, מודל חד-פעמי היטב עם מספר מתון של עצים במהירות גבוהה יותר בין הפחתת דיוק לעתים קרובות).

(ב) [15] ,5 ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇

(ב) [ה]: [ה]] [ה]]: [ה] [ה] [ה]] [ה'] [ה']'[ה']'[ה]']'[ה']'[ה']'[ה']'[ה']'[ה']'[ה']']'''[ה']']'[ה'[ה']']']'[ה'[ה']']'[ה']']'[ה'[ה'[ה'[ה'[ה'[ה']']']'[ה'[ה'[ה'[ה']']']']']']']'[ה'[ה'[ה'[ה']']']']'[ה'[ה']']'[ה'[ה']'[ה']']']'[ה']']'[ה'[ה'[ה'[ה']'[ה']']']'[ה'[ה']'[ה'[ה

מסקנה

שיטות אנסמבל הן הדרך היעילה ביותר לשפר את הדיוק ואת העוצמה של מודלים עץ ההחלטה.על ידי שילוב עצים מרובים באמצעות השקיה, הגדלת או ערימה, אתה יכול להפחית באופן דרמטי שגיאות הנגרמות על ידי overfitting או underfitting. Random Forest מספק חזק, קל לשימוש בסיס כי הוא עמיד על ידי כוח למידה קבוע, לחץ על ידי צריכת משאבים סטנדרטיים של דיוק, כלומר, על ידי דיוק קבוע של אמצעי למידה קפדנית יותר, על ידי דיוק אחד.