Table of Contents
עצי ההחלטות הם אלגוריתם למידה של מכונה המבוססת על מכונות שנשאר בשימוש נרחב הן עבור סיווג והן משימות רגרסיה. הפופולריות שלהם נובעת ממבנה אינטואיטיבי, מבוסס-כלל המשקף תהליכים של קבלת החלטות אנושיות, מה שהופך אותם לאחד המודלים המפרשים ביותר בערכת כלים של מדען נתונים.כל עץ מורכב מנקודות החלטה המבוססות על ערכים, עבור תוצאות, והחזקת תחזיות סופיות בעוד שלעתים קרובות הם יכולים להראות טמפרטורות מורכבות, אך ורק כאשר הם לא-מידה, אך ורק על-מידה, כאשר הם יכולים להשפיע על תכונות מורכבות, אך ורק על נתונים, אך ורק על תכונות, אך ורקמות, במיוחד, כאשר הם יכולים להשפיע על תכונות מורכבות, כאשר הם יכולים להשפיע על תכונות מורכבות, כאשר הם יכולים להשפיע על תכונות מורכבות, כאשר הם, כאשר הם יכולים להשפיע על תכונות מורכבות, אך ורק על נקודות השפעה, אם הם יכולים להשפיע על עקרונות, אך ורק על תכונות מורכבות, כאשר הם, כאשר הם, אך ורקמות, אך ורק על עקרונות, אך ורק על בסיס ערכים, כאשר הם יכולים להשפיע על בסיס תכונות מורכבות, כאשר הם יכולים להשפיע על תכונות מורכבות, כאשר הם, כאשר הם, כאשר הם יכולים להשפיע על בסיס תכונות מורכבות, כאשר הם יכולים לעתים קרובות, כאשר הם יכולים להשפיע על בסיס תכונות מורכבות, אם הם, כאשר הם
מה הם עצי ההחלטות?
עץ קבלת ההחלטות מפצה את המרחב המאפיין לאזורים, כל אחד מהם הציב חיזוי – לתוקפנות, ערך היעד הממוצע באזור זה, ולסיווג, את המעמד הרוב.תהליך הפיצול בוחר תכונות ונקודות סף הממזערים את מדד האימפולסיבי, כגון אימפולסיביות או דחייה לסיווג, או טעות גדולה ביותר לתוקפנות בכל תוקף, להעריך את כל האלגוריתם האפשרי, כך שמנוגד להפחתה אפשרית, ללא שינוי מוקדם יותר.
[ה]העיקרון העיקרי הוא שעצי ההחלטות אינם תלויים במדדים מרחקים גיאומטריים בין נקודות נתונים, אלא הם משתמשים בהשוואות המבוססות על הסף: עבור תכונה מסוימת:0XIRFLT:1jig:2reaFLT 3:2reaFLT 3:2, העץ שואל אם אלגוריתם LT:4XFLT:5jFLT 6 ⁇ ⁇ ⁇ ⁇ ⁇ FRE ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
שיטות איסוף נתונים נפוצות
דרוג נתונים, או קנה מידה, משנה את הערכים של תכונות נומריות למגוון משותף או הפצה.שני השיטות הנפוצות ביותר הן:
- (ב) [17] (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (ב) ⁇ (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (FLT:0)Robust ScalingFLT:1 - משתמש בטווח החציוני והInterquartile (IQR) במקום סטייה סטנדרטית, מתן עמידות נגד קיצוניות שיכולים לעוות את הפרמטרים המקיפים.
בעוד טכניקות אלה קריטיות לאלגוריתמים כמו מכונות וקטור תמיכה (SVMs) ושכנים k-nearest (k-N), אשר מרחקים חד-פעמיים בין דגימות, תפקידם בביצוע עץ ההחלטות הוא יותר מנוקד.
רגישות תיאורטית לדרגה
מנקודת מבט אלגוריתמית טהורה, עצי ההחלטות מציגים את ההיקף של השחלות, כי תהליך הפיצול קובע החלטות רק על סדר ערכי תכונה, לא את גודלם המוחלט.כאשר עץ מחפש את הנקודה המפולגת הטובה ביותר:0 (0) מחושב סף מספר 1 לאורך כל התכונות של ההרחבה:2XFLT 3: 3, הוא מעריך מועמדים שהם האמצעי בין ערכים מסולקים באופן קבוע, אם אנו מתרבים את ההפחתה של מדרגה כפולה של שינוי קבוע;
ההיגיון התיאורטי הזה מחזיק בהנחה שהאלגוריתם המתפצל משתמש בהשוואות מדויקות וכי דיוק צף אינו מציג חפצים. בפועל, יישום מודרני - כגון אלגוריתם של למידה-לימוד:0 ו-FLT:1 - הם דטרמיניסטים ומייצרים עצים זהים ללא קשר לשיפוץ ליניארי, בתנאי שהדחיפה אינה גורמת לבעיות מספריות.
היכן שסקר יכול להשפיע על ביצועי
למרות חוסר רגישות תיאורטית, מספר תרחישים מעשיים חושפים כי קנה מידה יכול להשפיע על תוצאות עץ ההחלטות, במיוחד כאשר המרחב המאפיין הוא גבוה ממדים, הנתונים אינם מאוזנים, או כאשר העצים משמשים כמרכיבים במערכות מורכבות יותר.
נתונים גבוהים
ככל שמספר התכונות גדל, העץ ניצב בפני מאגר גדול יותר של פיצולים.תכונות עם טווחים מספריים גדולים יותר יכול לשלוט באופן בלתי נמנע בתהליך הבחירה המפוצל, כי סף פיצול שלהם ברצף רחב יותר, שעלול להוביל לירידה משמעותית יותר במקרים של קריטריונים שונים (למשל, ירידה של תכונות שונות) עם שני תכונות: טווח תכונות תכונות תכונות תכונות של 0 עד 1, ותכונות B מ 0 ל- 1000 עד כה, אך לא ניתן להעריך את התכונות של מספר זה.
יתר על כן, בחללים גבוהים, העץ נוטה להתרווח כי זה יכול לנצל הרבה סף. Scaling לא למנוע ישירות overfitting, אבל על ידי הסרת היתרון מבוסס טווח של תכונות מסוימות, זה יכול להוביל לפיצולים יציבים יותר ובאופן כללי בשילוב עם טכניקות יזום או קבוע.
המונחים: shape Ranges
כאשר תכונות יש יחידות או גודל שונים מאוד, העץ עשוי להקצות חשיבות גבוהה יותר לתכונות עם טווחים גדולים יותר, גם אם תכונות אלה אינן למעשה יותר מפלות.זה בעייתי במיוחד בנתונים המשלבים מדידות פיזיות (למשל, טמפרטורה ב Kelvin לעומת לחץ בפיסקאות) או נתונים פיננסיים (למשל, הכנסות במיליוני לעומת קצב בדלפקציונים), בעוד ש- 90 אלף נקודות תורמות יכולות להיות מושפעות יותר מתכונות גיליות (למשל, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, פחות יעילות יותר מ-out אלגוריתם של אלגוריתם אפשרי) או נתונים סטנדרטיות של טווח של טווח של טווח של טווח של טווח של טווח של פחות מ-72 נקודות קצה (לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, אם טווח של פחות מ-72 נקודות קצה) או נתונים סטטיסטיים של טווח נמוך יותר של טווח נמוך יותר של טווח של טווח נמוך יותר של טווח נמוך יותר של טווח נמוך יותר של טווח של טווח של טווח של טווח של טווח נמוך יותר של פחות גבוה יותר של טווח מוגבל של פחות של טווח של טווח של פחות גבוה יותר של טווח של טווח של פחות גבוה יותר של טווח של טווח של טווח של טווח של אלגוריתם של פחות של פחות גבוה יותר של טווח מוגבל יותר של טווח של
החלת דחיסה של מניין ל [0,1] שווה את הטווח המספרי אך אינה משנה את מספר הערכים הייחודיים לתכונה. עם זאת, היא משנה את ההיקף של פיצולים – לאחר הגדלה, נקודות הסף עבור שני המאפיינים הופכים דומים יותר במונחים של מידת הטווח מכוסה.
שיטות אנסמבל
עצי החלטות לעתים קרובות להשיג את הביצועים הטובים ביותר שלהם כאשר מצטברים לתוך האנסמבלים כגון יערות אקראיים, עץ Gradient Boosted, או XGBoost. בעוד עצים בודדים הם בקנה מידה גדול, אימון יכול להציג תלות על סקאלה באמצעות מנגנונים כגון תת-מפרק, עמודה דגימה, או טיפול של ערכים חסרים.
שיטות שיפור ביצועים (למשל, XGBoost, LightGBM, CatBoost) משלבות תנאים קבועים נוספים ושיעורי למידה שיכולים להיות רגישים לגודל התחזיות והשאריות.למרות שהעץ מתחלק בעצמם נשאר בחלופה, עדכוני הקידוד במהלך אימון תלויים בגודל של שגיאות.
חשיבות וחשיבות הדדית
גם דרוג נתונים משפיע על האופן שבו מתרגלים מפרשים את פלט עץ ההחלטות, במיוחד ציוני חשיבות תכונה.מדד בעל חשיבות רחבה הוא חשיבותו של גיני (או מתכוונים לירידה באימפולסיביות), אשר מסמנת את ההפחתה המסולקת של ההפחתה במשקל שניתן להעלות על הדעת לכל תכונה. כי תכונות גדולות טווח יכולות להיבחר לעתים קרובות יותר, הם עלולים לנפח את ציוניהם באופן מלאכותי, לא משנה את סדר היחסי של ערכים אחידים של גודל זה, אם זה משתנה במידה כזו או לא משנה, אלא אם כן, אם הוא משנה את התכונות במידה רבה יותר, אם הוא משנה את התכונות המדורגוגן, אם הוא בעל חשיבות גבוהה, אם הוא משנה, אם הוא משנה, אם הוא אינו משנה, אם הוא חשוב יותר, אם הוא מסוגל יותר, אם הוא משנה, אם הוא משנה, אם הוא משנה, אם הוא חשוב, אם הוא יכול להיות בעל רמות גבוהות יותר, אם הוא אינו משנה, אם הוא משנה, אם הוא משנה, אם הוא משנה את רמות גבוהות יותר, אם הוא בעל רמות גבוהות יותר, אם הוא יכול להיות בעל רמות גבוהות יותר, אם הוא אינו משנה את רמות גבוהות יותר, אם הוא יכול להיות בעל רמות גבוהות יותר, אם הוא יכול להיות בעל רמות גבוהות יותר, אם הוא יכול להיות מסוגל, אם הוא אינו משנה את
פשטות וסדירזציה
ניתן להזיז עצים החלטות על ידי עלות-מורכבות pruning (ccp alpha in scikit-learning), אשר סחר בעומק עץ נגד העיוות.תהליך החיתוך משתמש במדד האימפולסיבי של תת-עצירים; קנה מידה אינו משנה את האמצעים האלה ישירות, אבל זה יכול להשפיע על אילו תת-עצים נוצרים כאשר יש מגוון שונה.
המלצות מעשיות ודוגמאות
בהתבסס על הדפוסים שנדונו, הנה הנחיות מעשיות למדענים ולמתרגלי למידת מכונות באמצעות עצי החלטות:
- (FLT:0)Start ללא דרוג של תכונות תת-ממדיות, הומוגניות.FreaLT:1; אם יש לך פחות מ 10 תכונות, הכל על קשקשים דומים (למשל, תגובות סקר מ 1–5), קנה המידה הוא מיותר.העץ יבצע באותה מידה, ומדלג אותו חוסך עיבוד מראש.
- (FLT:0) Experiment with scaleing in high-ממדי נתונים.Felo: 1. for datasets with עשרות או מאות תכונות, במיוחד כאשר הם משלבים יחידות כמו גיל, משכורת, מרחק וספירה, ליישם דחיסה מקסימלית או סטנדרטיזציה ולהשוות ציוני cross-validation. A שיפור משמעותי ( ⁇ 1–2% דיוק או שגיאה נמוכה) מצביע על דרוג שעזר בתהליך החיפוש.
- (FLT:0) תמיד קנה מידה כאשר משתמשים בשיטות הרכב עם תכונות רבות.BuildFLT:1, למרות ש-random Forest הוא חזק, קנה מידה יכול לייצב את המגוון העץ והופך את Hyperparameter לרגיש פחות למגוון רחב של תכונות. in XGBoost, הפחתת משתנה המטרה עבור רגרסיה מועילה לעתים קרובות עבור התכנסות.
- (FLT:0Combine מדרגת ברירה או הפחתה של מימדיות.FLT:1 Scaling לפני החלת PCA או אלגוריתמי בחירה תכונה (למשל, בהתבסס על סף השחלות) מבטיח כי תכונות דומות.
- (FLT:0) קנה מידה חזק כאשר בחוץ הם מציגים.FLT (תיקון: 1:1 סטנדרטיזציה הוא רגיש לדירות; קנה מידה חזק (באמצעות Median ו- IQR) מונע כמה נקודות קיצוניות מדחיסת שאר הטווח.זה רלוונטי במיוחד עבור עצי החלטה כי מקהלות יכולים ליצור עלים בודדים שפוגעים בהכללה.
- (FLT:0) בחירה ברמת הכדאיות (FLT) 1 בין אם אתה סולם או לא, להקליט את הצינור preמעבד.אם קשקשים מוחל, להבטיח כי אותם הפרמטרים (min, max, כלומר, std) משמשים בהקצאת הזמן.
לדוגמה, לשקול את הסיכון לסיכון אשראי עם תכונות: גיל (20–70), הכנסה (15k-$2M), מספר התלויים (0–5), ויחס חוב להכנסה (0.0-1.5) ללא דרוג, תכונה ההכנסה שולטת במועמדים המפולגת כי יש לו טווח עצום (2 מיליון לעומת 50 לגיל).
מסקנה
עצי ההחלטות הם רגישים תיאורטית לדרגת תכונות ליניאריות מכיוון שהלוגיקה המפולגת שלהם נשענת על השוואות של ערכים, לא מרחקים.עם זאת, השחלות התיאורטית הזאת אינה מרחיבה באופן חלק לכל היישומים בעולם האמיתי. בחללים תלת-ממדיים, כאשר תכונות יש טווחים שונים מאוד, או כאשר עצים משולבים לתוך האנסמבלים, קנה מידה יכול לשפר את הביצועים המודל על ידי חיסול הטיות בחיפוש מפוצל, קידום החשיבות הטובה יותר, שיפור המשתנים באופן כללי, ולהגדיל את רמות גבוהות יותר, עם רמות גבוהות יותר, עם רמות סטנדרטיות, עם רמות נמוכות יותר, עם רמות סטנדרטיות, עם רמות נמוכות יותר, עם אופציונליות, עם רמות סטנדרטיות, עם רמות סטנדרטיות, עם רמות נמוכות יותר, עם רמות סטנדרטיות, עם רמות נמוכות יותר, עם אופציונליות, עם אופציונליות, עם רמות נמוכות יותר, עם אופציונליות, עם רמות יעילות גבוהה יותר, עם רמות סטנדרטיות, עם רמות נמוכות יותר, עם רמות סטנדרטיות, עם רמות מדידה יעילה יותר, עם רמות סטנדרטיות יותר, עם אופציונליות, עם רמות נמוכות יותר, עם רמות נמוכות יותר, עם רמות נמוכות יותר, עם אופציונליות, עם אופציונליות, עם אופציונליות, עם אופציונליות, עם
(ב) לקריאה נוספת, התייחס לתיעוד הרשמי של FLT:0 scikit-learning על עצי ההחלטות ,(FLT:1) ו-FLT:2preמעבדing PartcioFLT 3 עבור טכניקות מדרגות.ניתן למצוא דיון אקדמי מקיף ב-FLT:4 "יסודות הלמידה הסטטיסטית"FLT:5 על ידי Hastie, Tibsani, וכן, כמו גם על בסיס מחקר זה על בסיס שיטות מחקר על בסיס אקראי של מחקר על בסיס 6Fמעבדים.