Table of Contents
מבוא
עצי החלטות הם אבן הפינה של למידת מכונה בפיקוח, המציע מסגרת שקופה עבור הן סיווג והן משימות רגרסיה. על ידי חלוקה מחדש של נתונים המבוססים על ערכים תכונה, הם יוצרים מבנה דמוי זרימה שמחקה באופן הדוק את קבלת ההחלטות האנושית.הפשטות והפרשיות שלהם הפכו אותם לשיטת מעבר לניתוח, אשראי, אבחון רפואי, ותפיסת לקוחות, כמו כל החלטה שנבחרה, להשגת תוצאות מסחר נכונות.
מאמר זה מספק צלילה עמוקה ליתרונות ומגבלות של עצי ההחלטות, חוקר טכניקות כדי להפחית את החולשות שלהם, ומשווה אותם עם שיטות חלופיות.עד הסוף, תהיה לך תמונה ברורה של מתי להשתמש בעץ החלטה, מתי להימנע ממנו, וכיצד לשלב אותו עם כלים אחרים לניתוח נתונים חזקים.
כיצד פועל עץ ההחלטות
ברמה גבוהה, עץ החלטה מחלק את נקודת הנתונים לתוך תת-קרקעית המבוססת על התכונה המודיעית ביותר בכל שלב.האלגוריתם בוחר את התכונה ונקודת הפיצול שמבדילה את משתנה היעד, באמצעות קריטריונים כגון אימפולס Gini, אנטרופיה (רווחת מידע), או הפחתה של השחלות למשימות רגרסציה.כל אחד פנימי מייצג מבחן על ענף, כל תוצאה של מבחן מבחן מבחן, או שינוי מינימלי, לא ניתן לעתים קרובות, עד שלא ניתן לראות, אם לא ניתן לראות אותו שיפור מינימלי, עד שלא ניתן לראות אותו דבר, או לעצור את הערך המדויק, עד שלא ניתן לראות אותו, או לעצור את הדרגה, עד שעדיין לא ניתן לראות, עד שעדיין לא ניתן לראות אותו מחדש, אם הוא בעל ערך קבוע, או לעצור את גודל, או לעצור את הערך המדויק, או לעצור את הערך המדויק, אם הוא קבוע, אם הוא קבוע, אם הוא בעל ערך קבוע, עד שלא ניתן לראות, אם הוא קבוע, עד שלא ניתן לראותו של מספר מסוים, אם הוא קבוע, אם הוא קבוע, אם הוא קבוע, אם הוא קבוע, אם הוא קבוע, אם הוא קבוע, אם הוא קבוע, אם הוא לעתים קרובות, אם הוא קבוע, אם הוא קבוע, אם לא ניתן לראות אותו דבר, או לא ניתן
מכיוון שהמודל הוא למעשה סט של כללים אם-אז-לייטים, קל להסביר לבעלי עניין לא-טכנולוגיים.שקיפות זו היא אחת מהסיבות העיקריות שעצי ההחלטות נותרו פופולריים למרות הזמינות של מודלים שחורים חזקים יותר.
היתרונות של עץ ההחלטות
1.הסברים והסבירות
עץ החלטות יכול להיות ויזואליזציה כמו דיאגרמה פשוטה, מה שהופך אותו לאחד המודלים המפרשים ביותר של למידת מכונה.כל נתיב החלטה ניתן לעקוב מן השורש על עלה, מתן רציונלית ברורה עבור כל חיזוי.זה יקר ערך בתעשיות מוסדרות כגון מימון ובריאות, שבו רואיטורים או חולים דורשים הסברים. לדוגמה, עץ אישור אשראי יכול להראות במפורש כי מועמד היה הכחיש כי הכנסה נמוכה עם חוב הכנסה משולבת עם הכנסה גבוהה.
גם אי-הסתברות מאפשרת לדגום מודל.אם העץ הופך לחיזוי לא נכון, מדעני נתונים יכולים לבדוק את הפיצולים ולזהות בעיות איכות נתונים או אפשרויות תכונה לא מתאימות.
2.לעקוב אחר נתונים נומריים וקטגוריאליים
עצי ההחלטות תומכים הן תכונות מספריות והן קטגוריות מבלי לדרוש טבילה אחת או נורמליזציה.זה מפשט את הצינור המעבד בהשוואה לאלגוריתמים כמו מכונות תמיכה או רשתות עצביות.עבור משתנים קטגוריים עם רמות רבות, העץ יכול לטפל בהם באופן אוטומטי על ידי פיצול על הקטגוריה, אם כי כמה יישומים (למשל, CART) דורשים פיצולים בינאריים.
3.Minimal Data הכנה
בניגוד לאלגוריתמים רבים של למידת מכונה, עצי ההחלטות אינם דורשים דחיסה, ריכוז או טרנספורמציה. ערכים חסרים יכולים לעתים קרובות לטפל באמצעות פיצולים חלופיים או על ידי התעלמות מהמקרים החסרים.חזקות זו לבעיות איכות הנתונים הופכת את עצי ההחלטות צעד ראשון מעשי בניתוח הבירור, במיוחד כאשר אתה מתמודד עם נתונים אמיתיים מבולגן.
יחסים לא-Linear ללא שינוי
עצי ההחלטות יכולים ללכוד אינטראקציות מורכבות ולא לינאריות בין תכונות מבלי לדרוש תנאים פולינומיים או טריקים לינאריים.לדוגמה, עץ יכול בקלות לדגום גבול החלטה שבו התוצאה תלויה על סף במשתנה אחד רק כאשר משתנה אחר נופל בטווח מסוים. גמישות זו היא יתרון גדול על מודלים ליניאריים, אשר נאבקים עם אינטראקציות כאלה אלא אם כן הוא מוקרן במפורש.
בחירת תכונה אוטומטית
בכל פיצול, האלגוריתם מעריך את כל התכונות ובחירת זה שנותן את התכונות הטובות ביותר.תכונות שאינן רלוונטיות ישמשו לעתים רחוקות, ביעילות ביצוע בחירה תכונה מוטבעת.זה מפחית סיכון יתר ומפשט את המודל, במיוחד כאשר מתמודדים עם נתונים עתירי גבוה שבו קיימים קורלציה מעוררת השראה.
6.רובוט ל-Outliers and Irlevant Features
מכיוון שפיצולים מבוססים על סף, ערכים קיצוניים בנתונים האימונים אינם משפיעים באופן לא פרופורציונלי על המודל (כמו שיטות המבוססות על מרחק כגון שכנני k-nearest) באופן דומה, תכונה לא רלוונטית פשוט לא תיבחר לפיצול, אלא אם כן זה קורה לקשור עם המטרה במקרה (במקרה זה יזום עוזר).
הגבלות של עץ ההחלטות
1.התעלל
עצי ההחלטות ידועים לשמצה עבור overfitting כאשר גדל לעומק מלא.עץ ממשיך פיצול עד שכל עלה מכיל מקרה אחד באופן מושלם יזכיר את נתוני האימון אבל לא להכללת דוגמאות בלתי נראות. overfitting מתבטא כעצים עמוקים מאוד עם סניפים רבים המונעים על ידי רעש. לדוגמה, עץ מאומן על סמך נתונים קטנים עם תכונות רבות עשוי להיות פיצול על רעש אקראי, לכידת דפוס שאינו קיים באוכלוסייה.
טכניקות סדירות כגון הגבלת העומק המקסימלי, קביעת מספר מינימלי של דגימות עלה, או ריצוף העץ לאחר הבנייה הם הכרחיים להילחם על פני השטח.
2.הרחבה והאינטואיציה
שינויים קטנים בנתונים האימונים יכולים להוביל למבנים עץ שונים באופן דרמטי.נקודת נתונים אחת שמוסיפה או להסיר יכולה לשנות את פיצול השורש, הפחתת החשיכה לשנות את העץ כולו.חוסר יציבות זו הופכת את עצי ההחלטות האישיים לא אמינים עבור יישומים הדורשים תחזיות עקביות, כגון ניקוד אשראי שבו הפרעות קלות במערכת האימונים לא צריכות לייצר באופן דרסטי כללי אישור שונים.
שיטות קבוצתיות כמו יערות אקראיים ו- ⁇ מגבירות את הכתובת על ידי שילוב של עצים רבים, אך חוסר היציבות שבבסיסו של עץ בודד נותר מגבלה הליבה.
3.Bas כלפי תכונות עם הרבה רמות
בעת בחירת פיצולים, עצי ההחלטות נוטים לתמוך בתכונות קאוליטוריות עם ערכים רבים (למשל, מזהה לקוחות, מיקוד) על תכונות עם ערכים מעטים.זה כי תכונה ברמה גבוהה מציעה יותר הזדמנויות ליצור תת-קרקעיות טהורות, גם אם אלה פיצולים אינם משמעותיים. לדוגמה, פיצול עלות לקוח נותן דאגה טהורה ללקוח, אבל פיצול אינו יכול להיות כללי זה יכול להיות מצמצם את האלגוריתמים כגון Catio, אבל זה עדיין לא יכול להיות אלגוריתמים סטנדרטי.
4.G. Greedy and Sub-Optimal Splitting
אלגוריתם הלמידה העץ הטיפוסי משתמש בגישה חמדנית, העליונה: בכל צומת, הוא בוחר את התפצלה הטובה ביותר מבלי לשקול פיצולים עתידיים.בעוד יעיל חישובי, זה יכול להוביל לעצים תת-אופטימיים. פיצול מעט יותר גרוע עשוי לאפשר הרבה יותר פיצולים מאוחר יותר, אבל האלגוריתם הרודני לא יכול לסגת.
טכניקות כמו צ'אט או גידול עץ ולאחר מכן ריצה יכול לטפל בזה באופן חלקי, אבל אין ערובה לאופטימליות העולמית.
5.ביצועים עניים על נתונים קטנים או גבוהים
על נתונים קטנים, עצי ההחלטות יכולים להיות רגישים מאוד לרעש וליצור מודלים לא יציבים.על נתונים תלת-ממדיים עם תכונות לא רלוונטיות רבות, האלגוריתם עשוי להיאבק כדי למצוא פיצולים משמעותיים, מה שמוביל להתאמה או overfitting. בתרחישים כאלה, ירידה במימד (למשל, PCA) או בחירת תכונה היא לעתים קרובות הכרחי.
קושי בקוצר רוח לקשור מערכות יחסים פשוטות
בעוד עצי ההחלטות מצטיינים באינטראקציות לא לינאריות, הם לא יעילים בדוגמת מערכות יחסים לינאריות פשוטות של תוספת.להפוך את הגבול של החלטה ליניארית, עץ חייב ליצור הרבה פלחי קבועות (צעדים), וכתוצאה מכך עץ עמוק ומורכב שקשה יותר לפרש.עבור בעיות ליניאריות גרידא, נסיגה לוגיסטית או SVM ליניארית יוציאו עץ החלטה עם פחות פרמטרים ובאופן כללי.
כתובת: Pruning and Regularization
יזום הוא הטכניקה העיקרית להפחית את התוספת בעצי ההחלטות.יש שתי גישות עיקריות: טרום אימון (נקרא גם הפסקת מוקדם) ולאחר אימון.
Pre-Pruning
במהלך בניית עץ, האלגוריתם מפסיק פיצול כאשר תנאים מסוימים מתקיימים - כגון עומק מקסימלי, דגימות מינימליות עבור צומת פנימי, או מספר מקסימלי של עלות על עלים, בעוד פשוט, pre-pruning יכול להיות אגרסיבי מדי ומוביל להתאמה.
פוסט-Pruning
העץ גדל לעומק מלא ולאחר מכן סניפים המספקים שיפור סטטיסטי מועט הוסרו.שיטות כוללות עומס עלות (הידוע גם כמשט קישורים חלש ביותר), שבו עונש נוסף לכל עלה, וצמצום הנגחת הטרור, שבו נעשה שימוש בהגדרת אימות כדי להעריך אם הסרת ביצועים מפוצלים משתפרים.
טכניקות סטנדרטיות אחרות כוללות קביעת סף מינימום (רק פיצול אם הרווח עולה על ערך מסוים) ושימוש בפיצולים עבור נתונים חסרים.
השוואה עם מודלים אחרים
מתי לבחור עץ החלטות על אלגוריתמים אחרים?השולחן מתחת לסכמת את הפקעת הסחר:
- (FLT:0vs. Linear Models (הההתקפה הלוגיסטית, קואר SVM): עצי החלטה 1:1 להתמודד עם לא לינאריות ואינטראקציות באופן אוטומטי, אבל מודלים ליניאריים הם יציבים ויעילים יותר כאשר מערכות היחסים הבסיסית הן תוספים ו ליניאריות.עבור נתונים עתיריים גבוהים (למשל, טקסט), מודלים ליניאריים לעתים קרובות החוצה עצים.
- (FLT:0vs. k-Nearest Neighbors (kN): FLT:1 שניהם אינם מדדים וקלים להבנה. kN עובד טוב עם נתונים מתמשכים תלת מימדיים נמוכים אך מפלס במימד גבוה (דיוק של ממדיות) ודורשים סקאלה זהירה של עצי החלטות להתמודד עם סוגי נתונים מעורבים יותר והם ניתנים לפירוש.
- רשתות ניל:0vs. Neural Networks: FLT:1 , רשתות נילי יכולות ללמוד דפוסים מורכבים מאוד אבל דורשות נתונים גדולים, כוונון היפר-פרפרמטר משמעותי, וחוסר פרשנות.
- (FLT:0vs. Random Forests / Gradient Boosting: FLT:1 שיטות אלה ההרכב לשפר באופן דרמטי את הדיוק והיציבות עלות הפירוש. עבור יישומים מעשיים ביותר, עץ החלטה יחיד משמש רק לניתוח בירור או כבסיס; הגרסאות מועדות לייצור.
שיטות להקות: Overcoming Single Tree Weaknesses
כדי להתגבר על חוסר היציבות והתאמה של עץ החלטה יחיד, שיטות הרכב משלבות עצים מרובים.שני הפופולריים ביותר הם:
יערות אקראיים
יער אקראי בונה עצי החלטות רבים על דגימות מפוספסות של הנתונים ואת תת-קרקעיות אקראיות של תכונות.זה ואז ממוצע התחזיות שלהם (לחזרה) או לוקח רוב הצבעה (ל סיווג) זה מפחית את השחלות באופן משמעותי תוך שמירה על הטיה נמוכה, הפקת מודל חזק כי לעתים קרובות מחלחל עץ אחד.ה-המסחר מופחתת - היער הוא למעשה קופסה שחורה.
מכונות Boosting (GBMs)
GBMs לבנות עצים באופן משמעותי, כל עץ חדש מתקן את שגיאות של אלה הקודמים. גישה זו יכולה להשיג דיוק המדינה- of-the-art על נתונים מובנים, אבל דורש כוונון זהיר של שיעור למידה, עומק עץ וסדירזציה.
שיקולים מעשיים לשימוש בעץי ההחלטות
- (FLT:0) גודל הנתונים: ⁇ FLT:1 עבור נתונים עם פחות מכמה מאות דגימות, עצי החלטות נוטים להגדלת יתר על המידה.חשב באמצעות ריצוף או לעבור למודל פשוט יותר (למשל, נסיגה לוגיסטית).
- (FLT:0) סוגי מזון: FLT:1 בעוד העצים מטפלים סוגים מעורבים באופן טבעי, אתה צריך עדיין לנתח את הנתונים. תכונות קאוליאורטוריות ברמה גבוהה (למשל, מיקום גיאוגרפי) צריך להיות pre-grouped או לטפל בזהירות.עבור תכונות בעלות דיוק גבוה, לשקול שימוש בקידוד יעד לפני האכלה לתוך העץ.
- (ב) ניתן להטיה לעצי החלטות של LT:0 (Im מאוזנת:0):1, ניתן להונות את עצי ההחלטות לכיוון שיעור הרוב. השתמש במשקלי מעמד, פיסול מחלחלים, או טכניקות מפריזות כדי להפחית את זה.
- (FLT:0) ערכים ממשימה: 1FLT) כמה יישום (כמו נספח של פיסול למידה) לא יכול להתמודד עם ערכים חסרים ישירות.אתה חייב למנוע אותם או להשתמש אלגוריתמים התומכים נעדרים - כמו C4.5, CatBoost).
- (FLT:0) Hyperparameter Tuning:FreaLT:1 ; היפרפרפרמטרים הקריטיים ביותר הם עומק מקסימלי, Min samples split, Min samples leaf, ו-max features. השתמש בחיפוש רשת או חיפוש אקראי עם validation כדי למצוא את הניתוק הטוב ביותר בין הטיה ו-Silce.
יישומים אמיתיים
עצי החלטה מאירים בתחומים שבהם הפרשנות היא המפתח לבריאות, עץ המבוסס על גיל, לחץ דם ורמות כולסטרול יכול לספק מסלול אבחון ברור עבור רופא.במימון, עצי ניקוד אשראי מועדפים כי הם יכולים להיות ביקורת על ההוגנות ולא מפלים על בסיס תכונות מוגן (הנחה בחירה זהירה). בייצור, עצי החלטה לעזור עם אבחון על ידי ביצוע סדרה של חיישן קריאה.
לדוגמה, יישום נרחב המצוטט הוא FLT:0UCI מחלות לב תחילתה של 1LT, שבו מודל עץ החלטה פשוט יכול לחזות נוכחות של מחלת לב עם דיוק סביר ושקיפות מלאה.
מסקנה
עצי ההחלטות הם כלי יקר ערך בארסנל של אנליסט הנתונים, המציע פירושים לא תואמים, קלות השימוש, ואת היכולת לעצב יחסים לא לינאריים מורכבים ללא עיבוד נרחב.עם זאת, החולשות שלהם - במיוחד מעדנים וחוסר יציבות - כלומר עץ החלטה יחיד הוא רק לעתים נדירות המודל הסופי של צינור מודרני.
כדי להשתמש בעצי החלטות ביעילות: תמיד ליישם את החיתוך או קבוע אחר, לאמת עם validation, לשקול לשלב אותם עם טכניקות הרכב עבור מערכות ייצור. כאשר הפרשיות היא רבת ערך, עץ יחיד מתואם היטב יכול עדיין להיות הבחירה הנכונה - אבל להיות מוכן לקבל פוטנציאל סחר-off דיוק חיזוי.
(ב) לקריאה נוספת, עיין בתיעוד עץ הדעת של עץ לימוד (FLT:2) ובספר הלימוד הקלאסי "FLT:2 The Elements of Proscikit-learn" 3 על ידי Hastie, Tibshirani ו-" פרידמן".