Table of Contents
עצי ההחלטות הם מרכיב עיקרי של תהליכי למידת מכונה, המוסמכים למבנה האינטואיטיבי שלהם ופירוש פשוט.הם מעצימים את כל מה שמערכת הסיכון לאבחון רפואי, לעתים קרובות משמשים כאלגוריתם של מדעני נתונים שצריכים להסביר תחזיות לבעלי העניין הלא-טכניים.אבל למרות האינטנסיכות שלהם, עצי ההחלטות אינם חסינים בפני בעיה עדינה אך מתמדת: FLT:0.
במאמר זה, נבחן מה רב-קוליניות היא, מדוע זה חשוב במיוחד עבור עצי החלטות, ומערכת של אסטרטגיות פעולה כדי להפחית את השפעתה.אם אתה מדען נתונים מלמד קורס או מתרגל המסדיר מודל ייצור, טכניקות אלה יעזרו לך לבנות עצי החלטה נקיים, כללי יותר.
מה זה Multicol לינאריות?
ריבוי קולינאריות מתייחס למצב שבו שני או יותר משתנים מנבאים בבעיית רגרסיה או סיווג קשורים ליניארית לדרגה גבוהה.כאשר מתאם בין משתנים הוא חזק, הנתונים הבסיסיים מכילים מידע חפיפה שיכול לבלבל מודלים רבים סטטיסטיים ומכונה למידה מודלים לינאריים, ריבוי קולינאריות מנפח שגיאות סטנדרטיות והופך לא יציב.
ישנם שני סוגים עיקריים של רב-קוליאניות להיות מודע:
- (ב) ,0) ,Perfect multicol לינאריותFLT:1 ; אחד החיזוי הוא שילוב ליניארי של אחרים.זה נדיר בנתונים אמיתיים אלא אם כן תכונה כבר משוכפלת באופן בלתי נמנע.
- (העיקרון) רב-קוליניטי (העילום) של הרב-קוליניטימבייטב 1 (FLT:0) , תחזיות הן חזק, אך לא מושלם, מתואמות.
מדוע חשוב עדיין הרב-קוליני בעץ ההחלטות
עצי ההחלטות הם לא דו-פרמטריים ולעתים מתוארים כחסיניים למולקוליניות, בעוד שזה נכון שעצים אינם דורשים את אותה הנחות עצמאות כמודלים ליניאריים, תכונות מתואמות עדיין מציגות בעיות מעשיות:
- (FLT:0) בחירת הטיית FLT:1 - כאשר שני תכונות מתואמות מאוד זמינים, העץ עשוי לבחור אחד עבור הפיצול הראשון, להתעלם מהשני.זה הופך עצים בודדים לא יציבים; שינויים קטנים בנתונים יכולים לגרום לעץ להפוך את המאפיין שהוא בוחר.
- (ב) ,0) תכונות מחוספסות מספקות הזדמנויות מרובות לעץ כדי לחלק את אותו המידע, להגביר את העומק והמורכבות מבלי לשפר את הכללה.
- (FLT:0) מיוצאת חשיבות חשובה ל- 1FLT:1, ציוני חשיבות מחולקים בין צופים תואמים, מסלקים את התרומה לכאורה של כל אחד מהם, מה שהופך אותו קשה יותר לזהות אילו משתנים באמת מניעים תחזיות.
- (ב) ,0) , התגלות (ב) , עץ שמפוצל על שניהם:0 ו-FLT:1 (אשר כמעט זהה) הוא מבלבל יותר וקשה יותר לבלוט מאשר אחד שנבנה עם תכונות נקיות ועצמאיות.
For these reasons, teaching practitioners to detect and handle multicollinearity before feeding data into a decision tree is a core part of building robust models.
כפלת Multicol לינאריות בנתונים שלך
לפני שתחליט כיצד לתקן ריבוי קולינאריות, עליך לזהות זאת לראשונה. שניים מכלי הגילוי הנפוצים ביותר הם מטריצה קורלטיבית וגורם האינפלציה משתנה (VIF).
באמצעות מטריקס שחיתות
הגישה הפשוטה ביותר היא למקם את מכלול יחסי פירסון בין כל התכונות המספריות.מפת חום של ממטריקס מתאם מגלה במהירות אשכולות של משתנים מתואמות מאוד.כלל משותף של אצבע הוא לדגל עם גלקסיות (FLT:2 לחקירה נוספת, אם כי הסף יכול להיות מותאם על בסיס ידע דומיין.
גורמי האינפלציה
מדד VIF מודד כמה השחלות של מקדם רגרסיה מנופחות בשל ריבוי קולינאריות.עבור כל תכונה, VIF מחושב על ידי נסיגה תכונה זו נגד כל האחרים ושימוש בנוסחה 3 (FLT 3: A VIF מעל 5 או 10 נחשב לעתים קרובות סימן של ריבוי בעיות קולינאריות, אם כי אלה הסףים אינם מוחלטים.
(ב) [15] ,ב"ה' (ב"ה) ,"ה' (ב"ב)"ה' (ב"ב)"ה' (ב"ב)"ה' (ב"ב)"ה' (ב"ב)"ה', "ה'"ה'"ב'"ה')"ה'"ה'"ב"ה'"ה'.
אסטרטגיות ל Handle Multicollinearity in Decision Trees
ברגע שזיהית תכונות מרובותקולאריות, הצעד הבא הוא להחליט כיצד להתמודד איתן.אסטרטגיות הבאות יעילות במיוחד עבור מודלים של עץ ההחלטות.
1 בחירת
בחירת תכונה היא לעתים קרובות הפתרון הפשוט והמורכב ביותר.המטרה היא לשמור רק תת-קבוצה של צופים שנמצאים בתאים ביותר זה לזה, תוך שמירה על האות הנבאיבי.
- (ב) ,0) , נספח: ⁇ (ה) , נספח ל' ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (FLT:0VIF-based SelectionFLT:1) - בדרגה 6F לכל התכונות, הורידו את ה-IIF הגבוה ביותר מעל קיצוץ, וחוזרים עד שכל התכונות שנותרו יש ערכים מקובלים על VIF.
- (FLT:0) שיטות הפעלה של ההרחבה 1 (FLT:1) - השתמש בבחירה קדימה, חיסול לאחור או ביטול תכונה חוזרת (RFE) המותאם במיוחד לאלגוריתם עץ ההחלטות, בעוד יקר חישובי יותר, שיטות אלה ישירות אופטימיזציה לביצועי עץ.
בחירת תכונות יש את היתרון הנוסף של צמצום איסוף נתונים ועלויות אחסון במערכות ייצור, והוא שומר על עץ פשוט וקל להסביר.
הפחתה של מימדיות עם PCA
כאשר טיפות תכונות הוא לא רצוי כי כל משתנה נושא משמעות דומיין ייחודי, ניתוח רכיב עיקרי (PCA) מציע אלטרנטיבה: זה הופך את התחזיות המקוריות מתואמות לתוך קבוצה קטנה יותר של רכיבים שאינם קשורים שלוכדים את רוב השחלות בנתונים.
- (FLT:0) AdvantagesFLT:1 - PCA מבטל ריבוי קולינאריות לחלוטין, מפחית רעש, ויכול לשפר את הכללה כאשר מספר התכונות הוא גדול יחסית למספר הדגימות.
- (FLT:0TradesFLT:1) - הירידה הגדולה ביותר היא אובדן של הפרשנות.רכיב הוא שילוב ליניארי משקל של תכונות מקוריות; קשה להסביר מה פיצול על FLT:6 פירושו במונחים עסקיים.בנוסף, PCA הוא ללא פיקוח וייתכן שמידע שאינו נתפס על ידי שרטוטים, אך חשוב עבור היעד.
למרות הבורסות הללו, PCA הוא כלי רב עוצמה להכנת נתונים לעצי החלטות, במיוחד בשילוב עם שיטות הרכב.
3.התרגילות במודלים המבוססים על עץ
למרות סדיריזציה קשורה לרוב למודלים ליניאריים (L1/L2 עונשים), לעצים החלטות יש צורות משלהם של סדיריזציה שיכולה להפחית את התוספת של תכונות מולקולאריות:
- (ב) [15] ,0) דגימות של כפלה: 1 (הגדלה של ה-FLT 7) מכריחה את העץ לדרוש יותר נתונים לפני שהפכה למפולגת, צמצום הסיכוי לפיצול על תכונה מובנת רק במקרה.
- (ב) ויקרא י"א: ויקרא י"ד: "ה' י"א ," (בראשית כ"ד) ,"ה' (בראשית כ"ד) , ).
- (ב) [15] , ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (ב) ⁇ :0) ,Complexity pruning (CCPrea) 1 (הופנה מהדף לאחר סיום 10) מאפשר לעץ לקצץ בחזרה לאחר צמיחה, הסרת ענפים הנשען על פיצולים מחוסנים.
החלת סדירות חזקה יכולה לעזור עץ ההחלטה להתעלם מתתקשורים מעוררי השראה, אבל זה לא כדור כסף - זה לא מתייחס לבעיה הבסיסית של תכונות מקודמות.
(ב) ⁇ (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
4.אנסמבל שיטות: יערות אקראיים וגרדנט בוטינג
שיטות אנסמבל הן אולי הדרך החזקה ביותר להתמודד עם ריבוי קולינאריות במודלים המבוססים על עץ.על ידי שילוב של עצים רבים, הרכבים בממוצע מחוץ לאינסוף ההסתברות הנגרמת על ידי תכונות מתואמות ומייצרים תחזיות יציבות יותר.
- (FLT:0Random ForestsFLT:1) - כל עץ מאומן על דגימה מפוספסת של הנתונים, ומתייחס רק למצע אקראי של תכונות בכל פיצול.תכונה זו שוברת את הדומיננטיות של כל אחד מהם, מכריח את היער לחקור פיצולים חלופיים.החיזוי הסופי הוא ממוצע על פני עצים רבים, אשר חלק מעל הבחירה השרירותית.
- (ב) [ה][דרוש מקור]] [ה]]] [ה]] [ה]]]] [ההה]]], [ההההתעלים] את העצים באופן בלתי אפשרי, כל אחד מהם מתקן את שגיאות קודמיו, ניתן עדיין לבחור בין העצים, אך הזיקוקטיביות המפחיתה את ההשפעה של ריבוי הקוליניות על ביצועיו הכלליים.
שיטות אנסמבל אינן מבטלות את ריבוי הקולינאריות, אך הן הופכות אותו להרבה פחות מזיק.עבור מתרגלים רבים, באמצעות יער אקראי או GBM היא הדרך הפשוטה ביותר להתעלם מהבעיה ללא עיבוד מפורש.
יישום מעשי: מדריך צעד-בי-צעד
בואו נלך דרך זרימת עבודה ייצוגית לטיפול במוליניטיקולאריות בפרויקט עץ החלטה.We'll use a hypothetical דיור Dataset with Features like Square, Number of חדרי שינה, מספר חדרי אמבטיה, גודל רב, ושנה בנוי - אחד מהם מתואמת באופן טבעי.
שלב 1: ect Multicolleiity
ראשית, חישוב המטריצה וה- VIF לכל התכונות המספריות.בדוגמה שלנו, קטעי ריבוע ומספר חדרי השינה עשויים להיות קורלציה של 0.82, וערכי VIF עבור שניהם יכולים לעלות על 6.זה מאשר רב-קוליניות בעייתית.
שלב 2: בחר אסטרטגיה של מייגציה
מכיוון שפירושיות חשובה למודל של ממש, אנו בוחרים ב-FLT:0.10.10.10.10.10.10.10.10.10.10.10.10.10.10.10.10.10.10.10.We Check for otherתואמיםdזוגות וסירנו הרבה אם הוא מראה 6F מעל 10 לאחר הירידה הסופית נשמר רק תואמים או מנבאים רק נחותים.
שלב 3: לאמן את עץ ההחלטות
עם המאפיין הצטמצם, אנו מאמנים עץ החלטה באמצעות עץ סביר (למשל, 6) ו-FLT:14 (למשל, 20) כדי למנוע התאמה יתר של העץ המתקבל הוא פשוט יותר, עם פחות צללים, ואת ציוני החשיבות מרוכזים כעת על משתנים נפרדים באמת.
שלב 4: אימות והשוואה
אנו משווים את העץ המוכשר על בסיס הנתונים המלאים נגד העץ שהוכשר על התכונות שנבחרו.למרות שהעץ המלא עשוי להשיג מעט יותר שגיאות אימונים נמוכות יותר, עץ התבוסה שנבחר צריך להראות ציונים טובים יותר של מחזורי צלב ופחות שידות על פני קפלים.
עבור שכבה נוספת של עוצמה, אנו גם להכשיר יער אקראי על תחילת הנתונים המקוריים.הביצועים של היער צריך להתאים באופן הדוק או יותר מזה של עץ ההחלטות המנוצל, המאשר כי שיטות הרכב הן אלטרנטיבה מעשית כאשר בחירת תכונה אינה רצויה.
מלכודות נפוצות וכיצד להימנע מהם
גם עם הכוונות הטובות ביותר, שגיאות יכולות להתרחש כאשר טיפול רב-קוליני בעצי החלטות.כאן הן המלכודות הנפוצות ביותר:
- (FLT:0)Over-eagerrated RemoveFLT:1 - ירידה משתנה רק כי זה מתואם עם אחר יכול לבזבז אות יקר ערך.תמיד לשקול את התרומה הנבאת של כל תכונה ולהשתמש בידע דומיין כדי להנחות את ההסרה.
- (FLT:0) אבחון השפעות אינטראקציה (FLT:1) - במקרים מסוימים, שני תכונות מתואמות יחד נושאים מידע כי לא לבד. הסרת זכות אחת יכולה לפגוע בביצועים.
- (FLT:0) Applying PCA ללא דרוג רוחב 1) - PCA רגיש לגודל של תכונות.תמיד סטנדרטיזציה של צופים מספריים לאפס משמעות ו- Unit variance לפני ביצוע PCA.
- (FLT:0) פסגות VIF הן אוניברסליות,00:1 - VIF של 10 הוא חיתוך משותף, אבל במאגרי נתונים קטנים או תחומים עם קורלציות טבעיות חזקות, אפילו סף נמוך יותר עשוי להיות מתאים.
- (FLT:0) ,לקבל לבדוק לאחר הנדסת הנדסה תכונה LT:1 ; multicol לינאריות ניתן להציג בעת יצירת תכונות פולינומיות, יחסים או תנאי אינטראקציה. Re-evaluate תואמים לאחר כל שלב הנדסי.
מסקנה
Multicol לינאריות אולי לא לשבור מודל עץ החלטה באותה דרך זה שובר תוקפנות ליניארית, אבל זה עדיין לערער יציבות, הפרשנות, והכללה. על ידי גילוי תכונות מתואמות מוקדם, החלת בחירה או ירידה ממדית, ומשלים עצים עם שיטות כמו יערות אקראיים, אתה יכול לבנות מודלים כי הם מדויקים וריחים.
(ב) [ה]]: [ה] [ה]] [ה]] [ה]] [ה]]] [ה'] [ה']'[ה]']'[ה']'[ב]']'[ה']'[ה']'[ה']'[ה']'[ה']''']''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''