הבנת מודל אינטר-חשיבות ב- Machine Learning

כאשר בונים מודל חיזוי, מדעני נתונים עומדים בפני מסחר יסודי בין דיוק ופירוש. מודל שהשיג ביצועים גבוהים בחיזוי, אך אינו יכול להסביר את החלטותיו נדחו לעתים קרובות בתעשיות מוסדרות, בעוד מודל שקוף עשוי להקריב כמה ביצועים אבל להרוויח את האמון של בעלי העניין. שני אלגוריתמים קלאסיים אשר מדגימים את המתח הזה הם עצים ומכונת תמיכה (SVMs) שימשו באופן נרחב במשך עשרות שנים, אך הם עדיין מציעים הדרכה מעשית של שני שיטות אלה.

אי-אפשרות בלמידה מכונה מתייחסת לדרגה שבה אדם יכול להבין את הסיבה לחיזוי המודל.זה לא נכס בינארי אלא רצף מודלים שניתן לפרשם מטבעם – לעתים קרובות מודלים "קופסאות זכוכית" - מאפשרים למשתמשים לעקוב אחר הצעד על ידי מודל קופסה שחורה, לעומת זאת, לייצר תחזיות שקשה להסביר ללא כל כלי עזר.

תגית: The Glass Box Champions

עץ החלטה הוא אלגוריתם למידה בפיקוח המחלק את המרחב המאפיין לאזורים באמצעות סדרה של החלטות בינאריות.כל צומת פנימי של העץ בוחן את הערך של תכונה אחת, כל ענף מייצג את התוצאה של המבחן, וכל עלה מכיל תווית צופה או התפלגות הסתברות.המבנה וכתוצאה מכך הוא חירש שניתן לעקוב אחריו משורש עלות, מה שקופה לחלוטין.

לדוגמה, לשקול עץ החיזוי אם לחולה יש מחלה מסוימת.הצומת הראשון עשוי לבדוק אם גיל המטופל הוא מעל 60, הבא עשוי לבדוק אם לחץ דם עולה על סף, וכן הלאה. כל אחד יכול לעקוב אחר הדרך ולראות אילו תנאים הובילו לאבחון.שקיפות זו היא הסיבה העיקרית לכך שעץי ההחלטות הם האלגוריתם של האלגוריתם לתחומים שבהם חשוב כמו חיזוי, רפואה, תאימות משפטית, בנקאות, בנקאות, בנקאות, בנקאות, בנקאות.

כיצד נבנות העצים

עץ ההחלטות בנוי באמצעות חלוקה חוזרת.בכל שלב, האלגוריתם בוחר את התכונה ונקודת הפיצול שמבדילה את הנתונים בצורה הטובה ביותר על פי קריטריון טוהר - בדרך כלל את חוסר האונות של גיני או את הטרופיה לסיוג, ופירוש שגיאה מקובעת לתוקפנות.הפיצול ממשיך עד שתנאי עצירה יינתן, כגון עומק עץ מקסימלי, מספר מינימלי של דגימות לכל היותר, או שיפור מוקדם יותר, כאשר אין אפשרות אחרת.

אחד היתרונות המרכזיים של תהליך זה הוא כי זה באופן טבעי מטפל הן תכונות מספריות וקטגוריות, זה גם invariant לטרנספורמציות מונוטוניות של תכונות, והוא יכול ללכוד יחסים לא לינאריים מבלי לדרוש את המשתמש מהנדס תנאי אינטראקציה.מבנה העץ גם עושה טיפול חסר ערך פשוט, לעתים קרובות באמצעות פיצולים.

היתרונות של עץ ההחלטות עבור Interpretability

  • (ב) ניתן להזיז את העץ ולהתבונן ישירות.אפילו לא- ⁇ יכול להבין עץ עם מספר מתון של צמתים.
  • (ב) [העיקרון]: עד כמה פעמים נעשה שימוש בתכונה לפיצול וכמה אי-נוחות היא מקטין, ניתן להפיק מדדים בעלי חשיבות גלובלית.
  • (ב) [הסברים המקומיים]: לכל חיזוי אישי, הדרך משורש לעלון מספקת הסבר מדויק, מבוסס-כלל.
  • (ב) אין צורך בנתוני דרוג: עץ ההחלטות אינו מושפע מהבדלים בקנה מידה כולל, אשר מפשט את הצינור המכוון.
  • (ב) [15] , ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇

הגבלות של עץ ההחלטות

למרות השקיפות שלהם, עץ ההחלטות יש חולשות ידועות.הם נוטים ל-FLT:0overfittingFLT:1, במיוחד כאשר גדל לעומק מלא.עץ המבשר את נתוני האימון ירחיבו בצורה גרועה לתצפיות חדשות.

עץ ההחלטות הוא גם (FLT:0) בלתי מוגבל של ההרחבה: שינוי קטן בנתונים האימונים יכול לייצר מבנה עץ שונה לחלוטין.שחלות זו יכולות לערער את האמון, כי שני מודלים מאומן על נתונים דומים עשויים לתת הסברים שונים.בנוסף, עצים נאבקים כדי מודלים של מבנים מודל שבו תכונות מרובות לתרום אופנה ליניארית; הם דורשים פיצולים רבים קרוב לגבול פשוט ליניארי.

להקות ועלויות של אי-מוכנות

כדי להתגבר על החולשות של עצים בודדים, שיטות הרכב כגון יערות אקראיים ועץ גראדנט בוזל משמשים בדרך כלל.אלה משלבים עצים רבים כדי להשיג דיוק גבוה יותר ועוצמה גבוהה יותר.עם זאת, הפרשיות של עץ אחד אבוד: ההרכב של מאות או אלפי עצים הופך לקופסא שחורה, למרות שכל עץ מתאים הוא שקוף.

עם זאת, מודלים של הרכב עדיין יכולים לספק רמה מסוימת של הסברה באמצעות חשיבות תכונה (למשל, חשיבות ההסתה, ערכי SHAP, חלקיות התלות) הסברים לאחר השואה אינם ישירים כמו בדרך אחת, אבל הם יכולים להשוות את ההתנהגות הגלובלית של המודל.אם הפרשיות היא דרישה מוחלטת ודיוק הוא משני, עץ אחד הוא בחירה טובה יותר.

מכונות Vector: כוח במחיר של שקיפות

מכונות Vector תמיכה הן סוג של מודלים למידה בפיקוח למצוא היפר-מטוס הפרדה אופטימלי בין המעמדות.הרעיון הליבה הוא למקסם את שולי - המרחק בין ה- Hyperplane לבין נקודות הנתונים הקרובות ביותר מכל מחלקה, הידוע כקטור תמיכה.עקרון שולי מקסימלי זה נותן תכונות SVMs חזק הכללה, במיוחד במקומות גבוהים.

עבור נתונים לינאריים, הפונקציה ההחלטה היא שילוב ליניארי של תכונות:0 (הסימן של FLT:1) קובע את השיעור הצפוי.המדן וקטור משקל:2 נקבע רק על ידי וקטורים תומכים, מקבל את המודל ספאר: רק תת-ממדי של נקודות אימון משפיע על גבול ההחלטה.

הטריק הקרנל והלא-לינארי

הכוח האמיתי של SVMs מגיע מן הטריק של הקרנל.על ידי מיפוי נתוני קלט לתוך שטח תכונה גבוה יותר ממדים באמצעות פונקציה גרעין, SVMs יכול ללמוד גבולות החלטה מורכבים לא ליניארית תוך עדיין פתרון בעיית אופטימיזציה convex. הקרנלים נפוצים כוללים את הליבה פולינומית, הפונקציה הבסיס הקרנית (RBF) גרעין, ואת sigmigmigmleiel.

כאשר נעשה שימוש בלינארי גרעין, הפונקציה ההחלטה הופכת לסכום של הערכות גרעין בין נקודת המבחן לבין וקטורי התמיכה: FLT 3: המשקלs αi יכול להיות חיובי או שלילי, ואת הקרנל (FLT:0KIRFLT:1) אין שום פרשנות אינטואיטיבית בחלל המקורי.

היתרונות של מכונות Vector

  • (FLT:0) דיוק גבוה בחללים תלת-ממדיים גבוה: SVMs מבצעים היטב כאשר מספר התכונות עולה על מספר הדגימות, כגון סיווג טקסט או ניתוח ביטוי גנים.
  • (ב) [ה]] [ה] [ה]] [ה]]: הגרסאות הרכה-מרוות מרעישות בפרמטר C, ורק חומר הווקטורים התומכים.
  • (ב) ,0) ,Kernelura FlexFLT:1: עם הקרנל המתאים, SVMs יכול מודל של גבולות החלטה מורכבים מאוד.
  • (ב) .0.Sparse SolutionFLT:1: המודל תלוי רק בVisors תמיכה, מה שהופך את החיזוי יעיל יחסית אם מספר הווקטורים תומך קטן.

חסרונות ל Interpretability

הסגירה העיקרית היא אופיו של ⁇ .גם עם גרעין ליניארי, המפרש את ה-FLT:0uphFLT:1 וקטור דורש מומחיות דומיין; הגודל והסימן של כל coefficient אינם מתאימים לסף החלטות פשוט כמו אלה בעץ. עבור הקרנלים לא ליניאריים, המודל הוא בעצם קופסה שחורה.

SVMs גם דורש עיבוד זהיר: כל התכונות חייבות להיות בקנה מידה למגוון דומה, בדרך כלל באמצעות סטנדרטיזציה או מינוס מפלסמות, כי השולי רגיש לקשקשים.זה מוסיף צעד נוסף המסבך פרשנות.יתר על כן, כוונון יתר על המידה - במיוחד בחירת הקרנל ופרמטר הסדיריזציה C - דורש שינוי וידע, וכתוצאה מכך ההתנהגות של המודל יכול להשתנות באופן דרסטי עם פרמטרים קטנים.

האם ניתן לעשות יותר אינטר-pretable?

קיימות טכניקות רבות לשיפור הפרשנות של SVMs. עבור לינארי SVMs, את משקל coefficients ניתן לבדוק כחשיבות תכונה, במיוחד אם התכונות על אותו קנה מידה. אנליסטים יכולים לבחון את המשקל החיובי והשלילי הגדול ביותר כדי להבין מה מניע סיווג.עם זאת, גישה זו הופכת לא אמינה כאשר תכונות מתואמות.

עבור שיטות הסבר לא לינאריות SVMs, לאחר-hoc שיטות כמו LIME (הסברים הבין-צפוניים מקומיים-אגנוסטיים) או SHAP (SHapley Additive exPlanations) יכול להיות קרוב לגבול ההחלטות המקומי סביב חיזוי.שיטות אלה ליצור מודל פונדקאי פשוט (למשל, מודל ליניארי או עץ החלטה) המחקה את SVM באזור מקומי, בעוד הם תמיד שימושיים, הם לא ניתן למצוא הסברים נאמנים.

גישה נוספת היא להכשיר עץ החלטה על הווקטורים התומכים לבד, או להשתמש ב- SVM לתכונות טרום סינון ולאחר מכן לבנות מודל שקוף על הסט המאפיין מופחת.

השוואה בין ראש ל-Head: עצי החלטות לעומת SVMs

Aspect Decision Trees Support Vector Machines
Interpretability Very high, glass box Low to moderate, black box
Accuracy Good, but prone to overfitting Often better on complex datasets
Scalability Scales well with features and data; can handle millions of samples Scales poorly with large data (O(n³) or worse with nonlinear kernels)
Handling non-linearity Natively through splits Through kernel trick, but kernel selection is non-trivial
Missing data Can handle natively with surrogate splits Requires imputation or removal
Feature scaling Not required Critical for performance
Probability estimates Directly from leaf frequencies Requires calibration (e.g., Platt)
Robustness to outliers Moderate; outliers can create deep branches High (with soft-margin)
Parameter tuning Depth, min samples per leaf, etc. Kernel choice, C, gamma, etc.
Memory usage Low (tree structure) Moderate to high (stores support vectors)

מתי לבחור עץ החלטה

עץ ההחלטות הוא הבחירה המועדפת כאשר FLT:0 (התיכון) הוא בלתי ניתן להשגה של רצף 1 (התרחישים הנפוצים כוללים:

  • (ב) ,0) ,HealthcareveFLT:1: רופאים ורגולטורים צריכים להבין מדוע מודל צופה מחלה.עץ עם מספר קטן של נתיבים ניתן לבדוק על ידי לוח רפואי.
  • (FLT:0) קבלת אשראי וניכוי אשראי 1: Lenders חייב להסביר החלטות אשראי ללקוחות ולקולטורים. תקנות רבות (למשל, ECOA בארה"ב) דורשות חשיבה שקופה.
  • (ב) ניתן להדפיס את ה- 0Legal andציותFLT:1: החלטות אוטומטיות שיש להן השלכות משפטיות שיש להן השלכות משפטיות.
  • (FLT:0) ניתוח נתונים של נתונים Exploratory 1FLT: Trees מספקים סיכום מהיר וויזואלי של אילו תכונות חשובות ביותר וכיצד הן אינטראקציה.
  • (ב) ,0) לוטו בגודל נתונים מתון: כאשר הנתונים אינם עצומים, ומטרתה היא לפרוס מודל פשוט, מובן.

מתי לבחור מכונת תמיכה

SVMs לזרוח כאשר LT:0 (דיוקנות היא כפליים) 1:1 והבעיה היא מורכבת, אבל הצורך בהסבר הוא פחות קפדני יישומים אופייניים כוללים:

  • (FLT:0) סיווג Text סיווגFLT:1: SVMs עם ליבות ליניאריות הם יעילים מאוד עבור זיהוי ספאם, ניתוח רגשות, ותווית נושא, שבו המרחב המאפיין גדול (של מילים) ופירוש של תכונות בודדות הוא פחות קריטי.
  • (FLT:0) Image ReventofLT:1; למרות שלמידה עמוקה החליפה בעיקר את SVMs במשימות תמונות, SVMs עם RBF kernels עדיין עובד טוב עבור נתונים קטנים יותר שבו החילוץ תכונה כבר בוצעה (למשל, באמצעות תכונות רשת CNN מראש).
  • (FLT:0) BioinformaticssFLT:1hil: בהבעה גנטית או בעיות סיווג חלבון, מספר התכונות הרבה יותר עולה על מספר הדגימות, ו- SVMs להימנע מהתאמה טובה יותר מאשר מודלים חלופיים רבים.
  • (FLT:0)Geoscience ו-SensingFLT:1 ; SVMs פופולריים עבור סיווג כיסוי הקרקע מדמיון לווייני, שבו להקות ספקטרליות הן למדידה, וגבול ההחלטה מורכב.
  • (ב) [ה]: כאשר האות הוא עדין והדאטה היא בעלת ממדים גבוהים, SVMs יכול להשיג דיוק גבוה, ועלות חיובי כוזב עשוי להיות נמוך מספיק כדי לסבול קופסה שחורה (או הסברים לאחר השואה מתקבלים על הדעת).

ההתערבות – מסחר-Off: האם אפשר לקבל את שניהם?

החוכמה המקובלת גורסת כי עליך לבחור בין מודל מפרש מאוד אך בלתי מדויק (כמו עץ החלטות רדום) לבין מודל מדויק אך מדויק אך מדויק (כמו SVM עם גרעין RBF).

בחירת SVMs

ניתן להשתמש ב- SVM-RFE:0 (התכונה המאפיין של חיסול FLT:1) כדי לבחור תת-קבוצה קטנה של תכונות, ולאחר מכן להכשיר עץ החלטה על תכונות אלה.הכליה הזו שומרת על הפרשנות תוך מינוף היכולת של SVM לזהות תכונות מפלה.

עץ ההחלטה

עץ החלטות יכול להיות מאומן לחקות את התחזיות של SVM מאומן העץ יהיה קרוב לגבול ההחלטה של SVM, ולמרות שזה לא יהיה מדויק, הוא מספק פונדקאית שקופה שניתן לבדוק ולהסביר.

קואר SVMs עם Visualisation

אם הבעיה היא לינארית מפולגת או כמעט כך, SVM ליניארי מייצר משקולות שניתן לדמיין כמפת חום או תרשים בר. עבור סיווג טקסט, המילים החיוביות והשליליות ביותר לעתים קרובות הגיוניות אינטואיטיבית, המאפשרות צורה של פרשנות.

שיטות הסבר מקומיות

כלים כמו LIME ו- SHAP יכולים להסביר תחזיות אישיות של כל מודל, כולל SVMs. בעוד שהם אינם מספקים את הלוגיקה הגלובלית המלאה של המודל, הם מציעים הסברים להפחתה כי לעתים קרובות לספק צרכים רגולטוריים.

עקבו אחרי Interpretability

(ב) לעץ הדעת, ניתן להשתמש בטכניקות כמו:0interpretable Random ForestFeloLT:1 אשר מטביעות את היער לתוך עץ קומפקטי יחיד, או להשתמש ב-FLT:2rule ExtracttureFLT 3 כדי לייצר קבוצה של אם כן כללים המסכמים את התנהגות ההרכב.

טיפים מעשיים עבור מדעני נתונים

  1. (FLT:0)Start with a Decision TreeFLT:1hil, גם אם אתה מתכנן להשתמש ב- SVM מאוחר יותר, מודל מבוסס עץ מהיר נותן לך תובנה על אינטראקציה תכונה ומבנה נתונים.
  2. (FLT:0)Use cross-validation 1 (FLT:1) להעריך אם המורכבות הנוספת של SVM למעשה משפרת את הדיוק על עץ ההחלטות המוזנח על תחילת הנתונים שלך לעתים קרובות, ההרכב עץ מתואם היטב (Random Forest) תואם את ביצועי SVM וקל להסביר.
  3. (ב) אם הפרשנות היא משנית (הראשונה) 1 (הראשונה) לנסות לינארי SVM; היא עולה בקנה מידה טוב ומספקת משקולות תכונה בלבד לעבור ל- SVM לא ליניארי אם המודל הליניארי מתחת לתחתונים.
  4. (FLT:0) ביצוע אסטרטגיית הפרשנות שלך:1 בפרויקט שלך: אם אתה דורש מודל תיבת זכוכית, אם הסברים לאחר השואה מתקבלים על הדעת, ואשר בעלי העניין צרכו את ההסברים.
  5. (FLT:0) זכרו כי הפרשנות אינה רק על האלגוריתם של אלגוריתם LT:1; זה גם תלוי בהקשר התחום והקהל. עץ החלטה רדודה הוא פרש לרופא, אבל עץ עמוק עם 50 עלים אינו דומה, SVM ליניארי עם 10 תכונות עשוי להיות מפריש לסטטינזיטיסטאן, אבל לא לנח.

מסקנה: אין תשובה אחת

השאלה של איזה אלגוריתם ניתן לפרש יותר היא קלה לענות ברמה גבוהה: עץ החלטות מנצח ידיים למטה.אבל הבחירה המעשית היא אף פעם לא פשוטה. פער הדיוק בין עץ רדום בודד לבין עץ בודד ומוכוון היטב SVM יכול להיות גדול, ואת העלות של חיזוי לא נכון עשוי לעלות על הערך של הסבר.

הבנת נקודות הכוח והחולשות של שני האלגוריתמים מאפשרת למדענים מידע לבצע את המסחר המעודכן.עבור בעיות רבות, הפתרון הטוב ביותר הוא לא עץ החלטות טהור ולא SVM טהור, אבל גישה היברידית המשתמשת בכלי הנכון לכל שלב של זרימת העבודה - ניתוח חקירה עם עצים, ביצועים גבוהים חיזוי עם SVMs, והסברים המקומיים כדי לגשר על הפער.המפתח הוא לפרש את דרישות הדיוק והדיוק לא רק כדי להעריך את המודלים שלהם.

לצלול עמוק יותר, להתייעץ עם המסמכים המקוריים: Breiman et al. (1984) עבור Classification ו-Regression Trees, ו-Corts & Vapnik (1995) עבור תמיכה Vector Networks. The scikit-learn מספק מדריכים מעשיים עבור שני האלגוריתמים, ומשאבים כמו מולנר's FLT:0 Interpretable Machine LearningFLT:1) ספר מציע סקירה מקיפה של מודל שקיפות.