מבוא

אלגוריתמי עץ החלטות נשארים אבן הפינה של למידת מכונה הן משימות סיווג והן תוקפנות בשל המבנה האינטואיטיבי שלהם, הפרשנות, ויכולת מודל יחסים לא-לינאריים.עם זאת, נתונים בעולם האמיתי הם לעתים רחוקות מפוכחים; הם לעתים קרובות מכילים ערכים חסרים הנגרמים על ידי כישלונות חיישן, טעות אנושית, בעיות אינטגרציה נתונים, או פעולות הגנה עצמית מכוונות פרטיות אלה יכולים לבצע ביצועים מודל, להציג חיזוי, ולכן טיפול בלתי אמין של שיטות פעולה מתקדמות של נתונים חסרים.

הבנת נתונים חסרים

נתונים חסרים אינם בעיה אחידה.האסטרטגיה המתאימה לטיפול תלויה במנגנון שיצר את החסרות. הסטטיסטים סיווגו נתונים חסרים לשלושה סוגים שונים, כל אחד מהם בעל השלכות שונות על ניתוח.

חסר לחלוטין ב-random (MCAR)

תחת MCAR, ההסתברות כי ערך חסר הוא לחלוטין עצמאי של נתונים נצפות ולא נשמרים.לדוגמה, כלי מעבדה נכשל לעתים במרווחים אקראיים שאינם קשורים לדגימה תחת הבדיקה, או סקר מגיב בטעות על שאלה. MCAR הוא הסוג הקל ביותר לטפל אנליטית כי הנתונים הנצפה נשארים מדגם אקראי מייצג של הנתונים המלאים.

נעדר ב-random (Mar)

המרה מתרחשת כאשר החסרה תלויה רק במשתנה נצפים ולא בערכים החסרים עצמם.לדוגמה, בנקודת נתונים בסיכון אשראי, ההכנסה עשויה להיות יותר נמוכה עבור מועמדים צעירים (גיל משתנה) אבל, בהתחשב הגיל, ההכנסה החסרה אינה תלויה ברמת ההכנסה בפועל.שיטות מזהמים סטנדרטיות רבות מניחות MAR, וטכניקות כמו אימפולסים מרובים או סבירות מקסימלית להישאר בתוקף תחת ההנחה הזאת הוא מנגנון עסקי סביר.

נעדרים לא ב-MNAR

ב MNAR, ההסתברות של החסרות קשורה לערך הבלתי נשגב עצמו.דוגמה קלאסית היא בסקרי שכר: אנשים בעלי הכנסה גבוהה עשויים לסרב לחשוף את הרווחים שלהם, כלומר החסרות מתאמים ישירות עם הערך החסר (הכנסה) הוא התרחיש המאתגר ביותר כי הערכים החסרים אינם יכולים להיות מוערכים ללא מידע חיצוני או טכניקות דוגמנות מיוחדות (למשל, מודלים בחירה או דפוס אינטגרטיבי).

זיהוי תבניות נתונים חסרות

לפני בחירת שיטת טיפול, מתרגלים צריכים לחקור את דפוס החסרות באבחון הנתונים שלהם.

  • (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
  • בדיקה אחרונה ב-17 במאי 2010. ^ "FLT:0.0.000's MCAR TestFLT:1 - AFPS RESTS RESTSTIONS TEITIONS TERDINGS TERRINGS TERRING TERS TERS TERDS TERS .
  • (FLT:0groupwise החסרה סטטיסטיקות סטטיסטיקות FLT:1) - נציין את המשמעות של תכונות נראות בתנאי אם תכונה אחרת חסרה; הבדלים גדולים מציעים MAR או MNAR.

הבנת המנגנון קובעת את הבסיס לבחירת אסטרטגיה מתאימה או מודל.

גילוי נתונים חסר נתונים

גישות נאיביות רבות – כגון מחיקה (פשוט הסרת שורות עם כל ערך חסר) או מחיקה מעוותת - עדיין בשימוש בפועל, אבל הם באים עם עלויות משמעותיות:

  • (FLT:0) ,Diged מדגם SizeFLT:1 - מחיקה קדמית יכולה לנפץ חלק גדול של הנתונים, במיוחד עם תכונות רבות, מה שמוביל לשחלות גבוהות וכוח סטטיסטי נמוך.
  • (FLT:0) פרמטר פרמטר מובחן מעריך את FLT:1 - אם החמיצות אינה MCAR, הדגימה הנמרת כבר אינה מייצגת.הטיה זו מתפשטת ישירות לתוך פיצול עץ החלטות, מה שגורם לסףים לא נכונים ולטוהר תת-אופטימי.
  • (FLT:0)Los of Figs of InformationFLT:1) תכונות עם ערכים חסרים עשויים להיות מחוץ ללוגיקה המתפצלת לחלוטין, תוך התעלמות מהאות החיזוי שניתן להשתמש בהם באמצעות פיצולים או אימפולסים.
  • (ב) (ב):0) טיפול עקבי בין העצים לאלף:1 – שיטות הרכב כמו יערות אקראיים עלולות לטפל בערכים חסרים באופן שונה בכל עץ בסיס, הניב תחזיות לא יציבות.

טיפול בנתונים חסר מעוצב היטב משפר את הדיוק והאמינות, במיוחד ביישומים גבוהים כגון אבחון רפואי, הערכת סיכונים פיננסית ותחזוקה חיזוי.

שיטות מניעה מסורתיות

אימפולס – מילוי ערכים חסרים עם ערכים מוערכים – הוא הגישה הנפוצה ביותר.בחירה של שיטת האכיפה תלויה בסוג הנתונים, במנגנון החסרות ובתקציב חישובי.

הרתעה בלתי יעילה

הטכניקות הפשוטות ביותר מחליפות ערך חסר עם המשמעות, החציונית או מצב הערכים הנצפה לתכונה זו.בעוד שמהירות, שיטות אלה מתעלמות מתאמים בין תכונות ו נוטות לכווץ את השחלות, באופן מלאכותי לנפח את אמון המודל.הההההה מתאימה רק תחת MCAR ותכונות עם סימטרית בערך; מוטציות אמצעיות חזקות יותר למצבים.

תוקפנות

מוטציות רגרסניות מתאימות לתכונות הנצפות ולאחר מכן משמש לחיזוי הערכים החסרים.זה משמר יחסים בין משתנים אך מניח לינאריות ויכול להוביל להתאמה יתר אם אותו נתונים משמשים גם למניעה וגם לאימון.

שכנים (KNNNN)

מוטציות KN מוצאות את הדגימות הכמעט זהות (על ידי מרחק על תכונות נצפויות) וממוצעים (או לוקח רוב להצביע) ערכיהם.זה באופן טבעי לוכדת תלות לא לינארית ופועל היטב עם סוגי נתונים מעורבים.המגירות העיקריות הן עלות חישובית עבור נתונים גדולים ורגישות לבחירה של k ומרחק KN מניח כי מנגנון החסר הוא MCAR או מרחק משמעותי עבור שטח משמעותי עבור תכונה.

מספר רב של

(למשל, שימוש באלגוריתם MCMC או MICE) יוצר מספר נתונים מלאים על ידי הטמעת ערכים ממודל סטטיסטי המשלב אי ודאות.האנליסט מתאים עץ החלטה לכל אחד מהנתונים שאינם מאוישים ומאגד את התוצאות (למשל, על ידי הסתברות צופה או שימוש בחוקי רובין). גישה זו משקפת כראוי את אי הוודאות ומחסימת את Python באמצעות LT1, בעוד שמקובלת על ידי סטנדרטים כגון: 0.

הגבלות של הרתעה פשוטה

אין שיטת מוטציות היא פאן-אצ'ה.המניעה פשוטה יכולה לעוות את ההפצה המשותפת של תכונות, מה שהופך אותו קשה יותר עבור עצי החלטות למצוא פיצולים נקיים. יתר על כן, אימפולס הוא צעד עיבוד נפרד מעץ אינדוקציה; אלגוריתם העץ אינו "יודע" כי ערך לא היה מוטעם.זה יכול להוביל לביצועים אופטימיים יתר אם אימפולס לא מאומת בתוך מודל מתאים, הוא להניח כי הוא בסופו של דבר חסר יכולת.

גירושים בעץ ההחלטות

במקום לעבד את הנתונים, כמה אלגוריתמי עץ החלטות - בעיקר את CART המקורי (Classification and Regression Trees) - להתמודד עם ערכים חסרים תוך שימוש ב-FLT:0surrogate מפוצלsuaFLT:1.

כיצד מפרידים מפרידים עובדים

בעת בניית עץ, האלגוריתם בוחר את הפיצול הטוב ביותר בצומת מבוסס על כל הערכים הלא-מחייבים של התכונה העיקרית (למשל, "הכנסה > 50,000 דולר") ולאחר מכן חיפושים עבור תכונות פונדקאית אחת או יותר אשר מחקים את הפיצול. A פיצול פונדקאית מוגדר על ידי תכונה אחרת (למשל, "רמת חינוך = בוגר") כי כאשר נעשה שימוש בנתוני ההתחלה, כאשר הוא מופץ, כמו גם כן, אם הוא חסר, כמו גם את המאפיין ראשוני, אם הוא, הוא, אם הוא מתאים לחיקוי, אם הוא, אם הוא, אם הוא, אם הוא חסר, אם הוא, אם הוא, אם הוא, אם הוא, לדוגמה, הוא מתאים לחיקוי, אם הוא מתאים לחיקוי, אם הוא מתאים לחיקוי מוקדם יותר, אם הוא, אם הוא מתאים לדגימה, אם הוא מתאים לדגימה, אם הוא, אם הוא, אם הוא, אם הוא מתאים לחיקוי מוקדם יותר, אם הוא מתאים לחיקוי מוקדם יותר, אם הוא, אם הוא מתאים לחיקוי מוקדם יותר, אם הוא, אם הוא, אם הוא, אם הוא, אם הוא מתאים לחיקוי מוקדם יותר, אם הוא, אם הוא, אם הוא, אם הוא, אם הוא חסר, אם הוא חסר, אם

יתרונות ואכזבות

(הפיצול) יש את היתרון העיקרי של לא לדרוש כל אימפולס - העץ לומד מכל הנתונים הזמינים ללא יצירת ערכים; הם גם לשמר את היחסים המשתנים של בניה מעץ.עם זאת, הטכניקה דורשת כמה תכונות מתואמות קיימות כדי לשמש כפונדקאיות; אם התכונה החסרה אינה תואמת באופן חזק, הפיצולים נחלשים והעץ עדיין עלול לאבד דיוק להורדת ערכים, כולל קונסולת:

גישות מבוססות מודל ואלגוריתמים מודרניים

בשנים האחרונות ראו את העלייה של מסגרות ⁇ -boosting המשלבות טיפול חסר ערך ישירות לתוך אלגוריתם הלמידה, לעתים קרובות outperating הן אימפולסיביות והן פיצולים חלופיים בביצועים חיזוי.

XGBOST

(FLT:0)XGBoostFLT:1 (Extreme Gradient Boosting) לומד כיצד להתמודד עם ערכים חסרים במהלך אימון על ידי טיפול בחסרות כאות ספורד.בכל פיצול, האלגוריתם מעריך גם כיוון ברירת מחדל עבור נתונים חסרים (שמאל או ילד ימין) ואת הערך הפיצול האופטימלי על הערכים הנצפה.

LightGBM

(FLT:0) LightGBMoriFLT:1 לוקח מסלול שונה: הוא מתייחס אפס וערכים חסרים כקבוצה אחת (בקיצור מחדל) ומאמת את הכיוון המפוצל של הקבוצה הזאת.במהלך אימון, הוא לומד אם דגימות חסרות שייכות לילד השמאלי או הימני של פיצול. כמו XGBoost, אין צורך בהנעה ומטפלים בנתונים דליקים ביעילות.

CatBoost

(FLT:0CatBoostFLT:1 (Categorical Boosting) משתמש מנגנון מעט שונה: הוא מתייחס לערכים החסרים כקטגוריה נפרדת ומאפשר לעץ להחליט מתי לחלק את הקטגוריה הזאת.עבור תכונות נומרניות, ערכים חסרים מוקצים בתחילה בעל מקום (למשל, −1) והעץ מוצא פיצול אופטימלי על בסיס טיפול זה.

יישום נתונים חסרים בפרקטיקה

בחירת אסטרטגיה תלויה בגודל הכלים, גודל הנתונים ותבנית החסרה. להלן היא זרימת עבודה מובנת המשלבת את הטכניקות שנדונו.

  1. (FLT:0) התעלמות של החסרה (FLT) 1 - חישוב אחוז הערכים החסרים לתכונה ולדגימה.אם כל תכונה יש > 90% נעדרים, לשקול את הזרקה אלא אם ידע התחום חזק.
  2. (FLT:0) זיהוי המנגנון של ההרחבה 1R) - החל מבחן MCAR של ליטל אם הדגימה גדולה מספיק.אם MCAR הוא סביר, מחיקה חכמה עשויה להיות מקובלת על מחסור קטן (תחת lt;5%) עבור MAR או MCAR עם מחסור מתון, אימפולס או טיפול מבוסס מודל הוא בטוח יותר עבור MNAR, לשקול איסוף נתונים נוספים או שימוש במודלים.
  3. (ב) [ה]] [ה]]: [ה] [ה]] [ה]]: [ה] [ה'] [ה']], [ה'] ב'[ה'], [ב]'], [ה'], [ב[[המאה ה'], ו'לא'לא'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''
  4. אם משתמשים ב- XGBoost/LightGBM/CatBoost, אין צורך במניעה - פשוט להעביר את הנתונים עם ערכי FLT:10; המסגרות יטפלו בהם לעתים קרובות, זוהי הגישה הפשוטה והיעילות ביותר.
  5. אם משתמשים ב-R'sFLT:11, אפשרו לפרמטר 12:12 כדי להפעיל פיצולים חלופיים.
  6. (ב) [ה] [ה]] [ה]] [ה]] [ה]] [ה]]] [ה]]], [ה] [ה] [ה]]ה'[ה]']'[ה']'[ה']'[ה']'[ה']'[ה']']'[ה']'[ה']'[ה'[ה']']']'[ה']']'[ה'[ה']'[ה'[ה'[ה'[ה']'[ה']']']'[ה'[ה'[ה'[ה'[ה']']']']']']'[ה'[ה'[ה'[ה']']']']']']'[ה']']']'[ה'[ה'[ה']']']'[ה']']'[ה'[ה'[ה'[ה']']'[ה']']'[ה'[ה'[ה'[ה'[
  7. (FLT:0)Validate כראויFLT:1 - תמיד כוללים טיפול בנתונים חסרים בתוך לולאה של גלגול (למשל, מוטציות לפני רכבת / עדות כדי למנוע דליפות נתונים) בהשוואה לביצוע שיטות שונות על אותו קפל כדי להבטיח משמעות סטטיסטית.

ההליכים הטובים ביותר והמלכודות הנפוצות

  • (ה) לא למנוע את שינוי היעד: 1) – לנטרל את המטרה בהקשר מבוקר הטיה את אות הלמידה במקום, לא לכלול או לטפל בחסרי מטרה כבעיה נפרדת (למשל, לטפל כמעמד נוסף).
  • (FLT:0) ידע התחום של ידע דומיינים (FLT:1) - בתחומים רבים, לחסרות עצמה יש משמעות.לדוגמה, בדיקת מעבדה חסרה עשויה להצביע על הרופא לא חשד למצב, מתן מידע שימושי.יש מיומים עץ המאפשרים לך ליצור תכונה מחוון חסר במפורש כדי לאפשר לעץ פיצול על החסרות כמשתנה בינארי.
  • (FLT:0)היזה של נתונים עתירי משקל גבוה (FLT:0) אם רוב התכונות יש ערכים חסרים לעתים קרובות, מזהמים יכולים להיות מאוד לא בטוחים.במקרים כאלה, להשתמש בשיטות המבוססות על עץ עם טיפול מובנה (XGBost או LightGBM) אשר טיפול חסר כיוון נפרד.
  • (FLT:0) ,Ensemble of Imputation ModelsFLT:1) - עבור יישומים קריטיים, לשקול שימוש במספר רב של מזהמים ועצי החלטות תוך שימוש על פני נתונים בלתי מאוישים (כלומר, מספר מזהמים + הרכב).
  • (FLT:0) ביצועי פריסת Monitor הפריסה ביצועים של פריצה:1 - דפוס החסרה עשוי להשתנות לאורך זמן (נחישות תפיסה) לעקוב אחר תכונת החסרה ומודלים מעצימה עם אסטרטגיות טיפול מעודכנים.

מסקנה

Missing data is an inevitable reality in machine learning, and decision tree algorithms are no exception. The appropriate handling strategy depends on the missingness mechanism, the chosen tooling, and the performance requirements. Basic imputation (mean, median, KNN, MICE) remains widely applicable but must be integrated carefully into the modeling pipeline to avoid leakage. Surrogate splits offer a principled, model‑based alternative, though their availability is limited to certainספריות. ⁇ -boosting מסגרות - XGBoost, LightGBM ו CatBoost - קבעו תקן חדש על ידי למידה אופטימלית נעדרים ערכיים מקצה לקצה, לעתים קרובות מניב דיוק חיזוי גבוה ללא כל preמעבדה בסופו של דבר, התרגול הטוב ביותר הוא להעריך באופן שיטתי כמה שיטות על סט אימות, באמצעות ידע דומיין כדי לחדד את הבחירה.

(ב) [ה]ה']: [ה'] [ה']'[ה]'[ה]'[דרוש מקור]]'[דרוש מקור], [ה']], [ה']'[ב[[המאה ה'], ו[[המאה ה-20]], ו[[1924]]]], [[1924]]]]]]]]