Table of Contents
מבוא לעץ החלטות והנדסת תכונות
עצי ההחלטות הם בין האלגוריתמים הנפוצים ביותר בלמידה ממוחשבת בפיקוח בשל הפשטות, הפרשנות, ויכולת להתמודד הן עם סיווג והן משימות רגרסיה.הם מודל החלטות כמבנה דמוי עץ שבו כל אחד מהם בודק תכונה, כל ענף מייצג תוצאה של הבדיקה, וכל עלה אין ערך או תווית ייצוגית.
הנדסה תכונה היא תהליך של הפיכת נתונים גולמיים לייצוגים אינפורמטיביים שמשפרים דיוק מודל. עבור עצי ההחלטות, זה לעתים קרובות אומר יצירת תכונות שמתאימות להתנהגות הרודנית, הבלתי-מסוגלת של האלגוריתם. במאמר זה, אנו נבחן את המכניקה הפנימית של עצי ההחלטות, לעבור דרך טכניקות הנדסיות חיוניות, ודן שיטות מתקדמות כגון קידוד, אופטימיזציה היפר-פרמטר, ואסטרטגיות כי יכול להגביר באופן דרמטי את הביצועים של עץ, כדי למנוע החלטות מעשיות כדי למנוע מודלים מעשיים כדי ליצור מודלים של בניית נתונים באופן כללי.
כיצד פועל עץ ההחלטות
עץ החלטות מפצה מחדש את המרחב המאפיין לאזורים הממזערים את חוסר הכדאיות (לסיווג) או השחלות (לגבי תוקפנות) בכל שלב, האלגוריתם בוחר את הנקודה המאפיין והמפולגת שנותן את הפרידה הטובה ביותר על פי קריטריון כגון אי-השיוט של גיני, אנטרופיה, או טעות מרובעת זו נמשכת עד למצב של הפסקת-לדוגמה, להגיע לדגימות, ללא שיפור מינימלי או שיפור נוסף.
המונחים: Tree Splitting
הליבה של כל עץ החלטה שוכנת בלוגיקה המתפצלת.לעצים סיווג, אמצעי נחיתות נפוצים כוללים:
- (ב) [ה]:0] ⁇ [ה] [ה]] [ה]], [ה], [ה], [ה]], [ה]]]], [ה]]], [ה], [ה], [ה], [ה]ה], [ה]]העיקרון] הוא [ה] [ה'[ה'] [ה'[ה'[ה']']']'[ה']'[ה'[ה']']'[ה'[ה'[ה'[ה'[ה'[ה'[ה']']'[ה']']']'[ב[[ה']']']']']']'[ב[[ה']']']']']']']']'[ה']']']']'[ה']']'[ב[[ה']'[ה']']']'[ב[[ה']'[ה']']'[ה']']'[ב[[ה'[ה'[ה'[ה
- (FLT:0)EntropyphFLT:1 - מבוסס על תורת מידע, הוא מסמיך את אי הוודאות בצומת.המידע מרוויח (החזרה במנזר) משמש כדי לבחור את הפיצול הטוב ביותר.
עבור עצי רגרסיה, הקריטריון הטיפוסי הוא ההפחתה בשחלות או טעות מרובעת.עץ מנסה ליצור בלוטות ילדים שבו ערכי המטרה הם הומוגניים ככל האפשר.
מכיוון שעצים החלטות הם לא דו-פרמטריים וגמישים, הם יכולים לעצב מערכות יחסים מורכבות, לא ליניאריות מבלי לדרוש תכונת סקאלה מפורשת.עם זאת, גמישות זו גם גורמת להם לתועלת יתר כאשר העץ גדל עמוק מדי או הנתונים מכילים תכונות רועשות.
תפקיד הנדסה של תכונות בעץ החלטות
הנדסה תכונה ממלא את הפער בין נתונים גולמיים לבין מה עץ החלטה יכול ללמוד ביעילות. בעוד העצים חזקים אל מחוץ לערים ולא דורשים נורמליזציה תכונה עבור פיצול, הם נהנים מאוד מתכונות כי קוד ידע דומיין משמעותי. תכונות מונדסות עניים יכולים להוביל לפיצול תת-אופטימי, עומק עץ מוגבר, וצמצום הכללה.
תכונות טובות מסייעות לעצי החלטות:
- מצא ניקוי מתפצל מוקדם, צמצום עומק העץ ומורכבות.
- לתפוס אינטראקציות בין משתנים שהעץ עלול להחמיץ אחרת ללא ענפים עמוקים.
- יד חסרה נתונים בחסד על ידי קידוד זה כקטגוריה אינפורמטיבית נפרדת או באמצעות אימפולס המשמרת הפצה.
- שיפור העוצמה לקלטים לא רלוונטיים או רועשים על ידי צמצום מרחב החיפוש לפיצולים.
המונחים: categorical Variables
עצי ההחלטות לא יכולים לעבוד ישירות עם טקסט או תוויות קטגוריות.שתי אסטרטגיות הקידוד הנפוצות ביותר הן:
- (ב) ,0) ⁇ FLT 1 - יוצר עמודות בינאריות לכל קטגוריה.זה עובד היטב כאשר מספר הקטגוריות הוא קטן (למשל, ונעל;20) והקטגוריות אינן ניתנות לתפוצה.עץ יכול לחלק קטגוריות בודדות.
- (FLT:0)Label ⁇ FLT:1) - להקצות קודים לקטגוריות.בעוד פשוט, זה יכול להצביע על מערכת יחסים אודין שעשויה להטעות את העץ.
- (FLT:0)Target ⁇ FLT:1 - להחליף כל קטגוריה עם משמעות משתנה היעד עבור קטגוריה זו (עם חלק כדי להימנע מהתאמה יתר) זה יכול להיות חזק עבור תכונות עתירה גבוהה אבל חייב להיעשות בזהירות כדי למנוע דליפת נתונים.
כאשר מתמודדים עם תכונות קפליות גבוהות (למשל, קוד ZIP עם אלפי רמות), טבילה אחת הופכת לא מעשית. במקרים כאלה, מיקוד או קבוצה של קטגוריות נדירות לתוך דלי "אחר" יכול לשמור על מידע ללא התפוצצות מימד.
עקבו אחרי Missing Data
רוב יישומי עץ ההחלטה יכולים להתמודד עם ערכים חסרים מבפנים על ידי הפניית דגימות לתעשיית הרוב.עם זאת, התנהגות ברירת המחדל זו היא לעתים קרובות תת-אופטימית. תוצאות טובות יותר מגיעות מזיהום מפורש המיישר עם מבנה הנתונים.
- (ב) ,0) ,מאן/מתווך, אימפולסים 1 (ה) – פשוט ומהיר, אך שטוח יותר, אך מתפצלות שטוחות, ויכול להפלות.
- (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (ב) יצירת אינדיקטור "מניעה" 1 (FLT:0) – תכונה בינארית נפרדת שמסמן אם הערך חסר במקור.זה מאפשר לעץ ללמוד דפוסים סביב החסרות עצמו.
- (ב) [15] (ב) ,0) ,NN או תוקפנות (הראשונה ל"ה) – יותר מתוחכמת אך אינטנסיבית מבחינה חישובית, ניתן להעריך אותה כאשר מנגנון הקוצרות הוא אינפורמטיבי.
עבור עצי ההחלטות, הגישה "האינדיקטור המניע" היא חזקה במיוחד משום שהעץ יכול להחליט אם ענף הנתונים החסר מתנהג אחרת מערכים שנצפו.
עץ סקר והחלטות
תפיסה מוטעית נפוצה היא שעצי ההחלטות דורשים סקאלה תכונה. כי פיצולים מבוססים על השוואות הסף, גודל תכונה לא משפיע על Gini או entropy רווח - רק את העניינים המזמין. לכן, נורמליזציה או סטנדרטיזציה הוא מיותר עבור עצי החלטה טהורים.עם זאת, קנה מידה הופך חשוב בעת שימוש בשיטות הרכב כמו XGBOst או LightGBM בשילוב עם סדירזציה, או כאשר מעבדים אלגוריתמים מראש של אלגוריתמים.
הנדסה יעילה לעץ החלטות
מעבר לקידוד בסיסי ומניעה, כמה טכניקות מתקדמות יכולות לשפר במידה ניכרת את ביצועי עץ ההחלטות.
יצירת תכונות אינטראקציה
עץ החלטות יכול באופן טבעי לייצר אינטראקציות על ידי יצירת פיצולים מוצלחים על תכונות שונות.לדוגמה, עץ עשוי קודם פיצול על הכנסות, אז על גיל בתוך כל קבוצת הכנסה.עם זאת, הצמיחה הרודנית של העץ עשויה להחמיץ אינטראקציות מסוימות אם הם דורשים ענף עמוק.על ידי יצירת תכונות אינטראקציה באופן ידני - כגון FLT:0 או FLT:1 - אתה מאפשר לעץ לאסוף יחסים אלה מוקדם, רדודה יכול להפחית את העומק ולהפחית את יכולת התפוררות.
ניתן ליצור תכונות אינטראקציה כמו:
- שילובים רב-תכליתיים (מוצר של שני תכונות)
- תכונות Ratio (למשל, יחס חוב להכנסה)
- דגלים בוטים לתנאים משולבים (למשל, "is Young and High Income")
תכונות Binning and Discretization
בעוד שעצים החלטות יכולים להתמודד עם תכונות רציף, לפעמים מינוף לתוך מרווחים יכול לעזור לנהל נתונים רועשים או להדגיש סף לא ליניארי.לדוגמה, במקום להשתמש בעידן גולמי, יצירת בינאריות כמו "0-18", "19-35", "36-60" יכול לפשט את העץ כאשר מערכת היחסים אינה מונוטונית לחלוטין.
תכונות רלוונטיות
אין טכניקה הנדסית כוללת מחליפה ידע דומיין. במודל זיהוי הונאה, למשל, יצירת תכונות כגון "מספר עסקאות בשעה האחרונה" או "סכום העסקה של ממוצע ביחס לקו הבסיס של המשתמש" מניב לעתים קרובות הישגים גדולים יותר מאשר שינויים גנריים.תמיד לשקול את ההקשר העסקי או המדעי בעת תכנון תכונות.
טכניקות לקבלת תוצאות טובות יותר של עץ
גם עם תכונות מצוינות, עץ החלטות עדיין יכול להיות מתאים או underperform אם לא כראוי מוגבל.טכניקות הבאות לטפל הן מודלים כוונון ואסטרטגיות הרכב.
בחירת
עצי ההחלטות מבצעים באופן טבעי את בחירת התכונה באמצעות תכונות רק כדי להפחית את החוסר האונים.עם זאת, כאשר תכונות רבות שאינן רלוונטיות קיימות, העץ עשוי עדיין לפצל אותם על ידי הזדמנות והתאמה יתר. השתמש בשיטות בחירה תכונה לפני אימון:
- (ב) ,0) שיטות מפרש 1 (הופנה מהדף ), תואמים עם מטרה, מבחן צ'י-סקוויר, מידע הדדי.
- (ב) [ה]הסברים [ה]]: [ה] [ה]] [ה]], [ה], [ה], [ה],]], [ה], [ה]], [ה], [ה], [ה],], [ה],], [הההההההההההההתחילה] היא מסלקת את התכונות הפחות חשובות.
- (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
ביטול תכונות רועשות מפחית את מרחב החיפוש, המוביל לעצים קטנים יותר ולהכללה טובה יותר.
Pruning
יזום הוא ההגנה העיקרית נגד התאמת עצי ההחלטות.יש שתי גישות עיקריות:
- (ב) ,(ה) ,התחילה (התחילה) ב[[1924]])]], [[1924]]]], [[1924]]]]]], [[1924]]]]]], [[1924]]]]]], [[1924]]]]]]]]]], [[1924]]]]]]]], [[1924]]]]]], [[1924]]]]
- (FLT:0)Post-pruning (המורכבות עלות) Frun:1 - גדל עץ מלא ולאחר מכן ענפים אחוריים שתורמים מעט לביצועים, באמצעות פרמטר מורכבות (ccp alpha in scikit-learning) שיטה זו יכולה להניב גדלים עץ אופטימליים ללא מגבלות עומק ידני.
לאחר אימון הוא בדרך כלל יותר מונע נתונים ויכול למצוא את העודף הטוב ביותר בין התאמה למורכבות.
Hyperparameter Tuning
עצי ההחלטות חושפים כמה היפר-פרפרמטרים השולטים בצמיחה ובכללה.חיפוש רשת שיטתי או חיפוש אקראי על הפרמטרים הבאים יכולים להביא רווחים משמעותיים:
- (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (ב) [15] ⁇ samples splitFeloLT:1 ; מספר מינימלי של דגימות נדרש כדי לחלק צומת פנימי.
- (ב) [15] ⁇ samples leafphFreaLT:1 ; דגימות מינימליות נדרשות להיות עלה צומת. Smooths את המודל על ידי מניעת עלים עם דגימות מעט מאוד.
- (ב) [15] ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (ב) [15] , ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
כאשר כוונון, תמיד השתמש בהגדרה צלבית כדי להימנע מהתאמה יתר למערכת אימות.
שיטות אנסמבל
עצי החלטה בודדים הם מודלים של שרטוטים גבוהים.שלב עצים רבים באנסמבל מפחית באופן דרמטי את השחלות תוך שמירה על הטיה נמוכה.
- (FLT:0Random ForestsFLT:1) - בנו עצים רבים על דגימות מפוספסות, כל אחד באמצעות תת-קבוצה אקראית של תכונות. חיזוי סופי הוא הצבעת הרוב (הההדרגה) או ממוצע (העברה) יערות אקראיים הם חזקים, להתמודד עם נתונים עתירי משקל גבוה, והם פחות נוטים להפריז יותר מעץ אחד.
- (FLT:0)Gradient Boosting Machines (GBMori)FLT) 1:1 - עצים בנויים באופן שווה, כל טעות תיקון של ההרכב הקודם. יישום פופולרי כוללים XGBoost, LightGBM, ו CatBoost. GBMs לעתים קרובות להשיג ביצועים המדינה-of-art אבל דורש כוונון זהיר של שיעור למידה, עומק, ויחס תת-קרקעי.
- (ב) ;0) עצים (המכונים "עצים אקראיים" (Extremelyized Trees) FLT:1 - דומים ליערות אקראיים אבל עם עוד אקראיות: סף מפוצל נבחרים באופן אקראי במקום באמצעות מיניזציה בלתי פתיר.זה יכול להפחית את השחלות עוד יותר, אם כי לפעמים בעלות עלייה בהטיה קלה.
עבור רוב הבעיות המעשיות, החל עם בסיס יערות אקראי ולאחר מכן מנסה GBM מכוונן מניב תוצאות מצוינות. שתי המסגרות זמינות בספריות פופולריות כגון scikit-learn, XGBoost, ו LightGBM.
פיתוח מעשי עבור פרויקטי עץ החלטות
כדי לחזק את הרעיונות לעיל, הנה זרימת עבודה מעשית ליישום עצי החלטות עם הנדסה תכונה:
- (FLT:0)Exploratory Data Analysis (EDA)BuildFLT:1) - הבנת סוגי נתונים, דפוסים חסרים, הפצה וקשרים.
- (ב) ,0) הנדסת תכונות בסיסיות (FLT:1) - Encode Categoricals, ערכים חסרים ללא סייג עם דגלי אינדיקטור, ליצור תכונות דומיין פשוטות.
- (ב) ,0) , 000 עץ יחיד בסיס עץ 1 (הביצועים המנציחים וזיהוי פוטנציאל overfitting (עץ גדול, דיוק אימון מושלם).
- (ב) ,0)Add תכונות מתקדמות של ההרחבה: תנאי אינטראקציה, בינינג, מיקוד, שם מתאים להשוות את שיפור ביצועים באמצעות גלגולי-התמדה.
- (ב) ,0) בחירה של תהילים 1 (FLT) - השתמש בחשיבותו של יער אקראי או שיטות סינון כדי להפחית את המימדיות.
- (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (FLT:0) בניית בניין ארסאל:1 - רכבת יער אקראי או ⁇ מגביר את המודל. Tune תוספות ספציפיות ספציפית (מספר העצים, שיעור הלמידה, תת-קרקעי).
- (ב) ,0) ,ההסבר והפרשנות (FLT:1), השתמש במזימה בעלת חשיבות, בתלות חלקית, ותדמיון עץ כדי לאמת שהמודל תואם ידע דומיין.
מסקנה
עצי ההחלטות נשארים אבן הפינה של למידת מכונה מכיוון שהם מפרשים, דורשים מעט נתונים מראש, ויכולים ללכוד דפוסים מורכבים.עם זאת, הביצועים שלהם מושפע מאוד מהאיכות של תכונות להאכיל אותם.על ידי שליטה בטכניקות הנדסיות תכונה - מ ⁇ קטגורית ו נעדר טיפול בנתונים ליצירת תכונות אינטראקציה ו binning - אתה מעצי החלטה למצוא מתפצלים יותר, כללי יותר.
הישגים נוספים באים מזינוק עסיסי, היפר-פרפרפרמטר, ובמיוחד שיטות הרכב כמו יערות אקראיים ו- ⁇ שיפור.שילוב של תכונות מובנות היטב וגיוון האנסמבל הוא לעתים קרובות ההבדל בין מודל בינוני ואחד כי הוא ביצועים באופן אמין בייצור.
כפי שאתה מחיל את הטכניקות האלה, זכור כי אין כמות של הנדסה יכול להחליף תובנה התחום.תמיד להתחיל עם הבנה עמוקה של הנתונים ואת הבעיה.לקריאה נוספת, לחקור את תיעוד ה- פיסול הרשמי על FLT:0decision עצים irph 1, a מקיפה FLT:2 מונחה להנדסת חשמל 3, ושיטות מתקדמות של דגם 4LTX2FIRSTT:2 משקף את המאפיין שלך, באמצעות דגם הנדסי מלא של הנדסת מכונות חשיבה, באמצעות הנדסת מכונות הנדסת חשמל, ו-FLT5.