Table of Contents
הבנת מודל עץ
עצי ההחלטות הם מעמד יסודי של אלגוריתמים למידה מבוקרים המשמשים הן למשימות סיווג והן לתוקפנות.מבנה האינטואיטיבי שלהם - גרף דמוי עץ של החלטות והשלכות אפשריות שלהם - הופך אותם לפירושים מאוד.כל צומת פנימי מייצג מבחן על תכונה, כל ענף מתאים לתוצאה של המבחן, וכל עלה אין תווית ייצוגית או שקיפות מספרית.
עם זאת, למרות הפשטות שלהם, עצי ההחלטות רגישים מאוד לתצורה שלהם.שינויים קטנים בהיפרפרפרפרפרמטר יכולים לשנות באופן דרמטי את עומק העץ, המורכבות, ואת יכולת ההכללה.ללא כוונון זהיר, עץ עשוי להתאים את נתוני האימון - להרות רעש ולא לדפוסי למידה - או תחת התאמה על ידי להיות רדודה מדי כדי ללכוד יחסים משמעותיים.
המונחים: Hyperparameter Tuning
אלגוריתמי עץ החלטות חושפים כמה היפרפרמטרים ששולטים כיצד העץ בנוי. פרמטרים מרכזיים כוללים:
- עומק:0 (מקסימום: 1) מגביל את מספר הרמות בעץ.עץ עמוק יותר יכול לייצר אינטראקציות מורכבות יותר, אך סיכונים מתואמים.
- (FLT:0) דגימות מינימליות על עלות: FLT:1 מפרט את מספר המינימום של מקרים של אימונים הדרושים כדי ליצור עלה.ערכים גדולים יותר מעודדים פיצולים כלליים יותר.
- (ב) ,0) דגימות מינימליות לפיצול: FLT:1 המספר המינימלי של דגימות צריך לבצע פיצול דומה למגבלה עלים, זה מונע פיצולים כי הם מדי גריפית.
- (ב) ⁇ :0) תכונות מקסימומיות: FLT:1 שולט מספר התכונות שנחשבות כאשר מחפשים את הפיצול הטוב ביותר. ערכים קטנים יותר להגדיל את אקראיות ויכולים להפחית את הכדאיות.
- (ב) ⁇ :0) ⁇ : (ב) ,התפקיד למדוד איכות מפוצלת, כגון קדחתנות או אנטרופיה לסיוג, ופירושו טעות מרובעת (MSE) לתוקפנות.
- האסטרטגיה של FLT:0 splitter: אסטרטגיה 1:1 לבחור את הפיצול בכל צומת.האסטרטגיה הסטנדרטית "הטובה" מעריכה את כל הפיצולים האפשריים, בעוד "random" בוחרת תת-קבוצה אקראית.
- (ב) ירידה בצמצום הצמצום: 1) סף להפחתה באימפולס הנדרש להצדיק ענפים לא רלוונטיים.
- (ב) משקל:0 (הראשונה ל-[[1924]]) מקנה את הרגישות לחוסר איזון מעמדי על ידי הקצאת עונשים גבוהים יותר לשיעורי מיעוט לא מסווגים.
באופן ידני לחקור שילובים של פרמטרים אלה הוא לא מעשי, במיוחד כאשר הנתונים גדלים בגודל ובמדידות. מדעני נתונים מסתמכים לעתים קרובות על ניסיון או אינטואיציה כדי לצמצם את מרחב החיפוש, אבל גם אז, את התצורה האופטימלית ניתן להחמיץ.כוונון ידני הוא גם זמן-consuming - ניסוי יחיד יכול לקחת דקות עד שעות, ועשרות ריצות עשוי להיות צורך להתכנסות על מודל טוב זה בקבוק השראה של כלי בחירה אוטומטיים.
מה זה AutoML?
אוטומטי Machine Learning (AutoML) מתייחס למערך של טכניקות וכלים ששותפים לתהליך הסופי של יישום למידת מכונה לבעיות בעולם האמיתי. בעוד היקף AutoML יכול לכלול נתונים preprocessing, הנדסת תכונה, בחירת אלגוריתם ומודל פריסה, היישום המשפיע ביותר שלו הוא אופטימיזציה היפר-פרמטר ומודל.
AutoML מכנה למידה על ידי צמצום הצורך במומחיות עמוקה.לא- ⁇ s יכול להעלות את תחילת הנתונים ולקבל מודל באיכות גבוהה ללא פרמטרים כוונון ידני.עבור מומחים, AutoML מאיצה את הניסוי ומשחררת זמן למשימות ברמה גבוהה יותר כמו הנדסה ופרשנות תכונה.הטכנולוגיות מפתח מאחורי AutoML כוללות אסטרטגיות חיפוש, למידה ושיטות הרכב.
חיפוש גריידי
חיפוש גריידי הוא שיטת החיפוש הממצה הפשוטה ביותר.המשתמש מציג קבוצה של ערכים אפשריים עבור כל היפרפרפרמטר, ואת הכלי להעריך כל שילוב.לדוגמה, אם אנו רוצים לכוון עומק מקסימלי ודגימות מינימום על עלון, עם 5 ערכים כל אחד, חיפוש מעריך 25 שילובים פשוטים, בעוד רשת סובלת מקללות של מימד: כמו מספר של היפרדות, גדל מספר של הערכות מבטיחות על פני השטח גם כן.
חיפוש אקראי
חיפוש אקראי, שהוצג על ידי ברגסטרה ובנג'יו (2012), דגימות ערכים היפר-פרמטר מהתפלגות מוגדרת.במקום לבדוק את כל השילובים, הוא בוחר מספר קבוע של תצורה אקראית. באופן מפתיע, חיפוש אקראי לעתים קרובות מחוץ לפורפורפורפורמציה ברשת כי הוא חוקר ערכים שונים יותר לפרמטר, במיוחד כאשר כמה פרמטרים יש השפעה מועטה על הביצועים.זה גם קל יותר כדי להמקבילה, וניתן לעצור תוצאות מוקדמות אם הם משביעי רצון.
אופטימיזציה Bayesian
אופטימיזציה Bayesian היא גישה מתוחכמת יותר אשר בונה מודל פרוביביליסטי של הפונקציה האובייקטיבית (ביצועים מודל) ומשתמשת בו כדי לבחור את ה- Hyperparameters הבאים כדי להעריך.מודלים הפונדקאית נפוצים כוללים תהליכים גאוסיים, יערות אקראיים, ועץ-מבנים estimators (TPE אופטימיזציה של Bayesian אופטימיזציהs (מבחן אזורים לא ידועים) וניצול (מונים ליד נקודות טובות ידועות בדרך כלל דורשות סבירות) כדי לבצע בדיקות אופטימליות אופטימליות עבור תהליכים מתאימים יותר.
שיטות מתקדמות אחרות
מעבר לטכניקות הליבה הללו, כלי AutoML כוללים:
- (ב) אלגוריתמים אבולוציוניים (התכנות גנטית) אשר מפתחים אוכלוסייה של מודלים לאורך דורות.
- [ה]ה' [ה']'[דרוש מקור] [ב] ו[ה] [ה']'[2]'[דרוש מקור]'[דרוש מקור]
- (הופנה מהדף NAS) ,0) חיפוש אדריכלות ציורי (NAS)FIRLT:1 for Deep Learning, אם כי פחות רלוונטי לעצי החלטות.
- (FLT:0) בחירת בחירה של קונסול 1:1 שבו AutoML משלב באופן אוטומטי מודלים מרובים לשיפור ביצועים.
מערכת ההפעלה AutoML for Decision Trees
כמה קוד פתוח ופלטפורמות AutoML מסחריות כוללות אלגוריתמים של עץ ההחלטות בחלל החיפוש שלהם.כאן הם הבולטים ביותר:
(ב) ⁇ ⁇ ⁇ ⁇ ⁇
Auto-sklearn הוא תחליף טיפות עבור scikit-learn. זה משתמש אופטימיזציה Bayesian עם meta-learning כדי חם כוכב החיפוש.זה להעריך מגוון רחב של מטיפים ותוקפים, כולל עצי החלטות, יערות אקראיים, ⁇ מגביר מכונות, ועוד. עבור עצי אבטחה באופן ספציפי, Auto-sklearning עומק, קריטריון מפוצל, דגימות מינימלי, דגימות, ומבצעים פרמטרים אחרים של זה גם שילוב מודלים מתקדמים.
(ב) ◄ ⁇ ⁇
פלטפורמת AutoML של H2O מיועדת לשימוש בדרגות ובמפעלים.זה פועל חבילה של אלגוריתמים כולל עצי החלטות, יערות אקראיים, XGBoost, LightGBM, ולמידה עמוקה, ולאחר מכן רכבות מודל אנסמבל מקודש לשלב אותם. Hyperparameter כוונו באמצעות חיפוש אקראי וחיפוש רשת על פני טווחים מוגדרים מראש. H2O AutoML מספק טיפול אוטומטי של ערכים חסרים, קטגורית, ו לעצור את Python מוקדם ו-ידי שימוש ב-ידי שימוש ב- API.
(ב) ◄ ⁇
TPOT (כלי אופטימיזציה של פיטורי מבוסס על צינורות צינורית) היא מערכת AutoML המבוססת על תכנות גנטי.זה מתפתח צינורות למידה מכונה שלמים, כולל מבחר תכונה, עיבוד מראש ומודל בחירה. עצי החלטות הם אחד הלומדים הבסיס TP יכול לבחור.זה החיפוש האבולוציוני שלה מניב שילובים חדשים כי לעתים קרובות החוצה צינורות מעוצבים באופן ידני. OT זמין כמו חבילת Python והוא פופולרי במיוחד בהגדרות חינוכיות.
(ב) Google Cloud AutoMLsFLT 1
Google Cloud AutoML מספקת שירות מנוהל לבניית מודלים מותאמים למינימום מאמץ.בעוד שהאדריכלות הבסיסית אינה מתועדת בפומבי, ידוע לכלול מודלים המבוססים על עץ כמו ⁇ מגביר עצים עבור נתונים לשוניים.הפלטפורמה מטפלת בנתונים המתפצלים, היפר-פרפרפרמטר כוונון, ופריסה באופן אוטומטי.זה אידיאלי עבור קבוצות שרוצים להימנע מניהול תשתיות ומעדיפים מודל לשימוש בתשלום.
(ב) ויקרא י"ד:
פותח על ידי אמזון, AutoGluon מתמקדת בפשטות ובעוצמה.זה אוטומטית רכבות מודלים מרובים, כולל עצי החלטות, ומשלב אותם לתוך הרכב.כלי החיזוי התעודה האוטומטי שלה ידוע לייצר תוצאות המדינה של האמנות על נתונים רבים של קריטריונים עם קלט קטן. AutoGluon משתמש בשילוב של אופטימיזציה בייסיאנית וערימות כדי לחדד מודלים.
שלב-בי-Step: שימוש ב- AutoML כדי לתקן עץ החלטה
כדי להמחיש את התהליך, לשקול משימה סיווג בינארי באמצעות ה- UCI הלב , המטרה היא לחזות נוכחות של מחלת לב המבוססת על תכונות כמו גיל, כולסטרול, סוג כאב החזה.
1.הכנת הנתונים
לנקות את הנתונים, לטפל בערכים חסרים, וקידוד משתנה קטגוריאליים.רוב כלי AutoML מבצעים את השלבים האלה באופן אוטומטי או לספק פרמטרים כדי לשלוט בהם.
בחרו מסגרת AutoML
בחר מסגרת שמתאימה לסביבה שלך.עבור משתמשי Python, Auto-sklearn או TPOT הם אפשרויות קלות משקל.עבור נתונים גדולים יותר או צרכי ייצור, H2O AutoML או AutoGluon הם מועדפים.
3.הגדירו את החיפוש
(הופנה מהדף , §) , לדוגמה, מרחב החיפוש של יתרת עץ ההחלטות (Dreperparameters) , מסגרות רבות מספקות טווחי ברירת מחדל (לדוגמה, Auto-sklearn) באופן אוטומטי טווחי טווח עבור FLT:0, FLT:1, 2, וכו 'אתה יכול להגביל באופן אופציונלי או להרחיב את טווחים אלה בהתבסס על ידע קודם.
4.לרוץ בתהליך AutoML
ביצוע החיפוש.המסגרת תאמן ותבחן מודלים של עץ החלטות על פני השטח היפר-פרפרמטר.זה לוגמל את מדדי הביצועים (למשל, AUC, דיוק, F1) על סט אימות. כלים מתקדמים גם להשתמש בסתבכות צלב כדי להפחית את ההתאמה.אתה יכול לפקח על התקדמות; כמה כלים לספק מנהיגים חיים.
להעריך את המודל הטוב ביותר
לאחר השלמתו, לבדוק את תצורת עץ ההחלטה העליונה.בדוק את הביצועים שלה על סט מבחן שנערך-out.דמיין את מבנה העץ כדי להבטיח את הפירוש נשמר - עצים עמוקים עם אלפי צמתים עשויים להיות פחות מפרשים.אם המודל הטוב ביותר הוא יער אקראי או ⁇ להגביר את ההרכב, לשקול את המסחר בין דיוק וסבירות.
6.הפנייה או הסירוב
הייצוא המודל לתבנית ייצור (למשל, PMML, ONNX או Pickle) לחלופין, ייתכן שתרצה לחדד עוד על ידי התמקדות בחיפוש בטווח צר יותר סביב הפרמטרים הטובים ביותר, או על ידי שילוב של שלבים הנדסיים תכונה שגלו על ידי תהליך AutoML.
היתרונות של בחירת עץ ההחלטות האוטומטית
- יעילות:0 (Timeיעילות: ההרחבה 1) AutoML יכולה לחקור אלפי תצורה במקביל, השלמת שעות מה שעשוי לקחת מדען נתונים ידני.
- (FLT:0) ביצועי סופריאור: חיפוש אוטומטי 1 (FLT:1) מגלה לעתים קרובות שילובים היפר-פרפרפרמטר כי כוונון ידני מפספס, המוביל לדיוק גבוה יותר, דיוק, או זיכרון.
- (FLT:0) ניכוי ההטיה האנושית: FLT:1rea מדענים נתונים עשויים להיות העדפות עבור פרמטרים מסוימים ברירת מחדל (למשל, הרגל של הגדרת max עמיק=10) חוקר את החלל ללא הטיה כזאת.
- (FLT:0) חידושים של עבודה אוטומטיתML יכולים להיות נשלטים מחדש על ידי גרסה ומופעלים עם אותו זרע אקראי, מניב תוצאות זהות - קריטיות עבור שבילי ביקורת וציות רגולטוריות.
- (FLT:0) AccessibilityFLT:1: לא ⁇ s יכול לבנות מודלים עץ החלטות יעיל ללא ידע מעמיק של כוונון היפרפרפרמטר, מה שהופך את המכונה למידה נגישה יותר על פני ארגונים.
- (FLT:0) הנדסת תכונות אוטומטיות הנדסה הנדסה 1FLT: כמה כלי AutoML גם לייצר תכונות חדשות (למשל, שילובים פולינומיים, בינינג) שמשפרים את ביצועי עץ ההחלטות, משהו שרטוט ידני בדרך כלל מזניח.
הגבלות ושיקולים
למרות היתרונות שלה, AutoML הוא לא תרופת פלאצ'ה.הבנת המגבלות שלה עוזרת להציב ציפיות מציאותיות.
עלויות פיצוי
AutoML יכול להיות בעל משאבים.ניהול מאות הערכות מודל על נתונים גדולים דורש זמן CPU / GPU משמעותי וזיכרון.פתרונות מבוססי ענן, אבל עלויות יכול להוסיף.זה חכם להגדיר תקציב ולהשתמש בטכניקות עצירה מוקדמת.
סיכון של overfitting
כאשר AutoML מחפשת חלל גדול, ייתכן שהוא ימצא תצורה המבוצעת היטב על נתוני אימות אך נכשל בנתונים בלתי נראים.זה מצטמצם באמצעות ביטול צלב, אך הבעיה נותרה אם החיפוש אגרסיבי מדי.חלק מהמסגרות ליישם סדיר נוסף או מעדיף מודלים פשוטים יותר באמצעות עונשים עונשים.
אובדן של חוסר יכולת
עצי ההחלטות מציעים באופן טבעי פירוש, אבל כאשר AutoML בוחר עץ עמוק מאוד או אנסמבל מורכב, פרשנות הופכת קשה.אם הפרשנות היא דרישה קפדנית, ייתכן שיהיה עליך לנטר את החיפוש למודלים פשוטים יותר או להשתמש בשיטות הסבר פוסט-הואק כמו SHAP.
תלות באיכות הנתונים
AutoML אינו מתקן בעיות נתונים בסיסיות. Garbage in, אשפה חלת.אם ל-Dataset יש תוויות רועשות, חוסר איזון מעמדי חמור, או מעט מדי דגימות, לא כמות של כוונון היפרפרמטר תייצר מודל טוב.
Black Box Nature
טכניקות מתקדמות של AutoML (למשל, אופטימיזציה של בייסיאנוס, תכנות גנטי) יכולות להיות ⁇ .הבנת מדוע תצורה מסוימת נבחרה לא ברורה, אשר עלולה לעכב את האמון בייצור.חלק מהמסגרות מספקות יומני ניסוי נרחבים כדי להגדיל את השקיפות.
שילוב לתוך MLOPS ו-הפקה
בחירת מודל אוטומטית עם AutoML מתאימה באופן טבעי לתוך צינור MLOps בוגר.השלב AutoML יכול להיות מופעל בכל פעם שמידע חדש נאסף, אימון מודלים על לוח זמנים או על נתונים סחף זיהוי.כלי AutoML רבים לייצא מודלים בפורמטים סטנדרטיים שניתן להשתמש בהם באמצעות APIs או מוטבעים במערכות תוכנה גדולות יותר.עבור עצי החלטות באופן ספציפי, יישום קל (למשל, פיסול למידה) הם קלים לפרוססים על גבי מכשירים נמוכים או פשטות.
חשוב לצמד AutoML עם מעקב ניסיוני חזק.כלי כמו MLflow או נפטון יכולים להזין את כל שילובי ה- hyperparameter ואת מדדי ביצועים, המאפשרים ביקורת והשוואה בין ריצה.שליטה בגירסה עבור נתונים וקוד בשילוב עם תשתית-כקוד (למשל, Docker, Kubernetes) מבטיח כי תהליך AutoML הוא הדדי והיקף.
כיוונים עתידיים
תחום AutoML ממשיך להתקדם. Meta-learning, שבו מודלים לומדים מניסויים קודמים ועד לחידושים חמים, כבר בשימוש על ידי מסגרות כמו Auto-sklearning. שיפורים עתידיים עשויים לכלול שיטות אופטימיזציה רב-נאמנות יעילות יותר, הנדסת תכונה אוטומטית הקשורה למבחר מודל, ושילוב עם הקצאה סיבתית. עבור עצי החלטות, גישות היברידיות המשלבות יכולת של עצים קטנים עם דיוק של הרכבים - עשוי להיות מסוגל להפוך למכונות חיפוש בולטות יותר.
בנוסף, AutoML מוזן מתפתח, ומאפשר מודלים לכוונון על פני נתונים מבוזרים ללא ריכוז נתונים רגישים.זה רלוונטי במיוחד לבריאות ופיננסים, שבו עצי ההחלטות נפוצים ותקנות הפרטיות של נתונים הם קפדניים.
מסקנה
בחירת מודל אוטומטי עץ הבחירה עם כלי AutoML מייצגת התקדמות משמעותית הן באיכות הפרודוקטיביות והן המודל. על ידי אלגוריתמי חיפוש כגון אופטימיזציה Bayesian, חיפוש אקראי, וטכניקות אבולוציוניות, מתרגלים יכולים לזהות במהירות תצורה של היפר-פרמטר הממקסימה את הביצועים תוך שמירה על כמויות עצומות של עבודה ידנית. מסגרות כמו Auto-sklearns, H2OML, TP, ו- AutoGluon לעשות זאת כדי נגיש לשילובים ו-Macts אמין, ו-Rips.
למרות עלויות ציות וצורך אימות זהירה, היתרונות - רווחיות דיוק, חיסכון זמן, התחדשות, ודמוקרטיזציה - כמעט עולה על החסרונות. כמו טכנולוגיית AutoML בוגר, זה יהיה מרכיב חיוני של כל ערכת הכלים של כל מכונה לומדת, במיוחד עבור מודלים מפרש עץ כי נשאר בסיס בתעשיות רבות.
(ב) ללמוד עוד על אופטימיזציה של היפר-פרפרמטר ומסגרות AutoML, מתייחס לתיעוד הרשמי של (FLT:0Auto-sklearnFLT:1,FLT:2H2O AutoMLirFLT 3: 3), ו-FLT:4TPFLT:5.