Table of Contents
מבוא לעץ החלטות עבור סדרת זמן
עצי ההחלטות הם סוג של אלגוריתמים ממוחשבים בפיקוח המחלקים את המרחב המאפיין לאזורים ועושים תחזיות בהתבסס על כללי החלטות פשוטים.הפירוש שלהם, קלות יישום, ויכולת לטפל בנתונים המספריים והקטגוריים, הפכו אותם לגורם מרכזי במשימות מודלים רבים של מודלים חיזויים.בשנים האחרונות, מתרגלים החלו ליישם עצי החלטות - ואת הגרסאות שלהם - לחיזוי זמן, שבו המטרה היא לחזות את הערכים העתידיים על בסיס שיטות פעולה ספציפיות.
נתוני סדרות זמן מוגדרים על ידי הסדר הזמני שלה, תלות זמנית, ולעתים קרובות התנהגות לא-סטציונלית. עצי החלטה סטנדרטיים מתייחסים לכל מקרה כתלויים וזהים מבוזרים (כלומר, כלומר,), הנחה שאינה מחזיקה כאשר תצפיות הן קשורות אוטומטית או כאשר מגמות ותיבת העונה משתנה לאורך זמן.ללא טיפול הולם, עץ החלטות עלול להיכשל כדי ללכוד את התקופות הבסיסית, הדינמיקה המובילה לחיזוי נמוך יותר, עם דיוק, עם מודלים סטנדרטיים, עם זאת, עם דיוקים, עם מתודולוגיה של למידה מתאימה יותר, עם מודלים סטנדרטיים, עם מתודולוגיה, עם מתודולוגיה, עם מתודולוגיה, עם מתודולוגיה, עם זאת, עם חיזוי יעיל יותר מאשר מודלים סטנדרטיים סטנדרטיים סטנדרטיים מתאימים יותר, עם מתודולוגיה, עם דיוק, עם מתודולוגיה.
מאמר זה מאורגן לשלושה חלקים עיקריים. ראשית, אנו מפרטים את האתגרים העיקריים הייחודיים לסדרת זמן החיזוי עם עצי ההחלטות.ב., אנו מציגים פתרונות מקיפים ושיטות הטובות ביותר, כיסוי הנדסי, טיפול בתחנות הרכב, שיטות הרכב ואסטרטגיות אימות.סוף סוף, אנו מציעים הערות מקבעות על תפקיד עצי ההחלטות בתחזיות מודרניות עבודה ומספקים משאבים חיצוניים למחקר נוסף.
אתגרים מרכזיים של יישום עץי החלטות לסדרת זמן
כדי להשתמש בעצי החלטות ביעילות עבור סדרת זמן, יש להכיר ולענות כמה מכשולים בסיסיים. אתגרים אלה נובעים מהטבע של הנתונים והאלגוריתם.
תלות זמנית ואוטומט
האתגר המשמעותי ביותר הוא שעצי ההחלטות, כברירת מחדל, אין מנגנון מובנה למודל תלות זמנית.בעץ החלטה סטנדרטי, כל שורה של נתונים נחשבת עצמאית, אך בסדרה זמן, הערך בזמן FLT:0tigtureFLT: 1 הוא לעתים קרובות מתואם ערכים ב-FLT:2t-1FLT 3,LT2F:4t-2FIND, כלומר, לדוגמה, אם הם רק תואמים את התכונות של עץ זמני, אם הם רק פעוטות, אם הם יכולים לראות את התכונות האלה.
אי-Stationarity and Concept Drift
הנתונים בסדרה זמן לעתים קרובות מציגים אי-סטיות: המשמעות, השחלות או מבנה הרכב משתנים עם הזמן. מחירי המניות, האינדיקטורים הכלכליים ודפוסי מזג האוויר מראים מגמות, עונות, או שינויים פתאומיים. עץ החלטה המאומנים על נתונים היסטוריים עשוי ללכוד דפוסים שהופכים לא חוקיים בעתיד. כי עצים יוצרים גבולות קשים המבוססים על התפלגות, הם רגישים במיוחד לשינויים בתופעה הבסיסית, אם לא ניתן לנסח מחדש, או למנוע נתונים, אם הם יכולים לנסחים במהירות, אם הם יכולים לנסחים אותם מחדש, אם הם יכולים לנסחים אותם מחדש, אם הם יכולים לנסחים אותם מחדש, אם הם יכולים לנסחים נתונים, אם הם יכולים לנסחים אותם מחדש, אם הם יכולים לנסחים אותם מחדש, אם הם יכולים לנסחים מודלים של מודלים של מותאמים באופן לא מתואמים, או לנסחים אותם מחדש, אם הם יכולים לנסחים אותם מחדש, אם הם שינויים קשים, אם הם יכולים לנסחים, אם הם שינויים קשים, אם הם שינויים רגישים באופן מיידיים, אם הם יכולים להיות מדגמים, אם הם יכולים לנסחים אותם מחדש, אם הם יכולים לנסחים אותם מחדש, אם הם יכולים לנסחים אותם באופן לא מתואמים אותם מחדש, אם הם יכולים לנסחים אותם מחדש,
שימוש בנתונים ללאסטיים או מוגבלים
עצי ההחלטות ידועים בנטייתם לתועלת יתר, במיוחד כאשר גדלים עמוק ללא מגבלות. סדרות זמן מכילות לעתים קרובות רעש, חריגות, מחזורים לא סדירים. עץ עמוק יכול לחלק דפוסים מעוררים שנראים משמעותיים במערכת האימונים, אך אינם כלליים.הטבע השברירי של סדרת זמן מחמיר את הסיכון הזה, כי רכבת אקראית / פיצול הם חסרי ערך; אם עץ מרעיש רעש מהעבר, הוא רק צפוי נתונים נדירים.
מורכבות הנדסה
בניגוד למודלים המיועדים לסדרת זמן (למשל, ARIMA, Exnential Smoothing), עצי ההחלטות דורשים מנבא לתכונות כלי רכב ידניות שלוכדות תבניות זמניות.בחירת אורך מתאים, גודל החלון עבור סטטיסטיקות מתגלגלות, ותומכים חיצוניים דורשים מומחיות דומיין וניסוי משמעותי מדי.
אפשרויות ל-Competance vs. Performance Trade-Off
אחד היתרונות העיקריים של עץ החלטה יחיד - יכולת התערבות - יכול להיות אבוד כאשר משתמשים בהרכבים מורכבים כמו יערות אקראיים או Gradient Boosting. בעוד עץ רדום יחיד מציע כללים ברורים, זה לא יכול להשיג דיוק חיזוי גבוה.עצים עמוק או האנסמבלים לשפר את הביצועים אבל להיות קופסאות שחורות עם מאות עצים, מה שהופך את זה קשה להסביר מדוע תחזית מסוימת נעשתה לעתים קרובות מול יכולת מסחר בין שמירה על תוצאות המדינה.
פתרונות ופעולות טובות ביותר לחיזוי זמן עץ ההחלטות
למרות האתגרים, אסטרטגיות רבות קיימות כדי להתאים את עצי ההחלטות למודלים יעילים של חיזוי.הסעיפים הבאים הוכיחו טכניקות, החל הכנת נתונים למודל כוונון והערכה.
הנדסה ללכידת מבנה טמפל
מאחר שעצים החלטות אינם יכולים להתמודד באופן מהותי עם סדר זמן, הצעד הקריטי ביותר הוא להפוך את סדרת הזמן לבעיה למידה מבוקרת.זה כרוך ביצירת מאטריקס תכונה שבה כל שורה מתאימה לצעד זמן וכוללת:
- (ב) [ה]] [ה]] [ה]] [ה]] [ה]] [ה]]][ה]]]][ה]]]][ה]]]]][ה]]]][ה]]], [ה'[ה'] [ה'[ה']]']']'[ה']']'[ה'[ה'[ה']']'[ה']']'[ה'[ה']'[ה'[ה'[ה'[ה'[ה'[ה'[ה']']'[ה'[ה']'[ה'[ה']']']'[ה']']'[ה'[ה'[ה']']']']']']'[ה'[ה']']'[ה'[ה'[ה']']']'[ה'[ה']'[ה'[ה'[ה'[ה']'[ה']']']'[ה'[ה'[ה'[ה'[
- (FLT:0) סטטיסטיקות החלון של רולינג: FLT:1Build, ממוצעים מתקדמים, סטיית סטנדרטית, דקות, מקס וקווימות מעל חלונות של אורכו משתנה עוזר ללכוד מגמות ותנודתיות. לדוגמה, גלגול 7 ימים פירושו לקודש את הרמה האחרונה תוך כדי חלקה רעש.
- (FLT:0) ,Calendar ותכונות מחזוריות: FIRLT:1; יום של שבוע, חודש, רבעון ואינדיקטורים חג המולד. Encode תכונות מחזוריות באמצעות חטאים ושינויים קוסטין כדי לשמר המשכיות מעגלית (למשל, 23:59 ו 0.
- (FLT:0) רגרסטורים: FLT:1, כולל משתנים הידועים להשפיע על המטרה, כגון מבצעים, אינדיקטורים כלכליים, או נתוני מזג אוויר.
- (FLT:0) תכונות מבוססות זמן: 1FLT להוסיף את הזמן דגימה עצמה (למשל, מספר ימים מאז תחילת) כדי לאפשר לעץ מודל מגמות ליניאריות, אם כי מגמות לא לינאריות נתפסות טוב יותר על ידי תכונות אחרות.
הנדסה תכונה היא אינטגרטיבית. השתמש תובנות דומיין כדי להציג תכונות רלוונטיות בגודל, ולאחר מכן ליישם חשיבות תכונה מעץ מאומן ל-prune לא רלוונטיות.לכלים כגון FLT:0 או FLT:1 עבור החילוץ אוטומטי, אבל תמיד לאמת באופן ידני כדי למנוע דליפת נתונים - לעולם לא להשתמש במידע עתידי כדי ליצור תכונות קודמות.
שימוש ב- non-Stationarity באמצעות טרנספורמציה בנתונים
כאשר הנתונים מציגים מגמות או עונות, ניתן לעשות את לוח הסדרה (הסדר הראשון שונה:0yt) = y(t) - y(t-1)FLT:1 או עונתי שונה (למשל, FLT:2y'(t) = y(t) - y(t) y(t-1) y(t-1)FLT:1 או עונתי שונה (כלומר, שינויים ייצוב) לתבניות דחיסה או ייצוב (C) כדי להסיר את השינויים באופן קבוע (CLC) ולא לשנות את ה- y(CLC) באופן קבוע (CLC)
לאחר טרנספורמציה, התחזית המקורית ניתן לשחזר על ידי מניעת התחזיות השונות.עבור תחזיות מתגלגלות, הצטברות זהירה של הבדלים יש צורך להימנע מפרופיל שגיאות. גישה חלופית היא מודל הסדרה ברמות אבל לכלול מגמה מפורשת ותכונות עונתיות, אם כי לעתים קרובות שונה חזק יותר עבור עצי החלטה כי מסתמכים על פיצולים על סף בהתבסס על גודל.
פתרון נוסף הוא להשתמש בשיטות האנסמבל כמו Gradient Boosting על נתונים שונים, אשר נוטה לייצר שאריות טובות יותר.כאשר משתמשים ביער אקראי, אשר אינו מפרש מעבר לטווח של נתוני אימון, השונה מועיל במיוחד כי הוא מרכז את המטרה סביב אפס ולהפחית סיכון נוסף לזיהום.
שיטות אנסמבל כדי להפחית את הכדאיות ולשפר את הכדאיות
עצי החלטה בודדים משמשים לעתים רחוקות לבד עבור חיזוי עקב שיטות להקות גבוהות לשלב עצים מרובים כדי להפחית את הכדאיות להגביר ביצועים חיזוי:
- (FLT:0Random Forest: FLT:1 בונה עצים רבים על דגימות מפוספסים ותכונות אקראיות תת-קרקעיות. Averaging תחזיות מפחיתות את השחלות.עבור סדרות זמן, להשתמש במגפיים חסומות המכבדות את הסדר זמני (למשל, העברת מגפי בלוק) כדי לשמור על מבנה ההנעה.
- (FLT:0)Gradient Boosting Machines (GBMIR) מוסיף עצים לתקן שגיאות של דגמים קודמים. XGBoost, LightGBM, ו CatBoost הם יישום פופולרי.הם לעתים קרובות Outperform Forest על נתונים מובנים ויכולים מודל מורכב של דפוסים לא ליניאריים עם עצים רדודים (מעמיקים 36), עם צורך זהיר היפר-פרנצילטיבי להפחתה של מספר , כדי למנוע משיעורים (פשוטים).
- (בלטינית:0) Extreme Random Trees (Extra Treesrov): FLT:1 דומה ליער אקראי, אבל עם פיצולי סף אקראיים, עוד צמצום השחלות.זה יכול להיות יעיל כאשר המרחב המאפיין הוא רועש.
האנסמבלים מספקים גם ציוני חשיבות תכונה, עוזר לזהות אילו lags או משתנים חיצוניים הם בעלי חשיבות חיזוי.שימוש בהתמדה או בעל חשיבות מבוססת רווח להנחות בחירת תכונה ופרש התנהגות המודל.
סדרת זמן - Cross-Validation
רצף סטנדרטי של C-fold cross-validation כי נתונים באופן אקראי מחיתולים נתונים עבור סדרות זמן כי הוא משתמש בנתונים עתידיים כדי לחזות את העבר, המוביל ליתר דיוק אופטימי.
- (FLT:0)Walk-forward אימות: רכבת 1FLT על הרחבת או חיפוי חלונות של נתונים קודמים ומבחן על בלוק הבא.לדוגמה, רכבת בחודשים 1-12 חודשים, בדיקה בחודש 13 חודשים; ולאחר מכן להתאמן על 1-13 חודשים, בדיקה ב-14 חודשים וכו 'זה מחק תנאים של חיזוי עולם אמיתי.
- סדרת FLT:0 (Time series divided:00: 1) A גירסה שבה מערכת האימונים תמיד לפני הבדיקה, עם גודל הכשרה קבוע או גדל.
- (FLT:0)Blocked Time series cross-validation:03FLT) 1 כדי להסביר מחזורים עונתיים, להבטיח שכל קפלציה כוללת תקופות עונתיות מלאות כדי למנוע דפוסים של העונה על פני קפקאות.
כאשר כוונון היפרפרמטרים, השתמש ב-CDCed cross-validation: לולאה פנימית לחיפוש היפר-פרפרמטר (באמצעות הליכה קדימה על נתוני אימון) ו-Louה חיצונית עבור הערכת ביצועים.זה מספק הערכות שגיאה בלתי מובנות ומונע מידע דליפה מפני כוונון.
החלפה ועץ
כדי לשלוט על התאמה, ליישם סדירות ישירות לגידול עץ:
- (ב) ⁇ :0) עומק עץ לימיט: 1FLT:1 מגביל עומק מקסימלי (למשל, מקס עמיק=5) כדי למנוע פיצולים ספציפיים באופן מופרז.
- (ב) ,0) דגימות של פימיום עלה: FLT:1 , קבע מספר מינימלי של דגימות הנדרש על עלות צמתים (למשל, מינוס samples leaf=5) כדי להבטיח פיצולים הם כללי.
- (ב) ירידה בצמצום הצמצום: FLT:0) דורש ירידה מינימלית באובדן כדי להצדיק פיצול.
- (הופנה מהדף ה-CCPIR): 0 (FLT:0) ,Complexity pruning (CCPura): שימוש בפרמטרים ממריצים (FLT 3: 3 ב- scikit-learn) כדי להזיז סניפים לאחר אימון.
כדי להגביר מודלים, השתמש בשיעור למידה פחות מ-0, לעצור מוקדם על סט אימות, ועמודות תת-קרקעי ושורה. טכניקות אלה באופן קולקטיבי ליצור מודל חזק יותר אשר מסדיר מעבר לתקופת האימון.
מספר רב של עונות
סדרות זמן לעתים קרובות מציגות מחזורים עונתיים מרובים (למשל, מדי יום, שבועי, שנתי, עצי החלטות יכולים ללכוד את העונה דרך תכונה מתאימה קידוד. עבור נתונים יומיים עם עונות שבועיות, כוללים תכונה קטגורית ליום של שבוע.עבור נתונים שעה, כולל שעה של יום ויום של שבוע.עם זאת, כאשר עונתיות אינטראקציה (למשל, תבניות שבועיות שונות בהתאם לתקופות החגים), עצים עמוקים יותר יכולים אינטראקציות באופן אוטומטי כמו תכונות של שבועיות.
לתקופות עונתיות ארוכות יותר (שנתיות), הוספת תכונה "יום של שנה" או באמצעות תנאי Fourier (זוגות חכמים / קובצים עם תקופות שונות) יכול להפחית את המימד של עצי החלטה עונתיים יכול לפצל על תכונות אלה כדי ללכוד את המציאות. לחלופין, להיפטר הסדרה למגמה, עונתי, ורכיבי מגורים באמצעות STL decomposition, אז המודל השולי עם החלטה זה יכול להיות נורמלי עבור עבודה היברידית טובה עם סדרה של עבודה לוחמתית עם סדרה חזקה.
שטף עבודה מעשי: דוגמה של צעד-בי-צעד
כדי להמחיש את המושגים, לשקול חיזוי הביקוש לחשמל יומי באמצעות מודל יערות אקראיים.התמונים מכילים שנתיים של נתונים לשעה עם קריאה חיצונית לטמפרטורה.
- (FLT:0) הכנת נתונים: המחשה 1:1 להמיר לרזולוציה של שעה, להתמודד עם ערכים חסרים (מלאים מתקדמים), וליצור תקופת אימות (החלים 3 חודשים האחרונים).
- (FLT:0) יצירת חשמל: 1FLT תכונות לדג לביקוש (שעה, יום, שבוע), טמפרטורה (שעה, יום), ממוצעי מתגלגל (24 שעות חלון), שעה של יום (sine /cosine), יום של שבוע (אחד-חם), חודש (אחד-חם), ואינדיקטור חג.
- (FLT:0)Model Setup:FLT:1 , Random Forest with 200 עצים, max עמיק=10, Min samples leaf=5, ומגפיים עם חסימה מרגשת של אורך 24 כדי לשמור על תלות שעה.
- (ב) ויקרא י"א: ויקרא י"ד: ויקרא י"א: ויקרא י"ד: ויקרא י"א) ו-"ה' (ב"ד) ב', ב', ב') ב'', ב'[[1924]], וב[[1924]], [[1924]], [[1924]]]]
- דור פורסט:0 (Forecast Generation: FLT:1 Recursive Multi-stepחיזוי: לחזות צעד אחד קדימה, לעדכן תכונות lag באמצעות הערך הצפוי, ולהמשיך.עבור מודלים ייחודיים ישירות, להכשיר מודלים נפרדים לכל אופק.
- (ב) ,0) ,Evaluation: FLT:1 השווה תחזיות נגד בפועלים באמצעות RMSE ו MAPE. Plot שוכנים כדי לבדוק את ההקפאה שנותרה.
זרימת עבודה זו מניבה מודל שבדרך כלל מפורש תחזיות של התמדה נאמית והוא תחרותי עם רשתות עצביות מורכבות יותר, בעוד שנותר מפרש באמצעות חשיבות כוללת.
השוואה עם מודלים אחרים
(הרכבים של עץ תופסים קרקע בינונית במערכת האקולוגית החיזוי.הם גמישים יותר ממודלים ליניאריים (ARIMA, Exnential Smoothing) כי הם יכולים לעצב מערכות יחסים לא לינאריות ואינטראקציות ללא מפרט ידני, הם פחות מורכבים ומהירים יותר כדי להכשיר רשתות עצביות עמוקות (LSTM, Transformers), והם דורשים פחות עיבוד נתונים בצד השני, הם עלולים לא ללכוד הרבה יותר לטווח ארוך כמו מגמות של חומרים גמישים (C) כמו: 1Fert) ו-HD) כמו תכונות אינטראקטיביות ללא מגבלות נתונים שונים, כמו תכונות שאינן יכולות להיות פחות מטווח גבוה יותר מאשר תכונות אימון (פחות מורכבות יותר מאשר תכונות אחרות, כמו:
(בהשוואה עמוקה יותר של שיטות סדרות זמן, ראה את ה-FLT:0) ,הסבר: עקרונות ופרקטיקה ספר לימוד לימוד FLT:1 אשר מכסה הן גישות קלאסיות ולמידה מכונה.מתרגלים צריכים גם לחקור ספריות זמן מיוחדות כגון FLT:2sktimeph 3 המספקות ממשקים עקבי עבור צינורות תחזית עץ.
מסקנה
באמצעות עצי ההחלטות עבור סדרות זמן חיזוי היא לא פשוטה כמו החלת אותם נתונים עצמאיים, אבל האתגרים ניתן להתגבר באופן שיטתי. על ידי שילוב במפורש תכונות זמניות באמצעות משתנים lag וסטטיסטיקות מתגלגלות, להבטיח תנודות באמצעות הבדלים או שינויים, תוך שימוש בשיטות הרכב כדי להפחית את השחלות, ואימוץ אימות קדימה, מתרגלים יכולים לבנות מודלים מדויקים וחיזוייים על המפתח הוא לטפל בקשיים בזמן למידה תחת פיקוח על פני ההיסטוריה.
ככל שהמחקר מתקדם, טכניקות חדשות כגון יערות אקראיים כלליים וניתוח של בסיס עצבי (N-BEATS) סוגרות את הפער בין תחזיות למידה המבוססות על עץ ועמיקות.אך, עבור יישומים רבים בעולם האמיתי שבו הסתברות ויעילות חישובית הן סדרי עדיפויות, עצי החלטות נשארים כלי חשוב.מחנכים הוראה ניתוח זמן צריך לכלול שיטות אלה כחלק מתוכנית לימודים מודרנית, הדגשה הנדסית ואסטרטגיות חוצה-ער, עם דרישות ניהוליות, אשר יכולות לספק מענה עסקי חזקות.
(ב) ויקרא י"ד:
- (ב) ,0) שיטות איסוף למידה-לימוד (Desert-learning Ensemble Methods Documentation)
- (ב) ,0) "השתמש במכונות למידה עבור סדרת זמן" - מסמך אקדמי 1Fillo
- (ב) ,0) ,Kaggle Time Series Course