Table of Contents
מה הם עצי החלטות ומדוע הם עובדים עבור HR Analytics
שיעור העובדים - שיעור שבו עובדים עוזבים ארגון - הוא בעיה יקרה. הצבת עובד אחד יכול לעלות בכל מקום מ 50% עד 200% מהמשכורת השנתית שלהם כאשר אתה גורם בגיוס, על הסיפון, איבד את הפרודוקטיביות. ניתוח HR חיזוי שואפת לזהות עובדים בסיכון מוקדם כדי שאסטרטגיות שימור יכולות להיות מיושם לפני מכתב התפטרות על שולחן העבודה של המנהל.
(ב) אלגוריתם למידה בפיקוח שמודלים החלטות ותוצאותיהם האפשריות כמבנה עץ.כל צומת פנימי מייצג מבחן על תכונה (למשל, "האם שביעות רצון פחות מ-3 בסולם של 5 נקודות", כל ענף תואם את התוצאה של מבחן זה, וכל עלה אינו מחזיק מעמד מצופה - במקרה זה, "האם הוא שביעות רצון פחות מגובה של 5 נקודות" (התחילה) כולל את הקריטריונים המפרקים ביותר על ידי ההפחתה של נתונים.
עבור ניתוח משאבי אנוש, עצי ההחלטות מציעים התאמה טבעית כי התוצאות קלות לתקשר לבעלי העניין הלא-טכניים.מנהל משאבי אנוש יכול להסתכל על דיאגרמת עץ פשוטה ומיד לראות כי עובדים עם ציונים נמוכים וכהונה קצרה הם הסיכונים הטיסה הגבוהים ביותר - אין מסתורין שחור של ארגז שחור הנדרש.
מדוע עץ ההחלטות שימושי במיוחד עבור תחזית התשה של העובד
תחזית ההסתה היא בעיה של סיווג, אך היא באה עם מאפיינים ייחודיים המעדיפים עצי החלטות על פני מודלים רבים אחרים:
- (FLT:0) בין-מידתיות FLT:1: שלא כמו רשתות עצביות או מכונות וקטור תמיכה, עצי החלטות מייצרים קבוצה של כללים מפורשים.אפשר לעקוב אחר כל חיזוי חזרה לתנאים המדויקים שהובילו לכך.זה קריטי עבור צוותי משאבי אנוש שצריכים להצדיק התערבות למנהיגות או לציית לתקנות שכר הוגן.
- (FLT:0) מ-Mixed Data TreatmentFLT:1: נתונים של HR מכילים תכונות מספריות (שלי, שנים בחברה, גיל) ותכונות קטגוריות (התחלקה, רמת החינוך, מגדר) יכולים להתמודד הן ללא צורך בקידוד אחד של כל קטגוריה.
- (FLT:0) העברת נתונים לסובלנות: נתונים של ארגון משאבי אנוש בעולם האמיתי לעתים קרובות אינם שלמים - עובדים שדלגו על שאלות סקר, שדות נותרים ריקים. עצי החלטות יכולים לעבוד עם ערכים חסרים באמצעות פיצולים או אסטרטגיות בנויות בספריות כמו פיסול למידה.
- (FLT:0) חשיבותה של ההרחבה:1: האלגוריתם באופן אוטומטי מדרג את הכוח הנבאי של כל משתנה.זה עוזר לזהות את הנהגים המובילים של אי הקרנה - בין אם זה מרחק נסיעה, תדירות יתר של זמן, או חוסר הזדמנויות קידום.
- (ב) אין תכונת קנה מידה הנדרשת ל- 1FLT: עצי ההחלטות מתפצלים על סף, לא מרחקים, כך שלא צריך לנרמל או לתקן את התכונות של קלט.
שלב-בי-Step: בניית מודל עץ החלטה עבור הקרנה
1. איסוף והתכונן את הנתונים הנכונים
איכות כל מודל חיזוי תלויה בנתונים שהוכשרו על מנת לנבאת התשה, לאסוף רשומות עובדים היסטוריות הכוללות גם אלה שעזבו וגם אלה שנשארו. Aim למשך לפחות 6-12 חודשים של נתונים היסטוריים כדי ללכוד דפוסים משמעותיים.
- (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (FLT:0) גורמים הקשורים ל-Job-ved (FLT:1: המחלקה, תפקיד העבודה, השכר, דגל במשרה מלאה, מספר שנים בתפקיד הנוכחי, מספר שנים עם מנהל
- (FLT:0) חידוש ומעורבות ב- 1:1: דירוג ביצועים, מספר שעות אימון בשנה שעברה, ציוני סקר מעורבות (אם זמין)
- (ב) [15] ,ב"ה: ימים נעדרים, חלים, מספר פרויקטים, תאריך קידום אחרון
- (ב) ◄0 (ב"ג): שיעור הנסיעה, סוג לוח הזמנים של עבודה, שעות נוספות
להיות מודע לתכונות מוגן (גזע, מין, גיל) שעשויות להסתה באופן בלתי נמנע תחזיות ההטיה.בעוד כולל אלה עשויים לשפר את הדיוק באופן חוקי, עליך לבדוק את ההשפעה הניתוק ולחשב בהשלכות ההוגנות - נושא שאנו חוזרים אליו מאוחר יותר.
2.עדכון תחילת הנתונים
למרות שעצים החלטות רגישים פחות להכנת נתונים מאשר אלגוריתמים אחרים, כמה צעדים נותרו חיוניים:
- (FLT:0)Handle החסר ערכים: עבור מודלים המבוססים על עץ, אתה יכול גם להוריד שורות עם נתונים חסרים, להמנע את החצין / מודה, או להשתמש בפיצול פונדקאי. בפועל, אימפולס עם החציון לתכונות נומרניות וצורה לתכונות קטגוריות עובד היטב.
- (FLT:0) משתנה קטגוריאלי משתנה (Feloeral Variiph:1 ; רוב יישום עץ ההחלטות (למשל, פיסול-לימוד של ®FLT:0) דורש קלט מספרי. השתמש בסימון עבור קטגוריות אורדיניות (למשל, רמת חינוך גבוהה = 0, רווק =1, 2) ו 1- 1-hot for nominal קטגוריות (למשל, אם אתה לא יכול למצוא תכונות קטנות), אלא אם אתה יכול להיות אלגוריתם (למשל, אם אתה יכול להיות חלק) או יותר מקטגוריות של אלגוריתם (למשל, אם אתה יכול להיות אלגוריתם) או יותר מקטגוריות של אלגוריתם, אם אתה יכול להיות אלגוריתם, אם אתה יכול להיות אלגוריתם, אם אתה יכול להיות אלגוריתם לדוגמה, אם אתה יכול להיות חלק קטן (למשל, אם אתה יכול להיות אלגוריתם) או יותר ממין (למשל, אם אתה יכול להיות אלגוריתם) או יותר) אם אתה יכול להיות אלגוריתם) אם אתה יכול להיות אלגוריתם (לדוגמה, אם אתה יכול להיות כפול (למשל, אם אתה יכול להיות אלגוריתם) אם אתה יכול להיות אלגוריתם) אם אתה יכול להיות אלגוריתם) אם אתה יכול להיות אלגוריתם) אם אתה יכול להיות אלגוריתם) אם אתה יכול להיות אלגוריתם אלגוריתם (למשל,
- (FLT:0) Remove משוכפלת ו- Outlierssherph:1; רשומות מפוכחות מנפחות באופן מלאכותי דפוסים מסוימים. Outliers עם ערכים קיצוניים (למשל, עובד עם 50 שנות כהונה בחברה בת 30) יכול לעוות פיצולים, כך לשקול קפיצת או הסרתם.
- (FLT:0) חוסר איזון של קיד:1; ברוב הארגונים, התשה היא נדירה - לעתים קרובות 5-15% של תחילת הנתונים.זה יכול לגרום לעץ לחזות "להישאר" עבור כולם ועדיין להשיג דיוק גבוה.
3.חלק לתוך אימון ומבחן
השתמש בנתוני נתונים סטנדרטיים 70-30 או 80-20 מפוזרים.עבור נתונים מסודרים - מקרה נפוץ ב- HR - פיצול על ידי זמן: רכבת על נתונים ישנים יותר, בדיקה על נתונים חדשים יותר.זה מדמה תחזיות צופה קדימה.
4.לרכב את עץ ההחלטות
באמצעות ספרייה כמו scikit-learn, אימון עץ בסיס הוא פשוט:
from sklearn.tree import DecisionTreeClassifier
model = DecisionTreeClassifier(random_state=42)
model.fit(X_train, y_train)
זה מתאים לעץ עם היפרפרפרמטרים ברירת מחדל - אבל אלה ברירת מחדל הם לעתים נדירות אופטימליים עבור מאגרי מידע בעולם האמיתי HRset.העץ עשוי לגדול עמוק וגבוה יותר, ביצוע היטב על נתוני אימון, אך גרוע על עובדים לא נראים.
5. Tune Hyperparameters כדי למנוע את הכדאיות
היפרפרמטר החשוב ביותר להסתגל בעץ ההחלטות הוא:
- (FLT:0) aviveFLT:1: מגביל כמה מתפצלים רצופים העץ יכול לעשות. לעומק של 5-10 הוא לעתים קרובות מספיק עבור נתונים של חיקוי עם מספר מתון של תכונות.
- (ב) [ה]: מספר הדוגמאות המינימלי הנדרש לפיצול צומת פנימי (למשל 20–50) מאלץ את העץ לשקול רק פיצולים המתרחשים על תת-קרקעית גדולה מספיק, צמצום הרעש.
- (FLT:0)min samples leafphphphalLT:1; המספר המינימלי של דגימות שיש להישאר בצומת. A ערך של 10-30 מבטיח כי עלות תחזיות מבוססים על מדגם בעל משמעות סטטיסטית.
- [ה]: [ה] [ה] [ה]] [ה]] [ה]] [ה]]] [ה']'[ה']'[ה]']'[ה']'[ה']'[ה']'[ה']'[ה']'[ה']'[ה']'[ה']'[ה']'[ה'[ה']']'[ה']']'[ה'[ה'[ה']'[ה'[ה'[ה']'[ה'[ה']']']'[ה'[ה'[ה'[ה']']']']'[ה']']'[ה'[ה'[ה'[ה']']'[ה']'[ה'[ה']']'[ה']']']']']']'[ה'[ה']'[ה'[ה'[ה'[ה']']'[ה']']'[ה'[ה'[ה'[ה'[
- (FLT:0) Class dderFLT:1: הגדר כדי "מאוזן" כדי להתאים באופן אוטומטי משקולות ביחס הפוך לתאריות המעמדיים.זהו כלי רב עוצמה לטיפול בחוסר איזון מעמדי.
השתמש בחיפוש רשת או חיפוש אקראי עם 5 כפול cross-validation כדי לזהות את השילוב שמביא את הזיכרון הטוב ביותר (או כל מי שמדורג מתאים עם המטרה העסקית שלך).
להעריך את המודל עם Appropriate metrics
רק הסתברות של נתונים לא מאוזנים של אי-שוויון, מודל שתמיד צופה ש"להישאר" יכול להשיג 90% יותר דיוק אם רק 10% מההעובדים יעזבו.
- (ב) [ה]הקדמה ל': מכל העובדים חזו לעזוב, איזה חלק מהם באמת נותר? - דיוק גבוה משמעו פחות אזעקות שקריות.
- (ב) [ה]העיקרון]: מה חלק מהעוזבים בפועל עשו את המלכודת המודל?הזיכרון הגבוה משמעו שאתם מתגעגעים פחות אנשים, שהוא לעתים קרובות העדיפות של שימור – עדיף להתערב ללא צורך מאשר לאבד עובד מפתח.
- (ב) ⁇ :0)1scoreFLT:1: המשמעות הרמונית של דיוק וזיכרון. A טוב F1 על מעמד המיעוט מצביע על מודל מאוזן.
- (ב) ,0)AUC-ROC-ROCFLT:1: מודד את יכולת המודל להבחין בין המעמדות על פני סף.ערכים מעל 0.8 נחשבים טובים לחיזוי חיקוי.
- [ה]: [ה]הפסקה של חיובי אמיתי, שליליות אמיתית, חיובי כוזב, שלילי כוזב, שלילית כוזבת.
עבור הבדיקה, לצפות עץ החלטות מכוון כדי להשיג ROC-AUC בין 0.75 ל-00 בהתאם לאיכות הנתונים.
בין עץ ההחלטות: מחוקים לפעולה
אחת החוזקות הגדולות ביותר של עץ ההחלטות היא השקיפות שלו, לאחר שהמודל מאומנים, ניתן לדמיין את העץ באמצעות FLT:2 או לייצא אותו כגרף.העץ יחשוף את הפיצול המשפיע ביותר.לדוגמה, הצומת העליון עשוי לתפצל ב"שביעות רצון עבודה: 0 10 שעות בשבוע" עובדים נפגשים בתנאים עשויים להיות הסתברות של 80% מהעזיבה.
אתה יכול גם להפיק חשיבות תכונה.מספרים אלה מסומנים ל- 1.0 ולהציג כמה כל תכונה תרם לצמצום הזיהומים. in a טיפוסית in atrition dataset, התכונות העיקריות הן לעתים קרובות:
- שביעות רצון עבודה / Ingance Score
- שנים מאז קידום
- Overtime אינדיקטור
- הכנסה חודשית
- מספר החברות עבד
תובנות אלה מאפשרות ל-HR לעצב התערבויות ממוקדות: לדוגמה, בונוס לשימור עבור בעלי ביצועים גבוהים שלא קידם בשלוש שנים, או אפשרות עבודה מהבית לעובדים עם נסיעות ארוכות.
אתגרים וכיצד להתגבר עליהם
Overfitting
הנפילה הנפוצה ביותר עם עצי ההחלטות היא שהם יכולים להיות מורכבים מדי, ממתינים רעש בנתונים האימונים.עץ ללא גבול עומק יכול לגדול למעמקים קיצוניים, בעצם ללמוד את האימונים שנקבעו על ידי הלב.סימנים של overfitting כוללים דיוק אימון גבוה מאוד (90% + עם זיכרון מושלם) אבל הרבה דיוק מבחן נמוך יותר.
המונחים:
עם שיעורי הקרנה לעתים קרובות מתחת 15%, העץ יהיה באופן טבעי מעדיף את שיעור הרוב.לנגד זה, להשתמש ב- FLT:5 ב- scikit-learning, אשר מקצה עלויות הנאות גבוהות יותר למעמד המיעוט. לחלופין, לנסח מחדש את נתוני האימונים באמצעות SMOTE (Synthetic Minority Oversampling Technique) כדי ליצור דוגמאות סינתטיות של עזובים.
חוסר יכולת
עצי ההחלטות רגישים לשינויים קטנים בנתונים האימונים.חלוקה של רכבת אחרת או וריאציות קלות בערכי תכונה יכול להניב מבנה עץ שונה מאוד.חוסר יציבות זה יכול לשקוע אמון בחוקי המודל.תרופה אחת היא להשתמש בהרכב של עצים (Random Forest או Gradient Boosting), אשר ממוצעים על פני עצים רבים ומייצרת תחזיות יציבות ומדויקות יותר – למרות שעלות של כמה הסתברות.
« « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « «
אם נתוני האימון מכילים הטיות היסטוריות – למשל, דפוסי החדירה מהעבר התואמים עם גזע או מין – העץ עשוי ללמוד את הדפוסים הללו וליצור המלצות מפלות.תמיד לבדוק את המודל להפחתה של ההשפעה: לבדוק אם שיעור החיזוי שונה באופן משמעותי על פני קבוצות מוגן.אם כן, לשקול הסרת תכונות רגישות או שימוש באלגוריתמים של ההוגנות-HR Analytics, חלק מצוות ניתוחי HR, גם לא לכלול תכונות כמו גיל או מצב משפחתי, כדי למנוע סיכון משפטי, אם הם אפילו לשפר את הדיוק.
מעבר לעץ בודד: שיטות אנסמבל לדיוק עליון
עבור רבים מהנתונים של HR, עץ החלטה יחיד עם כוונון היפר-פרפרמטר הוא בסיס מוצק, אבל זה רק לעתים רחוקות משיג את הביצועים הגבוהים ביותר האפשרי.
- (FLT:0Random ForestFLT:1) בונה עצי החלטות רבים על תת-קרקעיים מפוספסים של הנתונים וממוצע התחזיות שלהם.ההפחתה של השחלות לעתים קרובות מניבה הכללה טובה יותר מאשר עץ יחיד.תכונת עדיין ניתן להפיק על פני היער, שמירה על כמה הפרשות.
- (FLT:0Gradient BoostingFLT:1) (למשל, XGBoost, LightGBM) בונה עצים באופן בלתי נמנע, עם כל עץ חדש תיקון שגיאות של הקודם.מודלים אלה לעתים קרובות להשיג דיוק המדינה-of-art אבל הם פחות מפרשים ודורשים יותר זהיר כדי להימנע מהתאמה.
- (FLT:0) מכונות בולטות (EBMrea) 1 הן פשרה: הם מודלים של תוספי שיכול ללכוד אינטראקציות והם ניתנים לפירוש לחלוטין.הם עשויים להיות בחירה טובה יותר עבור HR כאשר נדרשת שקיפות קפדנית.
זרימת עבודה משותפת היא להתחיל עם עץ החלטה יחיד עבור הפרשנות ובעלי העניין לקנות-in, ולאחר מכן בוגר היער אקראי עבור פריסת הייצור.אתה תמיד יכול להסביר את התחזיות של ההרכב באמצעות ערכי SHAP (SHapley Additive exPlanations), אשר מראה כיצד כל תכונה תרם לציון הסיכון של עובד ספציפי.
יישום מערכת חיזוי תכוף בארגון שלך
חלוקת מודל עץ החלטה בהגדרת HR כוללת יותר מאשר רק בניית המסווג במחברת ג'ופטר.כאן הם צעדים מעשיים לעבור מטיפוס להפקה:
- (FLT:0) אינטגרט עם HRISFIRLT:1; משוך נתונים באופן קבוע (שבועי או חודשי) ממערכת המידע של משאבי אנוש שלך.אוטומטי את החילוץ וההפצה כדי שהמודל יקבל נתונים טריים ללא התערבות ידנית.
- (FLT:0)Define סיכון סף חסימה 1:1: להחליט על קיצוץ סביר עבור דגל עובדים.קביעת סף גבוה (למשל, 0.7) להפחית את החיובים המזויפים אבל עשוי להחמיץ עובדים בסיכון; סף נמוך יותר (למשל, 0.3) לוכד יותר אנשים, אך דורש יותר תשומת לב למנהל עם שותפי HR כדי למצוא טרייד מקובל.
- (FLT:0Build a pintureFLT:1): דמיין את ציוני הסיכון הצפויים לצד תכונות מפתח. מראה כי מחלקות יש ריכוז גבוה ביותר של עובדים "סיכון גבוה" להשתמש צבעים (ירוק, צהוב, אדום) כדי להפוך אותו לפעולה.
- (FLT:0) לעיין בלולאה משוב 1: לאחר התערבות (למשל, ראיון שהייה, קידום, תיקון שכר), להקליט את התוצאה.האם העובד נשאר לפחות שישה חודשים נוספים? השתמש בנתונים חדשים אלה כדי לאימון את המודל באופן זמני - כל רבע הוא נפוץ.
- (FLT:0) הבטחת תאימות ומוסריות: מסמך התכונות של המודל שלך, כללי ההחלטות וביצועים. Run הגינות ביקורת על כל אימון מחדש.
מסקנה: עצי ההחלטות כקרן לכוונות חכמות
עצי ההחלטות מציעים נקודת התחלה מעשית, מפרשים עבור צוותי משאבי אנוש המבקשים לחזות אילו עובדים צפויים לעזוב. הכללים ברורים שלהם לעזור לגשר על הפער בין מדע נתונים לבין פעולה עסקית, המאפשר לאנשי מקצוע של HR לעצב התערבויות ממוקדות ולא להסתמך על ניחושים. בעוד עץ החלטה יחיד עשוי לא להשיג את הדיוק הגבוה ביותר על נתונים מורכבים, הוא משמש כבסיס חשוב שניתן להרחיב עם שיטות כמו ההתמחות של הארגון גדל.
הערך האמיתי של מודלי חיזוי עץ ההחלטות אינו באלגוריתם עצמו, אלא בפעולות שהם מעוררים השראה.כאשר אתה יכול להצביע על כך שעובדים עם ציונים נמוכים של מעורבות ורשומות קידום עניים הם 4× יותר סיכוי לעזוב, אתה יכול ליישם תוכניות שימור ממוקדות: תוכניות לפיתוח קריירה עבור אותו קטע, הכשרת מנהלים, או התאמות פיצוי. לאורך זמן, אלה התערבות מונעת נתונים להפחית את המחזור, שכר, שכרה נמוך יותר, לבנות יותר יציב, כוח עבודה.
(ב) ראו את תיעוד ה-FLT:0 (הרחבה) של עצי החלטה (FLT:2practical Kaggle guideFLT:3, וסקירה זו של כפל 4Coursera סקירה של HR analyticsFLT:5 עבור צלילה עמוקה יותר לתוך חוסר איזון מעמדי, את תיעוד הספרייה המאוזנת של למידה מרחוק (FLT:4) הוא סוף-דלהלן:5 לקבלת צוואת עץ אחד מפרשים, על ידי עץ אחד, אם אתה מפרש על ידי ויקרא, לאחר מכן, אם אתה יודע, על ידי ויקרא, אם אתה יודע, על ידי ויקרא, על ידי ויקרא, אם אתה יודע, 5.