Karar Ağacı Nedir ve Neden İK Analytics için Çalışıyorlar

Çalışan yetersizlik - hangi işçiler bir organizasyondan ayrılır - pahalı bir problemdir. Tek bir çalışanın, işe alımda faktör olduğunda yıllık maaşlarının% 50'sinden 200'e mal olabilir, önceden tahmin edilebilir HR analizi, insan kaynaklarının tipik bir şekilde tanımlanmasını hedefler.

AŞFLT:0) Kadit ağacı[Dönetici:0)[Dönetici:0))[Dönetici: 0,3 puan üzerinden 3'ten daha az iş memnuniyetidir; her bir dal bu testin sonucuna karşılık gelir ve her yapraklı bir sınıf tutar - bu durumda, “köpürücük” veya “öpürücük” olarak yapılır.

HR Analytics için karar ağaçları doğal bir uyum sunar çünkü sonuçlar teknik olmayan paydaşlara iletişim kurmak kolaydır. Bir HR yöneticisi basit bir ağaca bakabilir ve çalışanların düşük katılım puanları ve kısa onure ile en yüksek uçuş riskleri olduğunu hemen görebilir - siyah-box gizemi gerekli değildir.

Karar Ağacı özellikle Çalışan Attrition Prediction için Faydalı

Attrition tahmini sınıflandırma problemidir, ancak diğer birçok model üzerinde karar ağaçları lehine olan eşsiz özelliklerle geliyor:

  • [FONT:0] Sorumluluk[Döneticiler[Döneticiler)[Döneticiler)[Döneticiler)[Döneticiler)[Döneticileri)[Dönlendirmeler: Disko ağları veya destek vektör makinelerinin aksine, karar ağaçları açık kurallar kümesini üretebilir.
  • [FONT:0]Mixed data işleme[[Dönetici: 1): İK veri setleri, şirket, yaş) ve kategorik özellikler (bölüm, eğitim seviyesi, cinsiyet) karar ağaçları her kategoriye dahil etmeden her kategoriyi ele geçirebilirler.
  • [FONT:0)Missing data toleransı[[Dönetici: Gerçek dünya HR verileri genellikle eksik - çalışanlar anket soruları atlar, alanlar boş bırakılır. Karar ağaçları, scikit-doktor gibi kütüphanelerde gerçek zamanlı bölünmeleri veya inşa edilmiş stratejileri kullanarak eksik değerlerle çalışabiliyor.
  • [FONT:0)Ana Sayfanın önemi[[Dönetici: 1): Algoritma otomatik olarak her değişkenin tahmin edici gücünü sıralar.Bu, en iyi sürücülerin attrition – ya da mesafeye, aşırı zaman frekansına veya promosyon fırsatlarının eksikliğine yardımcı olur.
  • [FONT:0]Hiçbir özellik ölçeklendirmeye ihtiyaç yoktur[Dönetici: Karar ağaçları eşiğine bölünmüştür, mesafeler değil, bu yüzden giriş özelliklerini normalleştirmek veya standartlaştırmak gerekmez.

Step-by-Step: Attrition için Bir Karar Ağacı Modeli Oluşturma

1. Doğru verileri toplayın ve hazırlayın

Herhangi bir tahmin modelinin kalitesi, eğitim aldığı verilere bağlıdır. Katkı tahminine göre, hem solu hem de kalanların ve kalanların da bulunduğu tarihi çalışma kayıtları toplamak. Anahtar özellikleri kategorilerinde bulunabilmeleri için en az altı ila on iki aylık tarihi veri için bir araya gelir:

  • [FONT:0]Demografikler[[Dönem: yaş, cinsiyet, evlilik statüsü, evden çalışma mesafeleri
  • [FONT:0)İşle ilgili faktörler[[Dönetici: Bölüm, iş rolü, maaş, aşırı zaman bayrağı, mevcut roldeki birkaç yıl, yönetici ile birkaç yıl yönetici ile
  • [FONT:0)Performance ve nişan): performans puanı, geçen yıl eğitim saat sayısı, anket puanları (eğer mevcutsa)
  • [FONT:0)Behavioral sinyalleri[[Dönem: Günler yok, şikayetler açıldı, birçok proje, son promosyon tarihi tarihi
  • [FONT:0]Work-life dengesi[Dönem: seyahat yüzdesi, çalışma programı türü, uzun saatler

Korumalı özelliklerin (race, cinsiyet, yaş) farkında olun, bu da önyargı tahminleri olabilir. Bunlar dahil olmak üzere doğruluk yasal olarak iyileştirilmesi gerekirken, eşitsizlik etkilerini test etmeli ve daha sonra geri döndüğümüz bir konu olarak değerlendirilmelidir.

2. Dataset

Karar ağaçları diğer algoritmaların veri hazırlığına daha az duyarlı olsa da, bazı adımlar önemlidir:

  • [FONT:0]Handle eksik değerler[[[Dönetici: Ağaç tabanlı modeller için, eksik verilerle satırları bırakabilir veya medya bölünmüş / modu kullanabilirsiniz. pratikte, medyadaki özellikleri ve kedi özellikleri için modları zorlayabilirsiniz.
  • [FONT=0)Encode kategorical değişkenler[DÜT:1): Çoğu karar ağacı uygulamaları (örneğin, ikit-dokuzlunun:0) sayısal girdi gerektirir.Birçok kategori için etiket kodlamak gerekir (örneğin, eğitim seviyesi: yüksek okul=0, lisans=1, master=2) ve bir-hot kodlaması nominal kategoriler için (örneğin, bölüm).
  • [FONT:0]Remove tekrarlar ve outliers[Dönetici: Bazı kalıpları yapay olarak şişirmek için kayıt olun. Aşırı değerler ile çalışan (örneğin, 30 yaşındaki bir şirkette çalışan) onları bölmek veya kaldırmak için zorlayabilir.
  • [FONT:0]Kuş dengesizliği[[Dönetici: 1) Çoğu kuruluşta, attrition nadir - çoğu zaman veri kümesinin% 5–15'i tahmin etmek için ağaça neden olabilir ve hala yüksek doğruluk elde ederiz.

3. Eğitime ve Test Setlerine Bölün

Standart 70-30 veya 80-20 bölünmüş kullanın. kronolojik olarak veri sipariş etti - HR'de ortak bir durum - zaman ayırarak: eski veriler üzerinde tren, yeni veriler üzerinde test.Bu, ileriye dönük tahminler.ASIFLT:0)Strarec edilmiş bölme) hem de aynı miktardaki solcuları dengesizlik sorunları için kritik olan orijinal veri setleri garanti altına almak için aynı oranda garanti eder.

4. Karar Ağacı Sınıflandırıcısı

scikit-learn gibi bir kütüphane kullanarak, bir temel ağaç basit:

from sklearn.tree import DecisionTreeClassifier
model = DecisionTreeClassifier(random_state=42)
model.fit(X_train, y_train)

Bu, varsayılan hiperparametrelerle bir ağaça uyuyor - ancak bu varsayılanler gerçek dünya HR veri setleri için nadiren en uygun. Ağaç derin ve aşırılık büyüyebilir, eğitim verileri üzerinde iyi performans gösterebilir, ancak görünmeyen çalışanlar üzerinde kötü.

5. Aşırılık önlemek için Tune Hyperparameters

Bir karar ağacında ayarlamak için en önemli hiperparametreler:

  • [FONT:0)max derinlemesine[[[Dönetici: 1): Ağacın kaç tane ardışık bölünmüş olabileceğini sınırlayın. 5-10 derinliği genellikle orta sayıda özellikteki veri kümeleri için yeterlidir.
  • [FONT:0]min samples split[DÜT:1): İç düğümü bölmek için gerekli olan minimum örnek.Bu değeri (örneğin, 20-50) güç, sadece yeterince büyük bir alt sette meydana gelen bölünmeleri dikkate almak için ağaç, gürültüyü azaltmak için.
  • [FONT:0]min samples leaf[DÜT:1): Bir yaprak nodesinde kalmaları gereken minimum sayıda örnek. 10-30, yaprak tahminlerinin istatistiksel olarak anlamlı bir örneke dayandığını sağlar.
  • [FONT=0]criterion[[Dönetici: “göçücü” veya “kanç” her iki sık benzer sonuçlar verir; hem de çapraz-validasyonda deneyin.
  • [FONT=0] Sınıf weight[[Dönetici: Sınıf frekanslarına karşı ağırlıkları otomatik olarak ayarlayarak “yapış” ayarlayın.

En iyi hatırlamayı sağlayan kombinasyonu tanımlamak için 5 kat çapraz eşdeğer arama kullanın (veya hangi ölçümler iş hedefinizle uyumlu).

6. Uygulamalı Metrikler ile Modelin Değerlendirilmesi

Tek başına dengesiz veri için yanıltıcıdır. Her zaman “sağlık” tahmin eden bir model, çalışanların sadece% 10'unun ayrılması halinde %90+ doğruluk elde edebilir.

  • [FONT:0)Öylege[[DÜDÜT:1): Tüm çalışanların terk etmeyi tahmin ettiği, hangi kesik aslında kaldı? Yüksek hassas daha az sahte alarm anlamına gelir.
  • [FONT:0)Recall (Sensitivity))[değiştir | kaynağı değiştir]: Gerçek terk edenlerin hangi kısmı daha az insanı kaçırıyor? Yüksek hatırla, çoğu zaman saklamada öncelik nedir - önemli bir çalışan kaybetmeden daha iyi.
  • [FONT:0]F1-dice[[[Dönetici:))): Azınlık sınıfında iyi bir F1, dengeli bir model gösterir.
  • [FONT:0]AUC-ROC[[DÜT:1): Modelin eşleri arasındaki ayrımı ayrımcılığa karşı ayrım yapma yeteneği. 0.8 Yukarıdaki değerler, yetersiz tahmin için iyi kabul edilir.
  • [FONT=0)Confüzyon matrisi[[Dönetici: Gerçek pozitifleri, gerçek negatifleri, yanlış pozitifleri, yanlış negatif negatifleri kırın. Bu, birçok “kabulunma”nın ne kadar meydana geldiğinin somut bir anlamı verir.

Test seti için, veri kalitesine bağlı olarak bir ROC-AUC'ye ulaşmak için bir ayarlanmış karar ağacı bekleyin.

Karar Ağacını Yorum: Kuralların Eylemine

Bir karar ağacının en büyük güçlü yanlarından biri şeffaflığıdır. Model eğitilmiştir, her iki koşulun da bir grafik olarak kullanmasına izin verebilir. ağaç en etkili bölünmüşleri ortaya çıkarır. Örneğin, en iyi düğümleri ortaya çıkarabilir.

Ayrıca özellik önemini de çıkarabilirsin. Bu sayılar 1.0'a kadar toplam ve her özelliğin yetersizliği azaltmaya ne kadar katkıda bulunduğunu gösterebilir. Tipik bir attrition dataset, en iyi özellikler genellikle:

  • İş memnuniyeti / nişan puanı
  • Yıllar son promosyondan beri
  • Overtime gösterge
  • Aylık gelir aylık gelir
  • Şirketler sayısı işe yaradı

Bu anlayışlar, HR'nin hedefli müdahaleleri tasarlamasına izin verir: örneğin, üç yıl içinde terfi etmeyen yüksek performanslılar için bir oturma bonusu veya uzun koşularla çalışanlar için iş-ev seçeneği.

Meydanlar ve Nasıl Overcome Them

Overfitting

Karar ağaçlarıyla en yaygın pitfall, çok karmaşık hale gelebileceği, eğitim verilerindeki gürültüyü ezberlemek, derin derinlik limitleri olan bir ağaç aşırı derinliklere yetişebilir, aslında eğitim setini kalple ilgili işaretler içerir.Forever Forest gibi bir yönteme geçiş.

Sınıf Imbalance

Madde oranı genellikle% 15'in altındayken, ağaç doğal olarak çoğunluk sınıfına yarar sağlayacaktır.Buna karşı koymak için, scikit- learning, hangi doğru sınıfla eşleştirilmezse gerçekçi olmayan veri puanlarını tanıtabilir. Alternatif olarak, SMOTE (Sental Minority Oversampling Technique) ile alınan eğitim verileri, terk edenlerin sentetik örneklerini ortaya çıkarabilir.

Instability

Karar ağaçları eğitim verilerindeki küçük değişikliklere karşı hassastır. Farklı bir tren testi bölmesi veya birçok ağaçta hafif bir varyasyon çok farklı bir ağaç yapısı sağlayabilir. Bu istikrarsızlığın modeldeki kurallara güvenir.Bir çare, birçok ağaçta ortalamaları kullanarak bir araya gelmektir ve istikrarlı ve sık sık sık sık sık sık sıkabilir.

Bias ve Fairness

Eğitim verileri tarihsel önyargıları içeriyorsa - örneğin, ırk veya cinsiyetle ilişkili olan metin kalıplarının geçmişteki - ağaç bu kalıpları öğrenebilir ve ayrımcı önerileri üretebilir. Her zaman modeli eşitsiz etki için denetimler: tahmin oranlarının hassas özellikleri veya adilliği kullanmayı düşünün. Bazı HR analiz ekipleri de yasal riskten kaçınmak için yaş veya evlilik statüsü gibi özellikleri dışlayabilirler.

Tek Bir Ağaç Ötesinde: Yüksek Hassasiyet için Ensemble Yöntemleri

Birçok HR veri setleri için, hiperparametre ayarlı tek bir karar ağacı sağlam bir temeldir, ancak nadiren en yüksek olası performansı elde eder.

  • [FONT:0]Random Forest[Dönetici], verilerin önyükleme noktaları ve ortalamalarının tahminleri üzerine birçok karar ağacı inşa eder.
  • [FONT:0]Gradient Boosting[[Dönetici:0)[Dönetici:0)Gradient Boosting[[[Dönetici: xGBoost, LightGBM) ağaçlar önceden tahmin edilen doğrulukta önemli olan - bir şirket çapındaki ilk uyarı sistemi inşa ederken daha dikkatli bir ayardır.
  • [FONT:0)Açıklanabilir Boosting Machines (EBM)) bir uzlaşmadır: etkileşimleri yakalayabilecek ve tam olarak yorumlanabilir modellerdir.

Ortak bir iş akışı, SHAP (SHapley Katkıları) kullanarak en çok benzeyen tahminlere başlamaktır ve her özelliğin belirli bir çalışanın risk puanına nasıl katkıda bulunduğunu gösterir.

Organizasyonunuzda bir Attrition Prediction System in Your Organization

Bir HR ortamında karar ağacı modeli çalışmak, bir Jupyter defterinde sınıflandırıcıyı inşa etmekten daha fazlasını içerir. İşte prototipden üretime geçmek için pratik adımlar:

  1. [FONT:0) HRIS ile birlikte (Dönetici: Pull data düzenli olarak (hafta veya aylık) İnsan Kaynakları Bilgi Sisteminizden otomatik olarak çıkarma ve işlem öncesi boru hattından, böylece model manuel müdahale olmadan taze veriler alır.
  2. [FONT:0) Risk eşiğini ifade eder[[Dönetici: Bir olasılık, yüksek bir eşiğe ayarlanır (örneğin, 0.7) yanlış pozitifleri azaltır, ancak düşük bir eşiği kaçırabilir (örneğin, 0.3) daha fazla insanı yakalar, ancak kabul edilebilir bir ticaret ortağı bulmak için HR iş ortaklarını iş ortaklarını daha fazla yönetici dikkat gerektirir.
  3. [FONT:0] Bir pano inşa etmek[[Döneticileri değiştir]: Temel özellikleri ile ilgili tahmin edilen risk puanlarını görselleştirmek. Hangi bölümler “yüksek risk” çalışanları en yüksek konsantrasyona sahiptir. trafik ışığı renkler kullanın (yeşil, sarı, kırmızı)
  4. [FONT:0]Bir geri bildirim döngüsü[[[Dönetici: 1 ): Bir müdahaleden sonra, bir görüşme, bir promosyon, maaş ayarlaması, sonuç kaydı. Çalışanın en az altı ay boyunca kalmasını sağladı? Bu yeni verileri düzenli olarak yeniden eğitmek için kullanın - her çeyrek ortaktır.
  5. [FONT=0]Ensure uyumluluğu ve etiği[[Dönetici: 0Döneticileri, karar kuralları ve performans. Run Fairness denetimleri her bir yeniden eğitimde.Herhangi bir istenmeyen sonuca ulaşmak için yuvarlanma yasal ve çeşitlilik takımları dahil edin.

Sonuç: Akıllı Retention için bir Vakıf Olarak Karar Ağacı

Karar ağaçları, İK ekiplerinin hangi çalışanların terk edileceğini tahmin etmek için pratik, yorumlanabilir bir başlangıç noktası sunar. net kurallar veri bilimi ve iş eylemi arasındaki boşluğu köprüye yardımcı olur, HR profesyonellerinin tahminlere güvenmek yerine hedef müdahaleleri tasarlamasına izin verir.Tek bir karar ağacı karmaşık veri setleri üzerinde en yüksek doğruluk elde edemezken, organizasyonun analitik olgunluğu ile genişletilebilecek değerli bir temel yöntem olarak hizmet eder.

Karar ağacının gerçek değeri, algoritmanın kendisi değil, ilham verdikleri eylemlerde, düşük katılım puanları ve kötü promosyon kayıtları ile çalışanların, terk etme olasılığı 4 × daha yüksektir, bu segment, eğitim veya tazminat düzenlemeleri için kariyer geliştirme planlarını uygulayabilirsiniz. Zamanla, bu veriler-aktif müdahaleler ciroyu azaltır ve daha istikrarlı, üretken bir işgücü oluşturabilirsiniz.

Daha fazla okuma için, [[Dönetici:0) karar ağaçları üzerinde , auranced- learning library Belgeleri) ve bu ) ⁇ Geçmiş belge (Dönetici)[Döneticileri yönetmek için daha derin bir şekilde bir ayrım yapmak için, bir kararın ötesinde bir karar verme modellerine izin vermek için.