Giriş: Neden Karar Ağacı İşi İçin Maddeleri

Karar ağaçları iş analizinde en sezgisel ve yaygın kullanılan araçlar arasındadır. Karmaşık veri kümelerini şeffaf, akışlı yapılara ilk koşullardan gelen ilk sonuçlara yönlendiren yapılara çevirip, yanlış bir pazarlama stratejisi inşa etmek, iş bulmak, gerçek değer ortaya çıkıyor ve her bir kolun her türlü iş zekasına yorum yapabilmesini sağlar.

Bir Karar Ağacı Nedir?

Bir karar ağacı hem sınıflandırma hem de regresyon görevleri için kullanılan denetimli bir öğrenme algoritmasıdır.Bu modeller karar ve olası sonuçları bir ağaç benzeri grafik olarak, her bir iç nodenin bir ilke üzerinde test ettiği ve teknik olmayan paydaşlara kolayca açıklayabileceği modellerdir.

İki ana karar ağacı vardır:

  • [FONT=0)Kuşlama ağaçları[Dönemli bir sınıf etiketini tahmin edin (örneğin, “köçücük” vs. “küretim düğümleri göstermeyecek” yaprak düğümleri her sınıfın tahmin edilebilir sınıf ve olasılıklarını gösterir.
  • [FONT:0)Regresyon ağaçları[DÜDÜT:1) - Sürekli sayısal bir değeri tahmin edin (örneğin, beklenen gelir veya müşteri yaşam değeri). broşürleri, bu broşüre ulaşan tüm eğitim örnekleri için hedef değişkeninin değerini gösterir.

Tür ne olursa olsun, temel yorumlama becerileri benzerdir. Ağacın verileri nasıl bölüğünü, bölünmeleri ne ölçütlerini ve belirli bir senaryoyu değerlendirmek için kökden bir yol nasıl takip ettiğini anlamanız gerekir.

Karar Ağacı Çıktısı

Her karar ağacı çıktı, metin olarak yazdırılıp, bir panoda temsil edilen veya aynı temel bina blokları içeriyor. Bu bileşenleri Mastering bu bileşenleri güvenilir yorum için ilk adımdır.

Nodes: Root, internal, ve Leaf

  • [FONT=0)Root Node[[Döntgen: 1) – herhangi bir bölünmeden önce tüm veri setini temsil eden en büyük node.
  • [FONT:0]Internal düğümler[Dönetici: 0:1) - veri kümesinin bir özellik ve bir eşiğe dayandığı karar noktaları.Her iç düğüm bölme kuralı (örneğin, “Age < 35”), örneklerin sayısı, bu kadar yetersizliğe veya hataya ulaşır.
  • [FONT:0)Leaf düğümleri (terminal düğümler)) - son sonuçlar. sınıflandırma için, bir yaprak, tahmin edilen sınıf ve orada sona ermiş olan her sınıfın eğitim örneklerini gösterir.Regresyon için, tahmin edilen değeri ve bazen meydan okuma hatası anlamına gelir.

Branşlar ve Yollar

Her bir şube iki düğümü birbirine bağlar ve karar kuralını uygular: “Eğer doğruysa, sol gidin.”Bir yapraktan bir yol, size verilen bir tahmine yol açan özelliklerin özel kombinasyonunu anlatır.

Kesirli Kriterleri ve Impurity Measures

Karar ağaçları CART (Classification and Regresyon Ağaçlar) veya C4.5 gibi algoritmaları her düğümü seçmek için kullanır. Çıktı genellikle “pure” a node nasıl anlamanıza yardımcı olan yetersizlik değerleri içerir:

  • [FONT:0)Gini'nin (Dönetici) [Dönetici)[0))) [en yüksek çözünürlükte 0 (en yüksek) ile 0,5 arası ayrım) arasında bir fark vardır.
  • [FONT:0)Entropy / Bilgi kazancı) - Entropi önlemler bozukluğu; en üst düzey bilgi kazançlarının entropi azalttığı bir bölünme.
  • [FONT:0)Mean meydan okuma (MSE))[regresyon) - bir yaprakta daha doğru tahminleri gösterir.

Çıktıyı yorumlarken, bu değerlere dikkat edin. Yüksek bir dürtü veya yüksek bir hata ile bir yaprak kararın daha az güvenilir olduğunu ve ek verilere veya alternatif bir modele ihtiyacınız olabileceğini göstermektedir.

Bir Karar Ağacı Diagram Nasıl Okunulur

Görsel karar ağacı diyagramları, Directus, Python'un scikit- learning veya R'nin rpart gibi iş araçlarındaki en yaygın çıktıdır: Bu sistematik yöntemi herhangi bir ağaç diyagramını okumak için takip edin:

  1. [FONT:0] kök node[DÜT:1) yükseltin - en üst kutuyu okuyun. Size verileri ve eşini bölmek için kullanılan ilk özelliği anlatacak.
  2. [FONT:0) Bölümleri Takip Et[Döneticileri değiştir] – Her bir şube, durumu ile etiketlenir (örneğin, “evet” veya “hayır”, “<= 50,000” veya “> 50,000”).
  3. [FONT:0)Yeraltı düğümleri[[Dönetici:0)[Dönetici düğümleri[Döntgen:0))) - her bir iç düğümde, örnek sayısını ve hedef dağılımını not edin. Bu, kaç veri puanının bu yolda takip ettiğini ve modelin bu seviyede ne kadar emin olduğunu anlamanıza yardımcı olur.
  4. [FONT=0) Bir yaprakta dur [Dönetici:0) - son node tahmin verir. sınıflandırma ağaçlarda, tahmin edilen sınıf ve sınıf olasılıklarını listeleyecek.Regresyon ağaçlarda, tahmin edilen sayısal değeri ve çoğu zaman örneklerin sayısını gösterir.
  5. [FONT:0]Pekizin güvenilirliği[Dönetici:0)[Dönetici veya hata ölçülerini kontrol edin. Ayrıca, çok az örnekle alınan örneklerin sayısını kontrol edin, iş kararları için aşırı kabul edilemez ve güvenilmez.

Örneğin, müşteri hazinesini tahmin eden bir ağaç düşünün. kök “Kontrat Type: bir yıl vs. ay- ay- ay boyunca.”Bir iş kullanıcısı olarak, birçok destek çağrısı olan “Number of Support Calls” ve “Tenure” ile bölünmüş olabilir - açık bir eylem noktası.

Olasılıkları anlamak ve Değerleri Bekledi

Prob yükümlülükleri sınıflandırma ağacının temel bir parçasıdır. Her bir yaprak, her sınıfa ait eğitim örneklerinin bir kısmını gösterir.For ikili sınıflandırma (e.g., satın / satın al), bir yaprak, “[0.92, 0.08], yani bu yapraktaki eğitim örneklerinin% 92'sini sadece bir sayı satın almak için gösterir; ağaç güveninin bir ölçüsüdür.

Regresyon ağaçlarda, yaprak çıkışı, 50 müşteriden ortalama gelir olduğunu tahmin ediyor: 0) Mevcut değer[Dönetici: 1 ) - eğitim örneklerinin ortalama hedef değişkeni. Örneğin, bir yaprak 50 müşteriden ortalama gelirini tahmin ederse, bu karar yolunda düşen herhangi bir müşteri için beklenen geliri de yorumlayabilirsiniz. Bazı uygulamalar standart sapma veya MSE sağlar, bu da güven aralıklarını hesaplamanıza olanak sağlar.

İş kararı üreticileri genellikle maliyet-benefit analizi ile ilgili olasılıklar birleştirir. Bir broşür, pahalı bir sonuç olasılığını tahmin ederse (örneğin, ekipman başarısızlığı), şirket önleyici bakımlara yatırım yapabilir. Conversely, düşük ücretli bir broşür, tahmin edilen olasılık ve iş etkisi arasındaki dengeyi etkili bir şekilde kullanarak dengeyi haklı çıkarabilir.

Karar Thresholds and Splitting Rules

Bir karar ağacının her iç düğümü bir bölme kuralı içeriyor. numeric özellikler için, kural bir eşiğidir (örneğin, “Annual Income > 75,000”). Kedisel özellikler için, kategorinin alt kümesidir (örneğin, “Dene.g., Marketing}).

[FONT:0]Numeric bölmeler [Dönetici: 0,3] - eşler çocuk düğümlerinde homojeniteyi en üst düzeye çıkarmak için seçilir. Örneğin, bir ağaç "Age < 35" vs. "Age >= 35", o yaştan 35 yaşın hedef değişkeni için önemli bir nokta olduğunu öğrenirsiniz.

[FONT:0]Categorical bölünmüşler [Dönetici: 1) - ağaç Kuzey ve Doğu’da bir araya gelebilirse, bu bölgelerin benzer bir satın alma modellerine sahip olduğunu ve bunun için birleşik bir pazarlama stratejisi tasarlayabilirsiniz.

Bir ağacı incelediğinde, derinliğe ve bölünmüşlere dikkat edin. Birçok eşikle derin bir ağaç yorumlayabilmeli ve aşırılık tercih edebilir.İş kullanıcıları genellikle sığ ağaçlar tercih eder (derinlemesine 3–5) çünkü Directus gibi daha genelleştirilebilir kurallar sağlarlar, en yüksek derinlik ayarlamanıza veya broşürler ayarlamanıza izin verir, karar verme için daha pratik hale getirebilirler.

Common Pitfalls'tan kaçının: Overfitting and Pruning

Karar ağacının çıktısını yorumlamadaki en büyük hatalardan biri, ağaçtan vazgeçilmeden önce değere güvenmektedir. Overfitting, eğitim verilerindeki ağaç modellerinin gürültü veya rastgele dalgalanmalar, tarihsel veriler üzerinde mükemmel görünen bir çıktıya yol açıyor, ancak yeni senaryolarda başarısız oluyor.

  • Birçok şube ile çok derin ağaçlar
  • Çok az örnek içeren (örneğin, 1-2 örnek)
  • Aşırı düşük orantısızlık veya yaprakların içindeki sıfır hata
  • Eğitim verileri üzerinde yüksek doğruluk, ancak geçerlilik verileri üzerinde çok daha düşük

[FONT:0]Pruning[DÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜSÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜN

Başka bir pitfall, örneğin, 50 veya 100 $ - bunu hiperparametresi olarak ayarlayabiliyorsanız, emel iş kararları için, minimum sayıda örnek gerektirir - örneğin, 50 veya 100 - daha fazla istikrar sağlar.

İş Kararları için Karar Ağacı Çıktısı: Bir Adım-Adım Yaklaşımı

Ağaç çıkışını pratik eylemlere dönüştürmek için, bu yapılandırılmış süreci takip edin:

  1. [FONT:0) Hedefinizi Tanımlayın[[[Dönetici: 1)) – kârı artırmak, urn'ı onaylamaya mı çalışıyorsunuz, kredileri onaylayın veya envanterinizi optimize edin?
  2. [FONT:0) Yüksek değerli yaprakları - Bu tahmin edilen olumlu sonuçları (örneğin, “yüksek satın alma olasılığı”) veya olumsuz sonuçlar (örneğin, “yüksek varsayılan risk”) bırakır.
  3. [FONT=0] Karar yolunu gözden geçirin[Dönetici: 1 ) - Her yüksek öncelikli iş yaprak için, yolunuzu yaprakla kapatın.
  4. [FONT:0] Domain uzmanlığı ile güncellenme - Kurallara konu olan konularla ilgili uzmanlarla ilgili kurallar tartışır mı?Bir ağaç “daha az 2 destek çağrısı olan katılımcılar yüksek hacimli risktir” diyorsa, bu, karşılaştırılabilir bir şekilde veri sızıntısının veya aşırı yüklemenin bir sanatını ortaya çıkarabilir.
  5. [FONT:0]Assess risk ve belirsizlik[Dönetici: 1 ) - Her bir yaprak için olasılık ve örnek sayıyı dikkate alın.% 95 olasılık ile bir yapraktan% 80 olasılık ile sadece 20 örnek 500 örnekle bir yapraktan daha risklidir.
  6. [FONT:0] Kuralları[Döneticileri Değiştirin[Döneticileri değiştir] - Örneğin, yüksek kârlı bir yaprak koşullarını karşılayan müşteriler için bir pazarlama segmenti oluşturun veya yüksek hacimli bir yaprak ile eşleme riski bayrağını oluşturun.
  7. [FONT=0]Monitor ve güncelleme[Dönetici:0] – Karar ağaçları statik modeller; iş ortamları değişir. Düzenli olarak yeni verilerle ağacı yeniden eğitin ve çıktıyı karşılaştırın.Eğer anahtar bölmeler değişirse, iş kurallarınız buna göre uyum sağlar.

Bu yaklaşım, ağacın sadece pasif bir şekilde okumadığından emin olur, ancak aktif olarak ondan değer çıkarır.

Örnek Örnek Örnek: Müşteri Churn Önleme

Yorum sürecini göstermek için basitleştirilmiş bir örnekle yürüyelim.

[[Dönetici:0)Context:[Dönetici:0) Bir abonelik tabanlı yazılım şirketi, bir müşterinin önümüzdeki çeyrekte çakal olup olmayacağını tahmin etmek için bir sınıflandırma ağacı inşa eder. Hedef değişken ikili: “Churn” (1) veya “Stay” (0). Eğitim verileri, onure, destek biletleri, sözleşme türü ve kullanım frekansı gibi özellikler içerir.

Ağaç çıkışı (pruned, max derinlik 4) aşağıdaki yolu gösterir:

  • [FONT:0)Root:[Dönem:[Dönem: 1) Sözleşme Türü = Ay-ay?urFLT:2|Evet, sol dal (1,200 örnek,% 40 churn oranı)).
  • [0]İçinde 1 ([Dönem: 1) [Dönemli: 1/01/2012; 12 ay?]
  • [FONT=0]Internal node 2: [[Döntme: 1] Destek Biletleri vegt; 3?ANSFLT:2) Evet → sol (300 örnek,% 80 churn)).
  • [[Dönem:0)Leaf:[Dönetici:[Dönetici: 5 giriş / hafta?]:2|Evet, 200 örnekle yaprak, tahmin edilen sınıf = Churn, olasılık = 0.88).

[FONT:0)Stratepretation:[Döntme:[Döntme:[Döntme: 0) Bu broşür yüksek riskli müşteri profili: ay-ya kadar sözleşme, bir yıldan daha az onure, üç destek biletleri ve düşük kullanım frekansı. yüksek olasılık (yüzde 88) ve iyi örnek boyutu (200) bu profili uygulanabilir hale getirir.

[FONT:0)İş kararı:[Dönetici: 8] Şirket, bu müşterileri hedef alan bir saklama kampanyası tasarlayabilir - indirimli yıllık sözleşme teklif edebilir veya kullanımı artırmak için bir ürün öğreticisi sunar.

Bu örnek, bir ağacın çıktısını doğrudan hedef alan iş stratejilerine nasıl yönlendirdiğini gösteriyor.

Sınırlar ve Tamamlayıcı Teknikler

Model mükemmel değildir. Karar ağaçları, çıktılarını yorumlarken hesaba katmanız gereken iyi bilinen kısıtlamalara sahiptir:

  • [FONT:0)Instability[DÜT:1] - Eğitim verilerindeki küçük bir değişiklik, temel sürücülerin ve eşlerin belirgin önemini etkileyen, rastgele Ormanlar veya Gradient Boosting gibi ensemble yöntemleri kullanarak, hangi ortalama birçok ağaç yorum yapmak daha zordur; hala anahtar sürücüleri anlamak için tek bir ağaç kullanabilirsiniz.
  • [FONT:0]Bias birçok seviyedeki özelliklere doğru ilerler[DÜT:1) - Categorical birçok eşsiz değerle (örneğin, ZIP kodları) bölünmüş olabilir. Her zaman ağacın bu tür granular kategorilerine bölünmesini inceleyebilir - eğer bu nedenle, ağaç genel desenlerden ziyade gürültüyü aşırı yüklemeyi seçebilir.
  • [FONT=0]Poor ekstrapolasyon[[Dönetici: 1 ) - Karar ağaçları, eğitim verilerinin aralığının ötesine tahmin edemez.Bir broşürün belirli bir kombinasyon için örnekleri yoktur, ağaç güvenilir bir tahmin yapamaz.İş dünyasında, yeni senaryolar için başparmak veya alternatif modellerin kurallarına geri çekilmeniz gerekebilir.
  • [FONT:0) Interaction algılama[[[Dönetici: 1)) – Ağaçlar otomatik olarak etkileşimleri yakalar, ancak derin ağaçlar anlaşılmaz karmaşık etkileşimleri yaratabilir. Pruning yardımcı olur, ancak daha basit istatistiksel yöntemlerle doğrulamanız gerekebilir.

Bu sınırlamaların üstesinden gelmek için birçok kuruluş diğer analitik araçlarla karar ağacı yorumlamasını birleştirir. Örneğin, aday iş kuralları oluşturmak için ağacı kullanabilirsiniz, o zaman A/B deneyleri veya regresyon analizi ile bu kuralları test edin.Ayrıca, [[0.) karar ağaçları üzerinde başarı notları)[Döneticileri ile ilgili olarak, aşağıdaki makaleye göre inceleyebilirsiniz.

Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç

Karar ağacının çıktısını yorumlamak, veriye dayalı iş kararına dayalı bir yetenektir. düğümleri, şubeleri, terk etmek, kuralları ve olasılık değerlerini anlamak, stratejik seçimlere rehberlik eden, yorumlayan kurallarla ilgili olarak her zaman göz önünde bulundurmak, ağacın içgörünü bilmek ve doğru kullanıldığında karar ağaçlarının temel bilgileri ile ilgili görüşlerini doğru bir köprü haline gelir.

Analiz becerilerini daha keskinleştirmek için, Python'un scikit- learning veya Directus Data Platform gibi araçlardaki pratik öğreticileri keşfedin, bu da veri ekosisteminiz içinde doğrudan bina ve görselleme karar ağaçlarınızı destekleyen doğrudan. ek olarak, kuruluşunuzun Harvard Business Review) üzerindeki karar uygulamalarını okuyun.