Giriş Giriş Giriş

Karar ağaçları, denetimli makine öğreniminin temel taşıdır, hem sınıflandırma hem de regresyon görevleri için şeffaf bir çerçeve sunar.Recursally partitioning data based on feature values, they create a flowchart-like structure that soon these trade-offs human decision-making. their simple-to method for exploratory analysis, kredi puanlama, tıbbi tanı ve müşteri segmentasyon. Ancak, herhangi bir algoritmaya dayanarak, karar ağaçları, bu ticaretle gelen bir akış tarzı oluşturmak.

Bu makale, karar ağaçlarının avantajlarına ve kısıtlamalarına derin bir at sağlar, zayıflıklarını azaltmak için teknikler keşfeder ve bunları alternatif yöntemlerle karşılaştırırsınız.Sonunda, bir karar ağacı kullanmak için zaman net bir resime sahip olacaksınız ve bunu sağlam veri analizi için nasıl bir araya getirirsiniz.

Karar Ağaçları Nasıl Çalışılır

Yüksek düzeyde, bir karar ağacı, bir veri kümesini her adımda en bilgilendirici özelliğine dayanarak alt setlere ayırmaktadır. Algoritma, hedef değişkeni en iyi şekilde ayırarak, Gini imkansızlığı gibi kriterleri kullanarak, entropi (bilgi kazanır), veya varyan her bir derinlik, bir dizi testi bir özellikte temsil eder, her bir şube testi temsil eder ve her bir yapraktan herhangi biri tahmin edilebilir bir değer veya sınıf etiketi tutar.

Model aslında, eğer-sonra-else kurallarının bir seti olduğundan, teknik olmayan paydaşlara açıklanması kolaydır. Bu şeffaflık, daha güçlü kara kutu modellerinin erişilebilirliğine rağmen en popüler karar ağaçlarının biridir.

Karar Ağacının Avantajları

1. Yorumability and Explainability

Bir karar ağacı basit bir diyagram olarak görselleştirilebilir, denetçilerin veya hastaların açıklamalarını talep ettiği gibi, bir kredi onayı ağacının yüksek bir borç-ömün geliri ile bir araya getirildiğini açıkça gösterebilir. Bu, finans ve sağlık gibi düzenlenmiş endüstrilerde paha biçilmezdir. Örneğin, bir kredi onayı ağacının düşük bir gelir nedeniyle düşük bir gelirin yüksek bir borç-öğrenme oranıyla birleştirilmesini açıkça gösterebilir.

Ayrıca yorumlanabilirlik modeli demleme sağlar. Ağaç belli bir yanlış tahmin yaparsa, veri bilim adamları bölünmüşleri inceleyebilir ve veri kalite sorunlarını veya uygunsuz özellik seçimlerini tanımlayabilir.

2. Hem Numerical hem de Categorical Data

Karar ağaçları hem sayısal hem de kategorik özellikleri bir - sıcak kodlama veya normalleştirme gerektirmeden destekler. Bu, vektör makineleri veya sinir ağları gibi algoritmaları kıyaslanır. kedisel değişkenler için birçok seviyede, ağaç otomatik olarak onları kategoriye üyeliğe bölmek için idare edebilir, ancak bazı uygulamalar (örneğin CART) ikili bölünmeleri gerektirir.

3. Minimal Data Hazırlık

Birçok makine öğrenme algoritmalarının aksine, karar ağaçlarının özellik ölçeklendirme, merkezi veya dönüşüm gerektirmiyor. Eksik değerler genellikle gerçek dünya verileriyle uğraşırken veya eksik örnekleri görmezden gelinebilir. Bu sağlamlık veri kalitesi sorunları karar ağaçları, özellikle de dağınık gerçek dünya verileriyle uğraştığınız zaman.

4. Dönüşüm olmadan Doğru İlişkiler

Karar ağaçları karmaşık yakalayabilir, polinom terimleri veya çekirdek hileleri gerektirmeden özellikler arasındaki doğrusal olmayan etkileşimler arasında. Örneğin, bir ağaç, sonucun yalnızca başka bir değişkende bir eşiğine bağlı olduğu bir karar sınırı kolayca modelleyebilir.Bu doğal esneklik, bu tür etkileşimleri açıkça mühendisi olmayan bir şekilde ele alır.

5. Otomatik Özel Seçim Seçeneği

Her bölmede, algoritma tüm özellikleri değerlendirir ve en iyi ayrımı veren birini seçer.Relevant olan özellikler nadiren kullanılır, etkin bir şekilde gömülü özellik seçimi gerçekleştirir. Bu, özellikle de yüksek boyutlu verilerle uğraşırken, özellikle de çok boyutlu verilerle ilgili olarak aşırı derecede basitleştirir.

6. Robustness to Outliers and Irrelevant Özellikler

Çünkü bölünmeler eşiğine dayanıyor, eğitim verilerindeki aşırı değerler, tesadüfen modeli etkilemez (keş komşular gibi uzaktan bazlı yöntemler gibi). Benzer şekilde, bir sorumsuzluk özelliği sadece bölme için seçilmez, bu durumda hangi durumda yardımcı olur).

Karar Ağacının Sınırları

1. Overfitting

Karar ağaçları tam derinlikte büyüdüğünde aşırılık için ünlüdür. Her bir yaprak rastgele bir gürültü değişkenine kadar bölmeye devam eden bir ağaç, eğitim verilerinin mükemmel bir şekilde yorumlanmasına izin verir, ancak birçok dal tarafından yönlendirilen son derece derin ağaçlara göre ortaya çıkmaz. Örneğin, birçok özellikte eğitilmiş bir ağaç rastgele bir gürültü değişkenine bölünebilir, nüfusta var olmayan bir desen yakalamaz.

Maksimum derinliği sınırlamak gibi düzenlileştirme teknikleri, yaprak başına minimum sayıda örnek ayarla veya inşaattan sonra ağacı yıkamak için gerekli.

2. Yüksek Variance ve Instability

Eğitim verilerindeki küçük değişiklikler, eğitim setinde hafif perturbasyonların önemli ölçüde farklı bir onay kuralları üretmemesi gerektiği gibi, bireysel karar ağaçlarının tüm ağacı değiştirmesi için öngörülebilir hale getirebilir.Bu istikrarsızlık, eğitim setinde hafif perturbasyonlar gibi kredi puanlamaları gerektiren uygulamalar için bireysel karar ağaçlarının tamamen farklı onay kurallarının değiştirilmesini gerektirir.

rastgele ormanlar ve gradient gibi benzer yöntemler birçok ağaç üzerinde bir şekilde ele almayı teşvik eder, ancak tek bir ağacın alt yapısı temel bir sınırlama olarak kalır.

3. Birçok Seviye ile Özelliklere Doğru Olarak

Ayrılmaları seçerken, karar ağaçları birçok farklı değerle kategorize edici özellikleri lehine karşı karşıya kalır (örneğin, müşteri kimliği, zip kodu) birkaç değerle ilgili özellikler üzerinde. Bu, C4.5 gibi algoritmaları kullanarak daha fazla fırsat sunar, ancak bu bölünmeler anlamlı değildir. Örneğin, müşteri kimliği mükemmel bir şekilde saf bir yaprak verir, ancak bu bölünme genelleştirilemez.

4. Greedy ve Sub-Optimal Splitting

Tipik ağaç öğrenme algoritması bir açgözlü, üst düzey bir yaklaşım kullanır: her düğümde, gelecekteki bölünmeleri göz önünde bulundurmadan en iyi bölünmeyi seçer.Bilinmeyen, bu, alt optimize ağaçlara yol açabilir. daha iyi bir bölünmeler daha erken bir şekilde bölünebilir, ancak açgözlü algoritma geri dönemez.

Bir ağaç ya da büyüyen teknikler ve sonra bunu kısmen ele geçirebilir, ancak küresel en iyiliğin garantisi yoktur.

5. Küçük veya Yüksek Boyutlu Veriler Üzerinde Kötü Performans

Küçük veri setlerinde, karar ağaçları gürültüye çok hassas hale gelebilir ve kararsız modeller üretebilir.Çok boyutlu verilerle ilgili özelliklerle, algoritma anlamlı bölünmeler bulmak için mücadele edebilir, bu tür senaryolarda, boyut azaltımı (örneğin PCA) veya daha önce seçim gerektirir.

6. Basit Linear İlişkilerin Zorlanması

Karar ağaçları doğrusal olmayan etkileşimlerin üzerinde öne çıkarken, basit katkı lineer ilişkileri modellemede verimsizdir. Lineer bir karar sınırına bağlı olarak, bir ağaç, birçok parça sabit segmenti (taraflar), yorumlamak için daha zor olan derin, karmaşık bir ağaç oluşturur.

Sınırlamalara: Pruning and Regularization

Pruning karar ağaçlarının aşırılığını azaltmak için birincil tekniktir. İki ana yaklaşım vardır: önceden tahmin edilen (ayrıca erken durdurma adı verilen) ve post-pruning.

Pre-Pruning

Ağaç inşaatı sırasında, algoritma belirli koşullar karşılandığında bölmeyi durdurur - örneğin içerideki en derin derinlik veya en fazla sayıda broşür düğümü. Basit olsa da, önceden çalıştırılabilir ve çok agresif olabilir ve altlara liderlik edebilir.

Post-Pruning

Ağaç tam derinlikte büyüdü ve sonra küçük bir istatistiksel gelişme sağlayan dalları kaldırıldı. Yöntemler maliyetle karmaşıklık pruning (ayrıca en zayıf bağlantı olarak da bilinir), her bir yaprak için bir ceza eklendiği ve azaltılmış bir şekilde, bir bölünmenin performansının nasıl artırıldığını değerlendirmek için kullanılır.

Diğer normalleştirme teknikleri minimum bir boşluk azaltımı (yalnızca kazanç belirli bir değere ulaşırsa) ve eksik veriler için ekin bölünmüşleri kullanarak.

Diğer Modellerle Karşılaştırma

Diğer algoritmaların üzerinde bir karar ağacı ne zaman seçmelisiniz? Aşağıdaki tablo, anahtar ticaretlerini özetliyor:

  • [FONT:0]vs. Linear Modeller (Logistic Regresyon, Linear SVM): ), Karar ağaçları, doğrusal olmayan ve etkileşimleri otomatik olarak ele alır, ancak lineer ilişkiler eklenme ve lineer olduğunda lineer modeller daha istikrarlı ve verimlidir.
  • [FONT:0] s. k-Nearest Neighbors (kNN): ) Her ikisi de düşük boyutlu sürekli verilerle iyi çalışır, ancak yüksek boyutlardaki küçülürler ( boyutsallıkta ölçeklendirme gerektirir) ve dikkatli ölçeklendirme gerektirir. Karar ağaçları daha iyi karmaşık veri türlerini idare eder ve daha fazla yorumlanabilirdir.
  • [FONT:0]Z. Neural Networks: Neural ağlar son derece karmaşık desenler öğrenebilir, ancak büyük veri setleri, önemli hiperparametre ayarını gerektirir ve verinin orta büyüklükte ve ne zaman açıklamaların zorlandığı zaman karar ağaçları tercih edilebilir.
  • [FONT:0] s. Random Forests / Gradient Boosting:[Döneticileri) Bu tür yöntemler, yorumlanabilirlik maliyetinde belirgin bir şekilde doğruluk ve istikrar geliştirir. En pratik uygulamalar için tek bir karar ağacı sadece bir üslup analizi veya bir temel olarak kullanılır; ensemble çeşitleri üretim için tercih edilir.

Ensemble Yöntemler: Overcoming Single Tree Weaknesses

Tek bir karar ağacının dengesizliğini ve aşırılığını aşmak için, birçok ağacı birleştirin.

Rastgele Ormanlar

rastgele bir orman, düşük önyargıyı korumak için birçok karar ağacı inşa eder ve özelliklerin rastgele alt kümelerini oluşturur. O zaman tahminleri ortalamaları (Regresyon için) veya çoğunluk oylaması alır (örneğin sınıflandırma için). Bu, düşük önyargıyı korumak için, genellikle tek bir ağaç ifade eden sağlam bir model üretir.

Gradient Boosting Machines (GBMs)

GBMs ağaçları açık bir şekilde inşa ediyor, her yeni ağaç öncekilerin hatalarını doğrulıyor. Bu yaklaşım yapısal veriler üzerinde devlet-of-art doğruluk elde edebilir, ancak öğrenme oranını, ağaç derinliğini ve normalleştirmeyi dikkatli bir şekilde ayarlamayı gerektirir.

Karar Ağaçları Kullanımı için Pratik Değerlendirmeler

  • [FONT:0)Data Boyut:[Dönetici:[Dönetici:0) Veri kümeleri için birkaç yüz örnekten daha az sayıda karar ağacı aşırı yüklemeye eğilimlidir. Sınırdan çıkarma veya daha basit bir modele geçiş yapmayı düşünün (örneğin, lojistik regresyon).
  • [FONT:0)Ana Sayfalar:[Döneticiler) Ağaçlar doğal olarak karıştırılmış türleri ele alırken, hala verileri analiz etmelisiniz. Birçok seviyeli kategorik özellikler (örneğin, coğrafi konum) önceden gruplandırılmalıdır veya dikkatli davranılmalıdır. yüksek kartel özellikleri için, ağaçta beslemeden önce hedef kodlamayı dikkate almanız gerekir.
  • [FONT:0]Imbalanced Sınıflar:[Dönetici:[Dönetici: 0) Karar ağaçları çoğunluk sınıfına karşı önyargılı olabilir. Sınıf ağırlıkları, stratified sample, or oversampling teknikleri bunu azaltmak için.
  • [FONT=0)Missing Values:[Dönetici:[Dönetici:0)[[0][değiştir | kaynağı değiştir] Bazı uygulamalar (örneğin scikit-do’nun KararTreeClassifier) eksik değerleri doğrudan ele alamaz.
  • [FONT:0]Hyperparameter Tuning: En kritik hiperparametreler maksimum derinlik, min samples split, min samples leaf, ve max features., kenar ve varyan arasındaki en iyi ticaret-tavap bulmak için grid arama veya rastgele arama kullanın.

Gerçek Dünya Uygulamaları

Karar ağaçları, yorumlanabilirliğin anahtar olduğu alanlarda parlar.Sağlıkta, yaş, kan basıncına dayanan bir ağaç ve kolesterol seviyelerinde bir doktor için açık bir teşhis yolu sağlayabilir. finansta, kredi puanlama ağaçları tercih edilir, çünkü adilliğe ve kontrol edilemezler (öneticileri dikkatli bir şekilde ayırt etmeyi varsayarsak) Üretimde, karar ağaçları, bir dizi sensör okuması ile teşhis yolu sağlayabilir.

Örneğin, yaygın olarak alıntılanan bir uygulama, ağaç bazlı yöntemleri tanıtmak için bu veri kümesini kullanır.

Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç

Karar ağaçları, veri analistinin cephaneliğinde paha biçilmez bir araçtır, eşsiz yorumlanabilirlik, kullanım kolaylığı ve geniş çaplı iş öncesi olmayan karmaşık ilişkileri modelleme yeteneğidir. Ancak, zayıflıkları - özellikle de aşırılık ve istikrarsızlığı - tek bir karar ağacının nadiren modern bir boru hattında son model olduğu anlamına gelir.

Karar ağaçları etkili bir şekilde kullanmak için: her zaman pruning veya diğer normalleştirmeyi uygulayın, çapraz-validasyonla doğrulayın ve bunları üretim sistemleri için bir araya getirmeyi düşünün.Relaability is paramount, a well-tuned single tree can still be the right choice - but be ready to accept a potential trade-off in predictive correct.

Daha fazla okuma için, [[Dönetici-öpücü karar ağacı belgesine bakınız[Dönetici:2) İstatistiksel Öğrenmenin unsurları[Dönetici, Friedman ve Friedman tarafından 3Dönetici.