Karar ağaçları, yorumlanabilir makine öğreniminin temel taşıdır, gürültü ve dışlayıcıları, temel kalıpları öğrenmeden ziyade, basit ve görsel çağrılarına rağmen, bilinen bir pitfall ile gelir: aşırılık gösteren bir karar ağacı, aslında eğitim verilerini ezberlemek ve temel olarak temel olarak temel olarak temellenen modelleri inşa etmek için harekete geçmek için harekete geçti.

Karar Ağaçlarında Aşırı Teklif Anlamak

Bir karar ağacı çok derin veya çok karmaşık olduğunda, gerçek sinyal yerine eğitimdeki rastgele dalgalanmaları yakalamak. Uygulamada, bu bir ağaç olarak birçok düğümle ortaya çıkıyor ve her birinin çok az örneği içerdiğinden ayrılır. Modelin eğitim doğruluk yaklaşımları% 100, ancak geçerlilik veya test doğrulukları geride bırakıyor.Bu boşluk, refitlite algoritmalarının birincil nedenidir.

Overfitting belirtileri şunlardır:

  • Çok derin ağaçlar onlarca seviyede.
  • Sadece bir veya iki eğitim örneği içeren bırakın.
  • Eğitim verilerindeki küçük değişikliklere yüksek hassasiyet.
  • Geçerlilik, çapraz-validasyon veya test setleri üzerinde kötü performans.

Matematiksel olarak, aşırılık, modelin tahminlerini takip etmeden yüksek değişkene karşılık gelir.Girişte küçük bir değişiklik tahmin edilen sonuçta büyük bir değişikliğe yol açıyor. aşırı yükleme işlemine katılmak, bu nedenle, modelin gürültüyü kovalamadan gerçek kalıpları bulmaktır.

Aşırı yüklemeyi önlemek için Core Strategies

Birkaç pratik teknik karar ağaçlarının aşırı yüklenmesini engelleyebilir. Bu yöntemler iki kategoriye girer: önceden (daha sonra ağaç büyümesini erken) ve post-pruning (daha sonra ağacı tamamen büyüterek büyütebilirsiniz). Aşağıda en etkili stratejiler vardır.

Ağaçları

Pruning en eski ve en sezgisel yöntemdir. Bir ağacı tam derinliğine yükselttikten sonra, yaprakları küçük tahmin edici değere ekleyen şubeleri seçici olarak kaldırabilirsiniz.En yaygın teknik, düşük bağlantı kümesinde de bilinir.Seks-dokuzlu-duyucuslama gibi bir ayarlı ayarlayabilirsiniz.SeksT:0 parametresi bu işlemi otomatikleştirin.

Örneğin, "müşteri kimliği" gibi bir özellikte ayrılan bir karar ağacı hayal edin. Bu bölünmüş mükemmel bir şekilde eğitim örneği olabilir, ancak bu kadar titiz dalları ortadan kaldırır, modeli anlamlı desenlere güvenmeye zorlayacaktır.

Ağaçların Sınırlanması

Aşırılık önlemek için basit bir yol, ağacın en derin derinliğini kapmak. Derinlik, en derin yaprakla bu hiperparametreden gelen derinlikleri kontrol eder. Deeper ağaçlar daha karmaşık ilişkiler modelleyebilir, ancak veri setinin karmaşıklığına göre daha fazla hassastır. Birçok veri setleri için, 5 ila 15 iş arasında bir derinlik kontrol eder, ancak bu hiperparametreyi çapraz-validasyon kullanarak ayarlamanız gerekir. Deep Tree özellikle de kullanılabilir.

Limiting derinliği klasik bir ön kovalama tekniğidir. Ağacı küçük, gürültülü alt setlere dayanan bölünmüşlerden uzaklaştırır: 3 ila 5, geçerliliği gözlemleyin ve performans boşluğunu takip ederken yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaş yavaşlayın.

Splits için minimum Örnekler ve bırakın

Başka bir güçlü ön test yöntemi, istatistiksel olarak anlamlı bölümlere destek vermek için yeterli veri olduğundan, ayarlandığında 1, 10 örnekten daha az sayıda örnek daha fazla bölünmüş olamayacağı anlamına gelir.Bu parametreler, bölmelerin yalnızca bu eşiğine yeterince veri sağladığını sağlar. Örneğin, ayarlandığında 1,8.

Bu parametreler özellikle küçük ölçekli veri kümeleri için aşırılık sürekli bir tehdittir. önyargıya mal olan hafif bir artış pahasına, genellikle genelleştirmede net bir kazanç elde ederler.

Özel Seçim ve Boyut Azaltımı

Karar ağaçları, ilgili özellikleri geri almak için nispeten sağlamdır, ancak özelliklerin sayısı örneklerin sayısına göre büyük ölçüde bağlıdır, ağaç, tartışmalı korelasyonları seçmekle kolayca aşırı kullanılabilir. Özel seçim - ne manuel veya otomatik teknikler aracılığıyla - bu riski azaltır. Ortak yaklaşımlar şunlardır:

  • Düşük değişken veya diğerleriyle yüksek korelasyon ile özellikleri geri yükleyin.
  • En bilgilendirici özellikleri seçmek için tek değişkenli istatistik testleri (örneğin, chi-squared, karşılıklı bilgi) kullanmak.
  • Daha az önemli özellikleri gözden geçirmek için recursive özellik ortadan kaldırma (RFE) uygulamak.

Müdür lüm Analizi (PCA) aynı zamanda bir karar ağacı eğitimi almadan önce boyutsalliği azaltmak için de uygulanabilir, ancak ağacın yorumlanabilirliği orijinal özelliklerin lineer kombinasyonları haline gelir. Uygulamada, alan bilgisi kullanarak sadece en alakalı özellikleri kullanarak eğitim süresini azaltır.

Hiperparametre Tuning için Cross-Validation

Cross-validasyon, modelin nasıl performans gösterdiğini değerlendirebilirsiniz. Bu, genelleme hatasının güvenilir bir tahmini sunar, ancak doğru hiperparametreleri bulmak için gereklidir (tipik olarak 5 veya 10 kat) eğitim verilerini birden çok katlara bölmek için, k-katılım oranlarına (kullanıcı alt üst sınıflar için) ve bir sonraki sürümlerde (çok küçük veri setleri) gerçekleştirilir.

Hiperparametreleri maksimum derinlik gibi ayarlandığında, minimum örnekler bölünür veya parametre α, çapraz doğrulama sizi katlamadan aşırı yüklemenizi önler, örneğin 100 derinlik değerini deneyin ve en düşük doğrulama hatasıyla birini seçin, bu tek doğrulama ayarını kullanarak riskinizi azaltırsınız.

Daha İyi Genelleştirme için Gelişmiş Teknikler

Temel stratejilerin ötesinde, birkaç gelişmiş yöntem, karar ağacı modellerinin genelleştirilmesini dramatik bir şekilde artırabilir, genellikle bazı yorumlanabilirliğin maliyetinde.

Ensemble Yöntemler: Bagging ve Rastgele Ormanlar

Ensemble learning, birden fazla ağaç birleştirerek varyanlığı azaltır. En ünlü yaklaşım, rastgele bir özellikten çok daha iyi örneklerle ilgili birçok karar ağacı inşa eden ve rastgele özellik alt setlerini her bir bölme için kullanır.The most famous approach is the Random Forest, which builds many decision tree on bootstrapped example of the data and uses a model that generalizes far better than a single tree. Bagging (Bootstrap Aggregating) or vote (forration) is a simple version that only uses to speak methods over random feature.

Rastgele Ormanlar sağlam ve sık sık yorumlanabilirlik önemli değildir. Çok sayıda özellik iyi çalışır ve hiperparametre seçeneklerine daha az duyarlıdır. Ticaret-off, şeffaf karar verme sürecinin kaybıdır: özellik önemini görebilirsiniz ama tek bir açık karar yolu değil.

Güçlendirici ve Düzenlileştirme

Gradient Boosted Trees gibi algoritmaları artırmak (örneğin, XGBoost, LightM) ağaçlara ek olarak, öncekilerin hatalarına odaklanan yeni ağaç, aynı zamanda birçok ağaç büyütmeye izin verildiğinde, modern uygulamaların öğrenme oranı, altsample oranları gibi düzenli olarak yapılan parametreleri içerir ve L1/L2’nin yaprak ağırlığına benzer şekilde ağırlıkları düzeltmesi gerekir.

Erken Durma

Eğitimin ensemble modelleri (özellikle de artırmak), erken durdurma, aşırılıktan kaçınmak için pratik bir yoldur. Daha fazla ağaç eklerken geçerli olan ve doğrulanan hatayı durduran birkaç tura kadar eğitimden önce en iyi şekilde ulaşılabilir.

Generalization için Pratik İş Akışı

Sistemli bir iş akışı, iyi bir şekilde genelleştirilmiş karar ağacı modelleri oluşturmanıza yardımcı olabilir.Bu adımları izleyin:

  1. [FONT:0) Basit başlayın: [Dönetici:0] Eğitim ve geçerlilik doğruluğu arasındaki büyük boşluklara bakın - bu aşırılık sağlar.
  2. [FONT:0) Uygulama öncesi kısıtlamalar: Maksimum bir derinlik ayarlayın (örneğin, 5), minimum örnek bölme (örneğin, 10), ve minimum örnek yaprak (örneğin, 10.g., 5).
  3. [FONT:0)Perform çapraz-validasyon ızgara arama: Derinlik kombinasyonları test etmek için 5 katlık bir çapraz-değerleme kullanın, min samples leaf, ve pruning parametreleri.
  4. [FONT:0)İlginç:[Dönetici: 0,0) Başlangıçta tam bir ağaç kullanıyorsanız, maliyetle uyumluluk (Xα'yı seçmek için çapraz değerle) uygulayın.Bu genellikle yalnız başına önceden yükleyiciden biraz daha iyi bir model verir.
  5. [FONT:0)Try ensembles:[Dönetici:[Dönetici:0)[Dönetici: 0))Eğer maksimum performansa ihtiyacınız varsa, bir Random Forest veya Gradient Boosting modeline geçiş yapın. Tune ensemble-specific hiperparametres (bine, maksimum derinlik, öğrenme oranı vs.
  6. [FONT:0]Bir iş yerinde yapılan test setinde güncel: Tüm ayarlandığında, gelişme sırasında hiç kullanılmadığı ayrı bir test setinde son modeli değerlendirin.

Bu süreçte, her zaman variance-bias ticaretinde bir göz tut. En düşük doğrulama hatası ile en basit model genellikle verilen veriler için en iyi genelleştiricidir.

Öğrenme Curves ile Aşırı Bakım

Öğrenme eğrileri mükemmel bir teşhis aracıdır. Planlama eğitimi ve geçerlilik (veya çapraz-validasyon) örnek sayısına karşı puanlar. aşırılık senaryoda, eğitim eğrisi önemli ölçüde daha düşük iken yüksek kalır ve boşluk daha fazla örnek olarak küçülmez.

Öğrenme eğrileri ayrıca veri toplama konusunda karar verebilir. Daha fazla eğitim örneği önemli ölçüde eğitim ve geçerlilik puanları arasındaki boşluğu azaltırsa, daha fazla veri toplamanın en iyi çözümü olabilir.

Gerçek Dünya Örneği: Kredi Temsil Etmeyi Tahmin Etmek

Örnek olarak, bir bankanın kredi başvuru sahibinin varsayılan olup olmayacağını tahmin etmek istediği bir sınıflandırma problemini düşünün.Veri setinin 10.000 örneği ve 50 özelliği vardır ( gelir, kredi puanı, borç- gelir oranı vs.). Bir ikna edici karar ağacı, 99.8 eğitim doğrulukuna ulaşır, ancak sadece% 78'i düzenlenen bir test setinde bulunur.

Stratejileri uygulayın:

  • max derinlemesine 8 – geçerlilik doğruluk% 85'e atlar.
  • Set min samples split to 20 - doğrulama doğruluk% 87'ye yükseltilir.
  • Geç-validasyon ile maliyet-komblemi inceler; seçilen α=0.002 derinliği 10 ve geçerlilik doğruluk% 88.
  • Son olarak, 200 ağaçla bir Random Forest (max derinlemesine=12) tek ağacı bilgilendirin.

Bu ilerleme, kasıtlı kısıtlamaların güvenilir bir tahminciye nasıl aşırı bir makyaj modeli haline geldiğini gösteriyor.

Dış Kaynaklar ve Daha Fazla Okuma

Daha derin bir şekilde atlatmak isteyenler için, burada yazar kaynakları vardır:

  • [FONT:0]Scikit- Learning Decision Tree Documentation) – tüm parametreleri ve pruning with [[ENFLT:2).
  • [FONT:0)Wikipedia: Overfitting - geniş bir istatistiksel bakış açısı sağlar.
  • [FONT:0]R-Bloggers: Karar Ağacı ve Overfitting[[[Dönetici: 1) - kod örnekleri ile pratik bir öğretici.
  • [FONT=0]Scikit- learning Cross-validation Guide[[[Döndüşüm 1: 1) modelleme için çapraz-validasyon nasıl kullanılacağını öğrenin.
  • [FONT:0)Makine Öğrenme Mastery: Random Forest Ensemble[[Dönetici: 1 ) – iyi genelleştirilmiş rastgele Ormanlar inşa etmek için bir adım kılavuz.

Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç

Aşırılık, karar ağaçları kullanırken doğal bir risktir, ancak rastgele Ormanlar ve Gradient Boosting, bireysel ağaçlar arasındaki fark, özellik seçimi ve titiz hiperparametre ayarlayarak, çapraz değerleme kullanarak, daha sağlam genelleştirme, ensemble yöntemleri, Random Forests ve Gradient Boosting, bireysel ağaçlar arasındaki farkları tamamen ortadan kaldırmak için daha güçlü bir koruma sağlar.