Karar ağaçları, eğitim verilerinin her nuance'ı öğrenen bir karar ağacının yeni, görünmeyen verilere genelleştirilmesi için tercih edilir.Bu fenomen - ağaç temelli modeller ile çalışırken birincil meydan okuma.

Bu kılavuz, karar ağacının incelenmesi, alttan pratik adımlara kadar bir ağaç inşa edip, scikit-do gibi bir kütüphanede bir model oluşturmanız ve nasıl prune'nin güvenilir performans elde etmek için kritik olduğunu anlamanızı sağlar.Her iki ön plandan de uygulama adım atıp, derin bir şekilde atlamanız veya düzeltme yöntemiyle (en yaygın olarak kullanılan post-prunlama yöntemi gibi) doğru şekilde iş birliği yapmak için en iyi uygulamaları paylaşmak için iyi uygulamaları paylaşmak, değerlendirme stratejileri ve en iyi uygulamaları paylaşmak için en iyi uygulamaları paylaşmak.Sonunda, doğru şekilde karar ağaçları doğru şekilde ayarlamanız ve doğru şekilde modellemek için donanımlı olacaksınız.

Karar Ağacı Pruning

Pruning, düşük tahminli güce sahip olan şubeleri kesmekle karar ağacının boyutunu azaltmaktır. Amaç, ağacın sadece verideki en önemli kalıpları yakalamak, böylece gürültüyü en yüksek derinliklere yükselterek geliştirmektir - her yaprak bir tek eğitim örneği veya başka bir bölünme mümkün değildir - bu yüzden mükemmel ama gürültülü bir eğitim seti.

Pruning savaşları kasıtlı olarak artan önyargı ile aşırı yükleme (daha basit bir model bazı ince kalıpları kaçırabilir) ve ağaç temelli modellerde yönetmek için en uygun yollardan biridir.The optimal prune achieve the lower possible generalization error by trade off these two resources of error.This önyargı-variance tradeoff is center to all machine learning, and pruning is one of the most direct ways to manage it in tree-based models.

Prune? Overfitting Maliyeti

Bir çözülmemiş karar ağacı son derece derin bir şekilde büyüyebilir, verilerin oldukça düşük noktalarına göre modele oldukça hassas hale getirir.Her bir bölme, modelin karmaşıklığını, belirli bir alana daha küçük bölgelere bölmek için artırır. Pruning, eğitimin verileri neredeyse mükemmel bir şekilde uyum sağlarken, aynı zamanda küçük korelasyonlara veya gürültülü olaylara dayanan küçük dalgalanmalara da son derece hassas hale getirir.

Ayrıca yorumlanabilirlik aşırı bol ağaçlarla da acı çekiyor. Birçok seviyedeki bir ağaç, büyük, siyah kutulu bir ağaçtan daha değerli hale gelir. Pruning, marjinal iyileştirmeler sunarken temel karar mantığını koruyan daha kompakt bir ağaç üretir.Birçok gerçek dünya uygulaması için, daha küçük ve biraz daha doğru olan bir ağaç büyük, siyah kutu ağacından çok daha değerli.

Pruning Türleri: Pre-Pruning vs. Post-Pruning

Karar ağaçlarının düzeltilmesi için iki geniş strateji vardır: önceden (ayrıca erken durak olarak da adlandırılır) ve post-pruning (ayrıca pruning veya kesmeyi de çağırın). farklılıkları probleminiz için doğru yaklaşımı seçmek için anahtardır.

  • [FONT:0)Öylenceli bir şekilde, bir yaprakta minimum sayıda örnek almak için gerekli olan minimum sayıda örnek, veya minimum yetersizlik, eğitim sırasında belirli bir noktaya kadar büyümenin ötesinden engellenir, ancak daha erken bir şekilde büyümesinin çok agresif olabileceğinden dolayı, en erken büyümenin en iyi şekilde ortadan kaldırılması için en az sayıda örnek oluşturabilir.
  • [FONT:0]Post-pruning[Dönetici: 1. Sezon 1. Bölüm: Ağaç ilk önce tam boyutuna büyüdü (hepsi daha fazla ayrılmanın saf veya imkansız olduğu için) daha sonra genelleştirmeyi geliştirmeyen şubeler daha fazla hesaplamalı pahalı (tam ağaç ilk önce inşa edildiğinde) daha iyi sonuçlar üretmeye eğilimlidir.

Uygulamada, post-pruning (özellikle maliyet-komplexite pruning) daha popüler tekniktir, çünkü daha az keyfi durdurma eşleri ve genellikle daha iyi bir önyargı-değişim ticaretini sağlar. Birçok kütüphane, agresif şubelerin nasıl kesildiğini kontrol eden bir karmaşık parametreyi ayarlamanıza izin verir.

Post-Pruning Mekanikleri: Bir Adım-by-Adım Kılavuzu

Posta-pruning, tam bir ağaç yetiştirmenin sistematik bir sürecini içerir, performansını değerlendirin ve sonra seçici olarak şubeleri ortadan kaldırır.En post-pruning algoritmalarında kullanılan prosedürü belirli maliyet-komplexiteye vurgula.Eğitim ve geçerlilik setlerine (veya çapraz-validasyon kullanarak) bölünmüş bir veri kümesine sahip olduğunuzu varsayacağız.

Adım 1: Tamamen gelişmiş bir karar ağacı büyütün

İlk adım, derin veya yaprak büyüklüğüne dair herhangi bir kısıtlama olmaksızın eğitim verilere bir karar ağacı yetiştirmektir. Her bir yaprak saf olana kadar (veya mümkün olduğunca saf) veya başka bir bölünmeye kadar (örneğin Gini impurity veya entropi gibi) bu “makimal” ağacının neredeyse kesinlikle eğitim verileri üzerinde artmasına izin verir.

Büyüme sırasında, her bölünme en aza indirmek için seçilir. sınıflandırma için, ortak bir dürtü önlemi Gini dürtüsellik ve entropidir; regresyon için, varyans azaltma tipiktir. ağaç, önyükleme koşullarıyla karşı karşıya kalır (göstermete iyileşme, tüm örnekler aynı sınıfa ait değildir, ya da en az sayıda örnek içerir.

2. Adım: Full Tree'in Performansını Evaluate

Ağaç inşa edildiğinde, performansı geçerli bir işlem setinde değerlendirin (veya eğitim verilerinin kullanılması) Doğruluk ( sınıflandırma için) kayıt ölçümleri, kareli hata (regresyon için), ve düğümlerin sayısı veya yaprakların sayısı karşılaştırılacaktır.Bu temelleme seti eğitim verilerinden ayrı olmalıdır - eğitim performansına yönelik kararlar, çünkü bu aşırı yüklemeye devam edecek.

Ağacın yapısını incelemek de faydalıdır: büyük ağaçlar genellikle sadece bir avuç eğitim örneği tarafından desteklenen birçok şubeye sahiptir. Bu şubeler, gürültüyü yakalama olasılığı yüksektir, çünkü ağacı görselleştirmek için büyük ölçüde yardımcı olabilir (bir metin gösterimi olarak bile).

3. Adım: Maliyet-Complexity Pruning kullanarak Ağacın

Maliyet-komplexite (ayrıca en zayıf bağlantı noktası olarak da bilinir) standart posta kodudur (T) = R (T) + α * |T|, R (T) için bir cezayı tanıtarak çalışır. - verilen bir ağaç T, maliyet-komblemi ölçütleri tanımlar, R ) = R (T) + α * * * |T) + α * |T|bent|bent x|bent |bent x x x x

Bu işlem tam ağaçla başlar (α=0). Daha sonra “en iyi bağlantı”yı tanımlar - R (T)'deki en küçük artışları geri alır. Bu düğümü en aza indiren bir altağaçtır (provertize edilmiş) ve yeni ağaç kaydedilir.

En iyi α (ve böylece en iyi altağaç) seçmek için, çapraz eşdeğerlik önemlidir. Aynı pruning yolu eğitim verileri üzerinde üretilir, ancak sonra her aday subtree geçerli bir dizi üzerinde değerlendirilir. α en düşük doğrulama hatası seçilir ve karşılık gelen pruned ağaç otomatik olarak ağaç karmaşıklığı ve tahmin edilebilir bir doğruluk olur.

Uygulama Örnekleri Uygulama Örnekleri

S:0) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇

Adım 4: Prud Ağacı Geçerli

En iyi α'yı seçtikten sonra, son ağacı tam eğitim setinde (veya tek bir geçerlilik bölünmüş kullanıyorsanız) bu α'yı kullanarak, performansınızı herhangi bir zaman değerlendirme için kullanılmadığı ayrı bir test setinde değerlendirin.Bu son değerlendirme size, pruned ağacın üretimde nasıl iyi bir şekilde genelleştirileceğini tahmin eder.

Bu ayrımın aynı zamanda pruning sürecinde de kullanılabileceğini belirtmek gerekir: her α adayı için eğitim verileri ve ortalama geçerlilik hatası üzerinde k-katılım haçlı geçiş yapmak.Bu yaklaşım hata tahmininin ve genellikle daha sağlam bir prömiyerlere yol açıyor.

Maliyet-Komlektiflik Detaylı

Maliyet-komplexitenin düzeltilmesi, hakim posta yöntemidir, daha yakın bir görünüm hak eder. Algoritmanın incelikli ağaçlardan tam bir dizi üretebilme yeteneğinde, en maximal ağacından her bir ağaca karşılık gelir.

Anahtar matematiksel fikir, “en iyi bağlantı” kriteridir. Her adımda, algoritma değer g(t) = (R(t) - R (T) / (|T[D)[Dönetici[Dönetici) alt kutuya doğrultulabilir.

Bu yöntem güçlü teorik temellere sahiptir. altağaçların sıralarının herhangi bir α için en uygun olduğunu garanti eder, R) Bu zayıf bağlantı yolundan aşağıya doğru ilerlerken, uygulayıcılar genellikle hatanın stabilize olduğunu tespit eder (α)

Alfa'yı Cross-Validation ile seçin

α'yı seçmek için sağlam bir yol, eğitim verileri üzerinde çapraz değer kullanmaktır. Her bir kat için, tam ağacı ve pruning yolunu hesaplamak, sonra her bir alt kutuyu daha basit modellere tercih etmek için.Bu kural özellikle de hata eğrisi ile ilgili hataların en az olduğu için, geçerli ayarlanan sete karşı korumayı sağlamak için kullanışlıdır.

α'yı seçtikten sonra, orukT:4 ile belirlenen tüm eğitimdeki ağacı yeniden eğitin. Sonuç olarak, bu işlem birçok istatistiksel öğrenme kütüphanesinde uygulanır; örneğin, [[Dönetici Öğrenmeye Giriş). R.D.'de örnekleme örnekleri ile mükemmel bir tedavi sağlar.

Pruned Trees'leri Evaluating Pruned Trees

Bir pruned ağacının belirlenmesi, bir test setinde doğruluğunun ötesine geçer. Ayrıca stabilitesini, yorumlanabilirliği ve performansını farklı alt dizilerdeki verilerle değerlendirmeniz gerekir.The following are recommended evaluation applications:

  • [0]Tamamlanmış ağaç, tam ağaça karşı [Dönetici: Her iki ağaç da test setinde daha kötü performans gösterir.
  • [FONT:0) Öğrenme eğrileri [[Dönetici: 1.)) Uygulamalı öğrenme eğrileri [Döneticileri ve geçerlilik hatası, ağaç büyüklüğü veya α işlevi olarak tanımlayabilirsiniz. İki eğri arasında geniş bir boşluk, bu boşluğu izlemek için; bu eğrilerin şekillerini izleyerek, en iyi karmaşık karmaşıklığı tespit edebilirsiniz.
  • [FONT=0)Measure karmaşıklığı doğrudan[Dönetici: Son ağacın yaprakları ve derinliğini sayın. Örneğin, 200 yerine 20 yaprakları, tam bir resim vermek için doğrulukla ilgili olarak bu ölçümleri daha kolay hale getirebilir.
  • [FONT:0] Birden çok rastgele bölünmeler üzerine tarih[Dönetici: Çünkü prömülme kararları eğitim/validasyon bölünmüşlüğünden etkileniyor, birden çok rastgele bölünmeleri veya tekrarlanan haçlılığı deneyin.En iyi α yaygın olarak değişirse, veriler çok gürültülü olabilir ve diğer modelleme yaklaşımlarını dikkate almalısınız.

Pruned Ağacının Yorumu

Takin edilen karar ağaçlarının en büyük avantajlarından biri yorumlanabilir.Kayıttan sonra, ağaç, model kararlarının denetim edilebilir olduğu konusunda sadece bölünmüşlerdir.

Etkili Pruning için En İyi Uygulamalar

Takinatın faydalarını maksimize etmek için, bu kanıt tabanlı yönergeleri takip edin:

  • [0]Ayrıca, ayrı bir geçerlilik seti veya çapraz-validasyon[[Dönetici] kullanır.
  • [FONT=0) Hem önceden belirlenmiş hem de post-pruning) ile ilgili ayrıntılı bilgi sahibi olmak, daha sonra bir ön bölme sınırı birleştirmek (örneğin, 5-10) ile birlikte, daha sonra çalıştırılan bir süre boyunca eğitim süresini azaltabilmektedir.
  • [FONT:0)Balance karmaşıklığı ve doğruluk[Dönetici:0]. Hedef, eğitim setinde en yüksek olası doğruluk elde etmek değil, genelleme hatasını en aza indirmek için geçerli eğrileri kullanın. daha fazla düğümlerin geri dönüşlerini azalttığı noktayı bulmak için geçerli eğrileri kullanın.
  • [FONT:0]Bir parçadan yoksundur, biraz daha büyük bir ağaçtan daha kötü bir teste sahiptir (örneğin, daha küçük bir αS).
  • [FONT:0)Mevcut olduğunda alan bilgisi . Belirli özellikler sorumsuz veya güvenilmez olarak bilinirse, onları bölme adaylarından manuel olarak dışlayabilirsiniz. Ancak pruning genellikle zayıf özellikler üzerinde bölünecektir.
  • [FONT=0) Bu belge, üretim sistemlerindeki pruning stratejisini[Dönlendirme) içerir, α'yı seçin, terk edilen noktaları ve çapraz eşdeğerleme sonuçları sağlar.

Karar Ağacı Prunings'te Ortak Pitfalls

Deneyimli uygulayıcıları bile, bu tuzakların farkında olmak onlardan kaçınmanıza yardımcı olacaktır:

  • [FONT:0) Geçim olmadan ([Dönlendirme): Rehberlik için tek bir geçerlilik seti kullanarak bu riski birden fazla bölmeye yol açabilir (bazen “validasyon seti).
  • [FONT:0) Maliyet-kompiyon yolunu görmezden gelir ([Dönetici: Tüm pruning yolunu incelemeden doğrudan belirli bir α'ya atlayın, her zaman alfaların tam sırasını ve her şeyi değerlendirmenize neden olabilir.
  • [FONT:0) Son derece küçük veri setlerine ([[Dönetici: 1)) uygun olmayan bir şekilde, herhangi bir bölünme önceden (tavaş ağacı) kullanarak, küçük örnekleri daha iyi idare eden bir alternatif model kullanabilir.
  • [FONT:0] uygunsuz yetersizlik önlemleri : Gini ve entropi genellikle benzer sonuçlar verir, ancak regresyon ağaçları için, variance azaltımı standarttır.
  • [FONT:0)Zizden sonra yeniden eğitim almak için geri bildirimde bulunun.[Dönetici:0)))[MİLMİŞKİNCİYLEŞİ:0) Tüm eğitim veri kümesine o α ile ağaç yeniden eğitimle yeniden eğitim vermelisiniz. Bazı uygulayıcılar yanlı bir geçişten alt kutuyu yanlış bir şekilde kullanmalıdırlar.

Bir başka ince hata, sınıf ağırlıkları veya kullanım maliyetinin daha iyi sonuçlara yol açabilmesi için tedavi edilir.For highly dengesizliked datasets or problems with very different yanlışclassification costs, standard pruning may not be appropriate. In such cases, adjusting class ağırlıks or using cost-sensitive impurity measure before pruning can lead to better results.

Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç

Pruning, iyi bir ağaç yetiştirmenin ve sonra maliyet-komblemi kullanarak zayıf şubeleri temizlemenin, hem doğru hem de yorumlanabilir bir model elde edebilirsiniz. adım adım adım adım adım adım süreci - tamamen, değerlendirme, prune via cost-validation, and retrain-provides a reliable flow for most Classification and regresyon tasks.

Takuning avantajları doğruluk ötesine uzatıyor: daha küçük ağaçlar, yüksek bölmelerde ve daha güvenilir dağıtmayı daha hızlı değerlendirmek için daha kolay, ancak her zaman tercihlerinize güvenebileceğiniz türden kuvvetlere güveneceksiniz.

Unutmayın ki, pruning bir tek çıkış aktivitesi değildir. Eğitim verilerini güncellediğinizde veya yeni özellikleri eklerseniz, en uygun ağaç yapısı değişebilir. Dönemsel olarak yeniden değerlendirilebilir ve karar ağaçlarınızı uygun özellik mühendisliği ve hiperparametre ayarını gerçekleştirmek için yeniden yapılandırın, pruning, yorum yapmadan ağaç tabanlı modellerden en yüksek tahmin edilebilir değer çıkarmanıza yardımcı olacaktır.