Karar Ağacı Limitlerini Anlamak

Karar ağaçları sezgisel yapısı ve yorum kolaylığı nedeniyle makine öğreniminin temel taşıdır. Tek bir ağaç, eğitim verilerindeki küçük varyasyonları bölmek, tamamen farklı bir ağaç oluşturmak için oldukça hassastır.Bu istikrarsızlığın, genellikle ağaç algılayıcılarının doğrultulmasını sağlar.

Ensemble Yöntemleri Nedir?

Ensemble yöntemleri birkaç temel model birleştirir - bu durumda, karar ağaçları - tek bir tahmin sistemi için. temel prensip, birçok zayıf öğrencinin (sadece rastgele şanstan biraz daha iyi performans gösteren modeller) güçlü bir öğrenme yöntemi oluşturmak için birleştirilebilir.Bu yaklaşım kalabalığın bilgeliğini kullanır: bireysel modeller hata yapabilir, ancak bu hatalar ilgili değilse, bir sürü düzeltme modeli veya oylamayı diğerlerinden uzaklaştırır.

Bagging ve Random Forest: Variance'ı Yeniden Üretin

Bagging Mekaniği

Bagging, eğitim verilerinin farklı rastgele alt setlerinde birçok karar ağaçları tarafından eğitim yoluyla çalışır.Bu alt setler, botlarla oluşturulur - değiştirilmesi ile karıştırılır - böylece her ağaç, orijinal veri kümesinin biraz farklı bir dilimi görür. Çünkü ağaçlar derin (zenginsiz büyüdü), her bir ağaç, özellikle de yüksek yeteneğe sahip ve çok düşük önyargılıdır.

Random Forest: Özel Sampling ile Bagging

Rastgele Orman, rastgele bir alt kümesine ek olarak bağlanır. Standart çantada, her ağaç, bölünmüş bir parça haline geldiğinde mevcut tüm özellikleri görür. Rastgele Orman, diğer yandan, her biri rastgele alt üst katlara bölünmüştür. Bu güçler ağaçlar daha da farklı olabilir - her zaman en güçlü tahmincilere güvenebilirler, böylece alternatif desenler öğrenir.

[FONT:0)Dön kaynağı:[Dönetici:2)[Dönetici-ödücüksel Enflajlama belgeleri) Yazara uygun uygulama ayrıntıları sağlar.

Boosting: Bias Sequentially'yi Yeniden Üretin

Nasıl Güçlendirmek

Kağıtların paralel olarak, inşa edilen ağaçlardan yararlanın, ilk ağaç, önceki veri setlerine etkili bir şekilde eğitim verilir.Eğitimden sonra, algoritma yanlış sınıflanmış örnekleri tanımlar (veya büyük bir ağaç geri dönüşümde) ve tüm ağırlıklarını artırmak için çalışır. sonraki ağaç daha sonra, daha sonra açık bir şekilde incelenebilir, daha düşük önyargılı ağaçlarla birlikte öğrenmemiz gerekir.Bu işlem daha erkenden çok fazla sayıdaki hataları tekrarlanır.

AdaBoost (Adaptive Boosting)

AdaBoost, ilk pratik güçlendirme algoritmalarından biriydi. Her eğitim örneği için ağırlıklar atar, her ağaçtan sonra onları günceller. Son tahmin, özellikle de sığ karar stumps ile birlikte (yalnızca bir hata payı olan ağaçlar daha yüksek etkiye sahip) ağırlıktır. AdaBoost, gürültülü verilere ve aşırılığa duyarlıdır, çünkü yanlış sınıflanmış noktalara aşırı önem verir.

Gradient Boosting

Gradient, kayıp fonksiyonunun her yeni ağacın, mevcut tahminlere göre artırılmasına yardımcı olur.Kabul edilebilir hata kaybı için bu büyük esneklik sunar - regresyon, sınıflandırma, sıralama ve hatta özel hedefler için optimize edebilirsiniz.The algorithming the most successful applications -XGBoost, LightGBM ve Cat mevcut tahminlere saygı ile. -add- criticalisation, ağaç optimizasyon stratejileri ve hesaplamaları optimize etmek için yönteme eşdeğerdir.

XGBoost

XGBoost (Extreme Gradient Boosting) düzenli olarak tanıtıldı (L1 ve L2) doğrudan objektif işlevine, sütun altları ve bir sparsity-aware bölme algoritmalarının ele aldığı algoritmayı ele alır. önbellekli erişim modelleri ve aşırı derecede hızlı bir şekilde yapılır. XGBoost, Kaggle yarışmalarına doğru bir şekilde doğruluk, hız ve esneklik nedeniyle hükmedmiştir. Key hiperparametreleri öğrenme oranını içerir (eta), maksimum derinlik, subsample oranı, colsample bytree ve kumarı sağlar.

[FONT=0)Dön kaynağı:[Dönetici:0)[[Dönetici:0))[[[Dönemli)))[[[[[değiştir | kaynağı değiştir]

IşıkGBM

LightGBM, büyük gradientler ile ilgili örnekleri ele almak için Gradient One-Side Sampling (GOSS) ile ilgili olarak, büyük kartelasyonelleri azaltmak için sürekli olarak çalışır ve Özel Özel Özellik Bundling (EFB) boyutlandırmak için tasarlanmıştır. LightGBM büyük ölçekli veriler için tasarlanmıştır ve sık sık sık sık sık yaprak bazlı ağaç büyüme üretir, ki bu durum normalleştirilemez.

CatBoost

CatBoost (Categorical Boosting) kediye dayalı özellikleri yerel olarak sipariş edilen hedef kodlamayı kullanarak, hedef sızıntıdan kaçınır.Süresel değişkenler (balanced broşürübilitesi) ve yüksek çözünürlükte bir strateji kullanır. CatBoost genellikle en az ayarlı, özellikle de birçok kategorik değişkenle datasets üzerinde güçlü performans elde eder.

Birbirlerine güç vermek: Her şeyi kullanmak için ne zaman

Rastgele Orman gibi Bagging yöntemleri gürültü ve aşırılıkçılara karşı sağlamdır, çünkü ortalama derin, aşırılık ağaçlara sahiptir; performans tavanın ötesinde eğitim verilerini nadiren üstlenebilirler. - Temiz, özellikle de yüksek tahminli güçlere ihtiyaç duyan, genellikle daha yüksek doğruluk uygulayıcılarına ulaşır, ancak dikkatli bir şekilde düzenli olarak geri çekilmeye ve sonra tekrarlamaya başlayan birçok irrelevsel özellik veya güçlü gürültüyü geri yüklemeye başlayabilirler.

Bağlanma ve karıştırma: Farklı Modellerle Kombine Etmek

Farklı modellerden gelen tahminleri birleştirerek ağaç-tavısıltma (örneğin, bir rastgele orman, bir XGBoost, bir lojistik regresyon ve bir sinir ağı) temel modellerin daha iyi bir şekilde toplanmasını sağlar.

Ensemble Performansını Geliştirmek için Pratik İpuçları

Ağaçlar arasında çeşitliliği sağlamak

Ensemble yöntemleri sadece bileşenlerinin çeşitliliği kadar güçlüdür. Tüm ağaçlar aynı tahminleri yaparsa, bunları birleştirebilmeden fayda yoktur. Çeşitlilik farklı veri alt kümelerini kullanarak ortaya çıkar (bootstrap örneklerini), farklı özellik alt kümeleri ve farklı ağaç derinliğinden gelir, ancak öğrenme oranı çok yüksek veya ağaçlar çok derinleşirse, bağlantı çok hızlı bir şekilde değişebilir.

Hiperparametre Tuning

Her bir benzerlik yönteminin kendi kritik hiperparametreleri vardır.For Random Forest, ağaçlar sayısı derinliği ve özellik kesimlerinden daha az önemlidir.For boosting, learning rate (shrinkage) ve ağaçlar sayısı yakından bağlantılıdır: daha küçük bir öğrenme oranı genellikle daha fazla ağaç gerektirir, ancak XGBoost'te daha fazla risk gerektirir.

CrossValidation and Evaluation

Eğitim sırasında aynı verilerle bir araya gelmeyin.K=5 veya 10) bir dizi tur için iyileştirmeye karar verirken, hedef sızıntıyı meta-öğrenme performansına yönlendirmek için kullanılmalı.

Özel Mühendislik ve Seçim

Ensemble yöntemleri, sorumsuz özellikleri yaratmak için sağlamdır, ancak yüksek çözünürlüklü sütunları kaldırmak hala performans geliştirmek ve eğitim süresini azaltmak için gerekli değildir.Bir ön rastgele Orman veya gradient güçlendirme modelinin filtre özellikleri oluşturmak için kullanılır. etkileşim özellikleri oluşturmak için, binize özellikleri veya alan özel dönüşümleri kaldırmak, aksi takdirde öznel ölçeklendirme genellikle karar verme zamanı gerektirir.

Düzenlileşme ve Erken Durma

Güçlendirme çok fazla sayıda iterasyon veya aşırı karmaşık ağaçlarla aşırıya eğilimlidir.Sürekli bir şekilde çalıştırın (öğrenme oranı <0.1), limit ağacı derinliği (3-6 çoğu problem için), ve yaprak başına minimum sayıda örnek ayarlaması XGBoost'in kumar parametresi, düzenli olarak yapılan bir şekilde hareket etmek için minimum kayıp azaltma gerektirir.

C ⁇ Maliyeti

Rastgele Orman trenleri kolayca paralel olarak, çünkü ağaçlar bağımsızdır - tüm mevcut temelleri kullanın. Boosting doğal olarak eşdeğerdir, ancak IşıkGBM ve XGBoost gibi bir karar ağacının bu az eğitim süresini azaltmak için dağıtılabilir ve GPU en iyi bir eğitim sunar.Eğer daha hızlı bir şekilde, 10-20 ağaç daha önemliyse, ve tamamen beyaz bir kutu modeline ihtiyacınız var.

Gerçek Dünya Tahminleri ve Ticaret-Resimler

Ensemble yöntemleri dramatik bir şekilde doğruyu geliştirir, ancak yorumlanabilirlik pahasına gelir. Tek bir karar ağacı, paydaşların görüntülenmesi ve açıklanabilir; yüzlerce ağaçtan oluşan bir Random Forest, aynı yönde (örneğin, kredi puanlamaları, sağlık), ek olmayan etkileşimleri kullanmak zorunda kalabilirsiniz), engin şekilde, farklı bir türdeki örnekleri ele almak için, önyargıları ortadan kaldıramaz.

Son olarak, ensembller üretimde hizmet etmek için daha fazla hafıza yoğun ve daha yavaştır, çünkü her ağaç, katı geçncy gereklilikleri ile girişleri değerlendirmelidir. - Düşük kanal ağaçlarını (daha küçük ağaçlarla), daha küçük bir karar ağacının doğruluğa ve hıza kadar en iyi dengeyi kullanarak.

[FONT:0)Dön kaynağı:[[Dönetici:2) Wikipedia'da Öğrenme[DÜDÜDÜDÜDÜDÜye Olmayanlar Teorisine geniş bir bakış açısı sağlar.

[FONT:0)Dön kaynağı:[Dönetici:0)[[Dönetici:0)Döntgen kaynağı:[Dönetici:0)[[Dönetici:0))[[Döneticileri Veri Bilimine Karşı Bir Yöntemlere İlişkin Pratik Kılavuz[Dönergeler[Dönergeler)[Dönemli, uygulamalı bir perspektif sunar.

Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç

Ensemble yöntemleri, karar ağacı modellerinin doğruluğunu ve sağlamlığını geliştirmek için en etkili yoldur. Birden çok ağaç torbasını kullanarak, güçlendirici veya yığınlama yoluyla birleştirerek, dikkatli bir şekilde doğrulama maliyetine bağlı olarak en iyi yaklaşım, doğrulayıcı kaynaklarınıza bağlıdır.