Karar Ağacı Model Değerlendirmesinde Cross-validasyonun Önemi

Karar ağaçları, en sezgisel ve yaygın kullanılan makine öğrenme algoritmaları arasında, modelleme ve geri dönüşüm görevlerine uygulanan alan alan alanlarla ilgili kararların, karar verme kurallarının, kullanıcıların bu kararın doğrulanmasının, doğrulayıcıların doğrulanmasının ve yasal olarak kabul edilmesi gerektiği gibi, doğrulayıcıların doğrulanmasının temel ilkelerin nasıl doğrulanması gerektiği konusunda karar vermeleri gerektiği konusunda karar verir.

Cross-Validation nedir?

Cross-validasyon, bir makine öğrenme modelini değerlendirmek için kullanılan bir resampling prosedürüdür ve sonra tek bir tren test bölmesine güvenmek yerine, trans-validasyon, tüm iterasyonlar boyunca performans puanlarını bölmek için kullanılan bir testtir.Bu işlem, özellikle de en az bir kez daha sabit bir şekilde test edilen verileri belirlemek için daha doğrulayıcı ve doğrulayıcı bir şekilde test eder.Bu işlem, her bir şekilde sabitleme için kullanılan verileri tekrarlanır.

Tarihsel olarak, çapraz değerleme, test setinde hangi özel arazileri değerlendirme ihtiyacından ortaya çıktı. En basit değişken, doğrulama geçerliliği, test sırasında verinin sabit bir kısmını geri yüklemektedir. Ancak, dikkat çeken noktalarda yüksek değerleme tahminleri üretebilir, çünkü bu modeller yüksek değişkenliklere sahiptir; bunlar, eğitim sırasında makine öğrenimi topluluğunda ve testlerde önemli ölçüde değişiklik gösterebilirler.

Karar Ağacı Neden Overfiting

Aşırı yükleme, bir model eğitim verilerini çok iyi öğrenirken, gürültü ve seslendirmeleri dahil, genel eğilim yakalama pahasına. Karar ağaçları özellikle birkaç nedenden ötürü aşırı derecede hassastır. İlk olarak, her bir yaprak sadece tek bir gözlem veya mükemmel bir şekilde saflaştırılıncaya kadar verileri bölmek, eğitim setinde tamamen farklı bir ağaçta nasıl değerlendirilebilir.

Küçük bir veri kümesi üzerinde 100 örnek ve birçok özellikte eğitilmiş bir karar ağacı düşünün. Ağacın 50 yapraklarına büyüdükçe, her yaprak bunu sadece birkaç örnek içerebilir.Eğitim setinde, ağaç, her örnekle sunulanda, özellikle de her örnekleme puanına sahip olacaktır.

Model Seçimi ve Hiperparametre Tuning'deki Cross-Validation Rolü

Basit değerlendirmenin ötesinde, çapraz değerleme model seçimi ve hiperparametre optimizasyonunda merkezi bir rol oynar.Bir karar ağacı inşa ederken, en iyi eğitim performansına sahip hiperparametreleri seçmeniz gerekir, bu da bir iç node bölme için gerekli olan minimum örnekleri ve en az sayıda örnek, bu seçenekler doğrudan modelin karmaşıklığı ve aşırı yükleme eğilimini kontrol eder.

Cross-validasyon aynı çapraz-validasyon işlemi kullanarak her modele kıyasla, değişkenlik için hesapların elde edilmesi gibi farklı modelleri karşılaştırmaya yardımcı olur.En iyi çapraz eşdeğer bir performansla model, dağıtım için seçtiğiniz bir oyundur, aynı eşdeğerliliği kullanarak değerlendirme ölçümlerinin ölçülmesi gerekir.For Selection procedure the same cross-validation conditions, right, sensitive, remember, F1-print, or area under the best cross-validated performance is one you should select for deployment, a admit if the assessment metric approachs with your business goal.For classroom tree, right, right, sensitive, remember, F1-mark, or area under the best cross-validation.

Cross-Validation Teknikleri Türleri

Çeşitli çapraz-validasyon teknikleri var, her biri kendi güçlü ve ticari-offs. Seçim veri kümesi boyutuna, problem tipine ve hesaplama bütçesine bağlıdır. İşte karar ağacı değerlendirmesi için en alakalı yöntemleri ele alıyoruz.

K-Fold Cross-Validation

K-katlı haçlılık, veri kümesi rastgele bölünmüş durumda.()))[Döneticileri, 10 puanlık bir kez daha doğrulanmış durumda.The model is training onÜcretsiz:2.k-1[DDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDD)[Döntmeler ve test puanları ile ilgili olarak, 10 puanlık bir süre daha yüksek çözünürlükte bulunur.

K-Fold Cross-Validation

Standart k-katılımsızlık, sınıf dağıtımları ile katlanabilir, özellikle hedef değişkeni nadir olduğunda.Bir sınıf dengesizliğinin sınıfsal tespit veya tıbbi tanıdan örnekle sona erdiğini değerlendirmenin önemli olduğunu varsayar.Stated k-fold çapraz-validasyon bunu her katta örneklerin yüzdesini korumayı sağlar.Bu, sınıf dengesizliğinin mevcut olduğu sınıf dengesizliğinin mevcut olduğu sınıf dengesizliğinin hangi sınıfsal ayrımı değerlendirildiği konusunda daha güvenilir performans tahminlerine yol açar.

Leave-One-Out Cross-Validation (LOCV)

LOOCV, her örnek bir kez tek bir test seti olarak kullanılır.Süresel olarak pahalı olan eğitimdir, çünkü her bir performans için oldukça hızlı olan, LOOCV'nin neredeyse her zaman kullandığı, en iyi performans için kullanılan bir test noktası olduğu gibi, her bir test seti olarak kullanılabilir.

Tekrarlanan K-Fold Cross-Validation

Tekrarlanan k-katlı geçiş, 15 kez tekrarlanan k-katılım işlemi tekrarlar.Verilerin tekrarlanan geçişleri, performans tahmininde değişkenliği azaltır. Örneğin, veri bölmeleri için 5 kat-validasyon gerçekleştirebilirsiniz, son derece tekrarlanan geçiş her zaman boyunca ağaç bu şekilde farklı zaman boyunca değişir.

Keepout Validation vs. Cross-Validation

Geçerlilik, verilerin bir kez bir eğitim setine ve test setine bölünmesi (örneğin, 80/20), daha basit ve daha hızlı ama yüksek sayıda bölünmüşten muzdariptir. Performans tahmini, test setinde arazinin güçlü olduğu ölçüde bağlıdır (örneğin, yüzlerce tane tutma veya gerçek bir performans, kötü model kararlarına yol açabilir. Cross-validasyon bunu çok daha düşük bir şekilde azaltılır.

Cross-Validation: Pratik Bir Rehber

Çoğu makine öğrenme kütüphanesi, çapraz değer için yerleşik destek sağlar. Python, theETHFLT:0) Kütüphane, karar ağacı modelleri için de facto standarttır. Örneğin, [[DÜyetim, eğitim ve puanlama işlemini otomatikleştirir.You Supply the default (e.g., 03:2).

Karar ağaçları için çapraz değer uygulamak, genellikle gereksizdir çünkü ağaçlar monoton dönüşümlere dikkat eder, ancak kateltüel değişkenlerin ölçeklendirilmesi veya kodlaması gibi, her eğitim katlarında veri sızıntılarından kaçınmak için yapılmalıdır.In scikit- learning to chain preprocessing steps with the model and feed the pipeline into theDMT:9. Bu nedenle her zaman standart zamanlı olarak kullanılan verileri tekrarlamanın kullanılması gerekir.UseFLT:8.

Ortak Pitfalls ve En İyi Uygulamaları

Pasaj güçlü bir araçtır, doğru şekilde uygulanmalıdır. Ortak bir hata, modeli değerlendirmeden önce özellik seçimi için çapraz değer kullanıyor.Eğer tüm veri kümesine dayanan özellikleri seçerseniz, test setinden bilgi sızdırıyorsunuz, aşırı derecede iyimser performansa yol açan bir seçim, her katlama işlemine göre yalnızca eğitim verileri kullanarak, puanların sabitleme yöntemine göre değişebilir.

En fazla veri setleri için )) veya [[DÜye değer (DÜye) veya [[DÜye/Üye))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))))

Bir diğer en iyi uygulama, istatistiksel önem testi ile model karşılaştırması için çapraz değer kullanmaktır. Model A'nın B modelinden daha yüksek bir anlamı var, fark çok kez çapraz onaylanabilir ve çift değişken farklılıkları hesaplayabilirsiniz.

Son olarak, çapraz-validasyon bir panacea olmadığını unutmayın. Aynı dağıtımdan eğitim verileri olarak çekilen veriler üzerinde performans tahmin eder.Eğer dağıtım verileri farklı bir dağıtımdan ( dağıtım değişikliği), çapraz-validasyon bunu ortaya çıkarmayacaktır.Böyle durumlarda, hedef alan hakkında daha fazla geçerlilik elde etmeniz gerekir.

Karar Ağacının Context of Decision Tree Ensembles

Karar ağaçları genellikle, rastgele ormanlar ve gradient güçlendirme gibi temel öğrenciler olarak kullanılır.Bir ağaçla kıyaslanma, çapraz eşdeğerlik, kümesleme için önemli kalır (sıralama, en iyi şekilde değerlendirilir).

Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç

Cross-validasyon, karar ağacı modellerinin değerlendirilmesinde vazgeçilmez bir araçtır. Sağlam, düşük seviyeli bir modele sahip olma yeteneği, verinin gerçek genel yeteneğine yönelik olarak algılanmasına yardımcı olur. Karar ağaçları, yüksek değişkenlik ve algılayıcılar kullanarak, bu titiz değerlendirmeden çok daha fazla yararlanın.