Karar Ağacı Modellerinde Multicollinearity Nasıl Çalışılır
Karar ağaçları, sezgisel yapısı ve basit yorumlanabilirlik için ödül alan makine öğrenme iş akışları için bir temeldir.Her şeyi kredi risk değerlendirmelerinden tıbbi tanıya kadar, genellikle başka bir teknik olmayan paylara ilişkin tahminler açıklama ihtiyacı olan veri bilim insanları için algoritması olarak hizmet ederler. Ancak sağlamlığa rağmen karar ağaçları ince ama kalıcı bir probleme bağışıklık sağlamaz: ”Dönderlikmulticollinearity). tahmin eden değişkenler birbiriyle güçlü bir şekilde ilişkili olduğunda, karar ağacı modelleri istikrarsız hale gelebilir.
Bu makalede, çok sayıdakirliliğin ne olduğunu keşfedeceğiz, neden özellikle karar ağaçları için önemli şeyler ve etkisini azaltmak için bir eylem stratejisi. Bir veri bilim insanı bir ders ya da uygulayıcının bir üretim modelinin hazırlanmasına yardımcı olacak, bu teknikler daha genelleştirilebilir karar ağaçları inşa etmenize yardımcı olacaktır.
Multicollinearity Nedir?
Multicollinearity, birçok istatistiksel ve makine öğrenme modellerini karıştırabilecek bir duruma işaret eder ve değişkenleri doğrusal olarak yüksek derecede ilgilidir. değişkenler arasındaki ilişki güçlü olduğunda, altta yatan veriler, korelasyonelasyonel modelleme modelleri arasında karıştırabilir ve sonuçlanmış ağaç gerçekleştirilmiş güç eklemeden karmaşık hale gelebilir.
Bilmek için iki birincil çoklucollinearity türü vardır:
- [FONT:0)Perfect multicollinearity[[Dönder: 1 ) - bir tahminci başkalarının lineer bir kombinasyonudur. Bu, bir özellik ters kopyalandığında gerçek verilerde nadirdir.
- [Uygunluk) yüksek (imza) çok fazlacollinearity[Döntgenlik[Döntgenlik: 1) tahminciler güçlü, ancak mükemmel değil, korelasyonlu. Bu çok daha yaygındır ve çoğu mitigation stratejilerinin odağıdır.
Neden Multicollinearity Hala Karar Ağaçlarında Önemlidir
Karar ağaçları parametrik değildir ve genellikle çoklucollinearity'ye bağışıklık olarak tanımlanır. Ağaçların aynı bağımsızlık varsayımlarını lineer modeller olarak gerektirmez, korelasyonel özellikler hala pratik problemleri tanıtmaktadır:
- [FONT:0]Split seçim önyargısı[[Döneticileri) - iki yüksek korelasyonlu özellik mevcut olduğunda, ağaç ilk bölünme için birini seçebilir, diğerini görmezden gelir.Bu, bireysel ağaçlar kararsızdır; verilerin küçük değişiklikler hangisini seçtiğini döndürmek için ağaca neden olabilir.
- [FONT:0)Genelleştirme[DÜDÜDÜT:1) - Reddant özellikleri, genelleşmeyi geliştirmekten önce ağaç için birden fazla fırsat sağlar.
- [FONT:0)Mis önde gelen özellik önemi[[[Dönetici: 1) - önemli puanlar her birinin belirgin katkısını pekiştirir ve hangi değişkenlerin gerçekten sürüş tahminlerini tanımlamak için daha zorlaşır.
- [0]Decreased yorumability[Dönetici:0)[0) ve [[Dönetici:0) (yaklaşık aynı) daha kafa karıştırıcı ve daha kolay, bağımsız özelliklerle inşa edilmiş bir ağaçtır.
For these reasons, teaching practitioners to detect and handle multicollinearity before feeding data into a decision tree is a core part of building robust models.
Verinizdeki Multicollinearity in Your Data detecting Multicollinearity in Your Data detecting Multicollinearity in Your Data detecting Multicollinearity in Your Data detecting Multicollinearity in Your Data detecting Multicollinearity in Your Data detecting
Multicollinearity'yi nasıl düzelteceğinizi karar vermeden önce, önce tanımlamanız gerekir. En yaygın algılama araçlarının ikisi korelatör ve Variance Inflation Factor (VIF).
Bir Correlation Matrix
En basit yaklaşım, tüm sayısal özellikler arasındaki çift Pearson korelasyon katlarını hesaplamak. korelatörün ısıtılması hızla çok ilişkili değişkenlerin kümelerini ortaya çıkarır.Ortak bir baş kuralı, daha fazla soruşturma için bayrak çiftleri içindir, ancak eşiğine göre ayarlanabilir.
Variance Inflation Factor
VIF, geri dönüşüm katımın ne kadar değişkeninin çok yönlülük nedeniyle şişirilmesini ölçer, ancak bu eşler kutudan bir VIF işlevi geri alır; örneğin, DAD 4'ün üzerinde bir VIF, her sayısal tahminciyi değerlendirmek için hızlı bir yol sağlar.
[FONT:0)Dön kaynağı:[Dönetici:0) [FONT=0] [FONT=FONT=0) Uygulama ayrıntıları ve örnekler sunar.
Karar Ağaçlarında Multicollinearity'yi Tutmak için Stratejiler
Multicollinear özelliklerini tespit ettikten sonra, bir sonraki adım onları nasıl idare etmeye karar vermek. Aşağıdaki stratejiler özellikle karar ağacı modelleri için etkilidir.
1. Özel Seçme
Özel seçim genellikle en basit ve en yorumlanabilir çözümdür. Hedef, ancak tahmin edilebilir sinyali korumak için en zayıf olan tahmincilerin sadece bir alt kümesini korumaktır.
- [FONT:0)Kurallık eşi[[[Dönetici:0)[[Dönetici)) - korelatör matrisi hesaplar ve seçilmiş bir eşin üzerinde her korelasyon çifti (örneğin, [[DÜyetim) üzerinde bir özelliği kaldırmalısınız.
- [FONT-based Selection[[Dönetici:0)VIF tabanlı seçim[Dönetici:0)[Döneticileri için VIF işlem yapılır, kesmenin en yüksek VIF ile bir kesmeden vazgeçin ve kalan tüm özelliklerin kabul edilebilir VIF değerlerine kadar tekrarlayın.
- [FONT:0]Wrapper yöntemleri[[[Dönetici:0)[Dönetici:0)Wrapper yöntemleri[[Dönetici:0) -- ileri seçim, geri ortadan kaldırma veya recursive özellik ortadan kaldırma (RFE) özellikle karar ağacı algoritmasına uygun olarak, bu yöntemler doğrudan ağaç performansı için optimize ederken.
Özel seçim, veri toplama ve depolama maliyetlerini üretim sistemlerinde azaltmanın ek avantajına sahiptir ve ağaçı basit ve açık tutmak için kolaylaştırır.
2. Boyutlu Azaltımı PCA ile
Özellikleri ortadan kaldırıldığında, her değişken eşsiz alan anlamı taşır, ana bileşen analizi (PCA) bir alternatif sunar: orijinal korelasyon tahminörleri verilerin çoğunu yakalayan daha küçük bir dizi ile dönüştürür.Bu bileşenler daha sonra karar ağaca beslenebilir.
- [FONT=0]Advantages[[Dönetici:0)[Dönergeler[Dönergeler)[[Döneticileri sayısı) çok fazla olduğunda, gürültüyü tamamen ortadan kaldırır ve genelleştirmeyi geliştirebilir.
- [[Düzücüler[Döneticiler)[[Döneticiler) – en büyük alt kısım, orijinal özelliklerin ağırlıklı lineer bir kombinasyonudur; iş açısından bir bölünmenin ne anlama geldiğini açıklamak zor olabilir. Ek olarak, PCA denetimsiz ve farklılık tarafından yakalanamayan ve kartpostalabiliyor.
Bu ticarete rağmen, PCA karar ağaçları için veri hazırlamak için güçlü bir araçtır, özellikle de ensemble yöntemleri ile birleştirildiğinde.
3. Ağaç tabanlı Modellerde Düzenlileşme
Normalleşme en sık lineer modeller (L1/L2 cezaları) ile ilişkilendirilse de, karar ağaçlarının çoklucollinear özellikleri tarafından teşvik edilen aşırı yükleme biçimlerini azaltabilecek kendi normalleştirme biçimleri vardır:
- [FONT:0) Ayrılma örnekleri[Dönetici: {0) - artan% 7, bir bölünme yapmadan önce, bir parça bölme yapma şansına tamamen bir şekilde sahip olma şansına sahip olmak için ağacı daha fazla veri gerektirecektir.
- [0]Maximum derinliği[[[Dönetici: 1 ) - cappingİLFLT:8) ağaç, korelasyon özelliklerini kullanmak için yeterince derinleşmeyi önler.
- [FONT:0)Minimum yetersizlik azalır[DÜT:1] - ayarlandığında sadece anlamlı olarak azaltılabilen bir boşluktan vazgeçilir, çoklu kıvrım gürültüsünden uzaklaştırılır.
- [FONT:0)Köst-komplexite (CCP))[değiştir | kaynağı değiştir] - ağaç büyümeden sonra kesilmesine izin verir, bölünmeye güvenen dalları ortadan kaldırır.
Güçlü bir düzenlileştirme karar ağacının sıkıcı korelasyonları görmezden gelmesine yardımcı olabilir, ancak bir gümüş mermi değildir - kırmızıdan çıkarma özelliklerine temel meselelerini ele almamaktadır.
[FONT:0)Dön kaynağı:[Dönetici:0) [Dönetici kaynağı:[Dönetici:0)[[Dönetici:0)[[Dönetici:0))))[[[Dönetici:[Dönetici: 3)))))))))))))))) ve bir ağaç düzenli olarak nasıl uygulamanız gerektiği hakkında net bir örnek sunar.
4. Ensemble Yöntemler: Rastgele Ormanlar ve Gradient Boosting
Ensemble yöntemleri belki de ağaç temelli modellerdeki çoklu kıvrımları işlemek için en sağlam yoldur. Birçok ağaç birleştirerek, ortak özelliklerden kaynaklanan enst yükümlülükleri ortalama olarak birleştirir ve daha istikrarlı tahminler üretir.
- [FONT:0]Random Forests[[Dönetici: 1 ) - Her ağaç, verilerin botları üzerinde eğitilmiştir ve her bölmede sadece rastgele bir alt özellikleri göz önünde bulundurun. Bu özellik rastgele bir tahmincinin baskınlığını bozar, ormanı alternatif bölmeleri keşfetmeye zorlar.
- [FONT=0)Gradient Boosting Machines (GBMs))[değiştir | kaynağı değiştir], her biri önceki Corlev özellikleri hataları doğrulamaktadır, ancak bu da sorunu daha da azaltır.
Ensemble yöntemleri çoklucollinearity ortadan kaldırmaz, ancak birçok uygulayıcı için, bir Random Forest veya GBM kullanarak problemi açık preişleme olmadan görmezden gelmenin en basit yoludur.
Pratik Uygulama: Bir Adım-by-Step Guide
Bir karar ağacı projesinde multicollinearity işlemek için temsilci bir iş akışıyla yürüyelim. Biz meydan görüntüleri, yatak odası sayısı, birçok banyo, çok boyutlu ve yıl inşa edilmiş olan özellikleri ile varsayımsal bir konut veri setini kullanacağız.
Adım 1: Multicollinearity
İlk olarak, korelatör ve VIF'yi tüm sayısal özellikler için hesaplar. Örneğin, kare görüntüler ve yatak odası sayısı 0.82 korelasyona sahip olabilir ve her ikisi için de VIF değerleri 6. Bu, sorunlu multicollinearity onaylar.
Adım 2: Bir Dava Stratejisi seçin
Gerçek bir devlet modeli için yorumlanabilirlik önemlidir, aynı zamanda diğer korelasyon çiftlerini tercih ederiz (DDDD:0) PCA'den daha bağımsız veya zayıf ilişkili olanları takip ettikten sonra, daha fazla tahminci olan) ve diğer korelasyon çiftlerini de kontrol ederiz ve ilk damlayı 10'dan sonra VIF'yi gösterirsek çok boyutu ortadan kaldırırız.
3. Adım: Karar Ağacının Eğitimi
Az önce yapılan bir özellikle, makul bir şekilde bir karar ağacı eğitiyoruz (örneğin, 6) ve [[Düzg: 20) aşırı yüklemeyi önlemek için. Sonuç ağaç daha basit, daha az düğümle ve özellik önemli puanlar şimdi gerçekten farklı değişkenler üzerinde yoğunlaşmıştır.
Adım 4: Geçerlilik ve Karşılaştırma
Seçilen özellikler üzerinde eğitilmiş ağaçla tam veri kümesi üzerinde eğitilmiş ağaç karşılaştırıyoruz. tam ağaç biraz daha düşük eğitim hatasına sahip olsa da, seçilen en iyi oyun ağacı katlama puanlarını ve daha az varyantasyon işaretlerini göstermelidir.Bu, gelişmiş genelleştirmenin yer işaretidir.
Ekstra bir sağlamlık katmanı için, orijinal veri setinde bir Random Forest da eğitiyoruz. Ormanın performansı yakından maça veya bu konuyu ele almalı, bu tür yöntemlerin uygun bir alternatif olduğunu doğrulayın.
Ortak Pitfalls ve Them'dan Nasıl Kaçırmak
En iyi niyetlerle bile, karar ağaçlarında multikolinearity ele alırken hatalar meydana gelebilir. İşte en sık çukurlar:
- [FONT:0)Over-eager özellik geri yükleme[[Dönetici: 1 ) - sadece bir değişkeni bırakarak, başka bir ile ilişkili olduğu için değerli sinyal kaybıyla ilişkilendirilir. Her özelliğin tahmin edici katkısını ve etki alanı bilgilerini kılavuzluk için kullanın.
- [FONT:0] Etkileşim etkilerini görmezden gelmek[[[Dönetici: 1) Bazı durumlarda, iki korelasyon birlikte, tek başına taşımadığı bilgileri taşır.Biri dışarı çıkarmak performansa zarar verebilir. Bu durumlarda, boyutsal azalma veya ensemble yöntemleri daha iyi seçimlerdir.
- [FONT:0) Uygulamalı PCA ölçeklendirmeden ([Dönetici: 1) PCA, özelliklerin ölçeklerine duyarlıdır. Her zaman PCA'yı yapmadan önce sıfır kelime ve birim değişkenleri standartlaştırır.
- [FONT:0) VIF eşiğinin evrensel olduğunu varsayarsak; 10'un VIF'si ortak bir kesmedir, ancak küçük veri kümelerinde veya alanlarda güçlü doğal korelasyonlarla, hatta daha düşük eşler uygun olabilir.
- [FONT:0) Özel mühendislikten sonra kontrol etmek için uygun olarak; – çoklucollinearity polinom özellikleri, oranlar veya etkileşim koşulları yaratarak tanıtılabilir.Re-evaluate korelasyonlar her özellik mühendisliği adımlarından sonra.
Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç
Multicollinearity, aynı şekilde bir karar ağacı modelini kıramayabilir, ancak her iki doğru ve dirençli olan modelleri de zayıflatır ve genelleştirmeyi algılar.Seksle ilişkili özellikleri erken tespit ederek, verinizin basitleştirilmiş ve boyutsal azaltımı uygulayın ve modeliniz gelişmiştir.
[FONT:0)Dönem kaynağı:[Dönetici:0) Daha derin bir şekilde VIF'ye ve resmi olarak incelenen karar ağaçlarının ).Wikipedia article on Variance Inflation Factor)