Karar Ağacı Algoritmalarında Eksik Verileri Kullanın
Table of Contents
Giriş Giriş Giriş
Karar ağacı algoritmaları hem sınıflandırma hem de regresyon görevleri için makine öğreniminin temel taşı olarak kalır, sezgisel yapısı nedeniyle yorumlanabilirlik ve doğrusal olmayan ilişkileri modelleme yeteneği. Ancak, gerçek dünya veri kümeleri nadiren incelenir; bu nedenle, yanlış anlamalar, doğrulama sorunları, veya mahremiyete teşvik edilen kırmızı aksiyonları, geleneksel olmayan verileri görmezden gelen hataların pratik bir şekilde düzeltilmesi ve yanlış anlamalara ihtiyaç duyan yanlış anlamaları sağlamak için eksik değerlerin çoğu zaman içerir.
Eksik Data
Eksik veriler üniformalı bir problem değildir. Uygun kullanım stratejisi eksikliği yaratan mekanizmaya bağlıdır. Statisticians üç farklı türe ayrılmış verileri analiz için farklı etkilerle her biri.
Tamamen Random (MCAR)
MCAR altında, bir değer eksik olması, gözlemlenen verilerin tam veri kümesinin rastgele bir örneği olarak kalması için tamamen bağımsızdır. Örneğin, bir laboratuvar cihazı bazen test altında numuneye ilişkin olarak başarısız olur veya bir anket yanıtlayıcısı yanlışlıkla bir soruyu atlar. MCAR analitik olarak işlemek için en kolay türüdür, çünkü gözlemlenen veriler tam veri kümesinin rastgele bir örneği olarak kalır.
Random (MAR)
MAR, eksiklik yalnızca gözlemlenen değişkenlere bağlıdır ve eksik değerlere bağlı değildir. Örneğin, kredi riski altındaki bir veri kümesinde, gelir daha genç başvurular için daha olası eksik olabilir (daha az sayıda iş ve bilimsel bağlamda) ancak, belirli bir yaş, eksik gelir seviyesi MAR'nin gerçek gelir seviyesine bağlı değildir.
Eksik Not at Random (MNAR)
MNAR'da eksik değerle doğrudan ilişkili olan eksiklik olasılığı, dış bilgi veya özel modelleme teknikleri (örneğin, yüksek gelirli bireyler kazançlarını açıklamayı reddedebilirler, eksik değerle doğrudan ilişkili olarak kabul edilebilir). MNAR, dışsal bilgi veya özel modelleme teknikleri olmadan güvenilir bir şekilde tahmin edilemez.
Eksik Data Desenleri Tanımlamak
Bir işleme yöntemi seçmeden önce, uygulayıcılar veri setlerinde eksiklik modelini keşfetmelidirler. Common tanı şunları içerir:
- [FONT:0)Missingness ısımaps) - özellik başına eksik değerlerin ve örnek başına görselleştirilmesi.
- [FONT:0]Küçük MCAR testi[[Dönetici: 1 ) – MCAR'in makul olup olmadığını gösteren resmi bir istatistik testi.
- [FONT=0) Grupif eksik istatistik[[[Dönetici: 1))[[Dönetici:0))[değiştir | kaynağı değiştirilen özelliklerin başka bir özelliğin eksik olup olmadığı konusunda gözlemlenen özellikleri hesaplamak; büyük farklılıklar MAR veya MNAR’ı önerir.
Mekanizmayı anlamak uygun bir dürtü veya modelleme stratejisi seçmek için temel oluşturur.
Eksik Data'yı görmezden gelenlerin Sonuçları
Birçok naif yaklaşımlar – listebilce deletion (simply kaldırmak satırları eksik bir değerle kaldırmak) veya çift açıdan deletion – hala uygulamada kullanılır, ancak önemli maliyetlerle gelir:
- [FONT:0)Redüklenmiş örnek büyüklüğü[[Dönetici:0)[Dönetici:0)Redüklenmiş örnek büyüklüğü[[Dönetici:0)[Dönemsel olarak, verinin büyük bir kısmını atabilir, özellikle de birçok özellikle, yüksek değişkenliğe ve düşük istatistiksel güce yol açabilir.
- [FONT=0]Biased parametre tahminleri) - eksiklik MCAR değilse, bu önyargı doğrudan karar ağacı bölmelerine yol açıyor, yanlış eşlere ve alt-optimal node saflığa neden oluyor.
- [FONT:0]Bilgilerin kısımları[Döneticileri 1 ) - eksik değerlerin özellikleri tamamen bölünme mantığından dışlanmış olabilir, ek devreler veya kesintiler yoluyla kullanılabilir tahmin edilebilir sinyalden yoksundur.
- [FONT:0) Ağaçlarla ilgili olarak ele alınan Inconsistent kullanım) – rastgele ormanlar gibi örnekler her temel ağaçta farklı olarak eksik değerleri tedavi edebilir, kararsız tahminlere göre.
İyi tasarlanmış bir eksik veri tedavisi hem doğruluk hem de güvenilirlik geliştirir, özellikle tıbbi tanı, finansal risk değerlendirme ve tahmin edici bakım gibi yüksek oranlarda uygulamalar.
Geleneksel Imputation Yöntemleri
Imputation – tahmin edilen değerler ile eksik olan değerleri doldurun – en yaygın kullanılan yaklaşımdır. İmkansızlaştırma yöntemi seçimi veri türüne, eksiklik mekanizmasına ve hesaplama bütçesine bağlıdır.
Basit Univariate Imputation
En basit teknikler, bu özellik için gözlemlenen değerlerin eksik bir değeri değiştirir ve bu yöntemler, özellikleri arasındaki korelasyonları görmezden gelir ve eğimli model güvenini azaltır.
Regresyon Imputation
Regresyon yetersizlik, diğer tüm tüm özelliklerin işlevi olarak eksik olan özellikleri modeller. Bir lineer regresyon gözlemlenen girişlere uygundur ve sonra eksik olanları tahmin etmek için kullanılır. Bu, değişkenler arasındaki ilişkileri korur, ancak lineerliği varsayar ve aynı veriler her iki engel için de kullanılabilir.Daha gelişmiş versiyonlar zincirli denklemler gibi (MICE) bu döngüyü yakınlaştırır.
KNearest Neighbors (KNN) Imputation
KNN dürtüsü, k en benzer tam örnekleri (görülerdeki mesafe) ve ortalamaları bulur (veya eksiklik mekanizması MCAR veya MAR ve mesafe ölçümleri için doğal olarak karmaşık veri türleriyle iyi çalışır.
Birden çok Imputation
Birden fazla dürtü (örneğin, MCMC veya MICE algoritması kullanarak) birkaç tam veri kümesini belirsizliğe dahil eden bir istatistik modelinden uzaklaştırarak alır. analist daha sonra her bir yanlış veri kümesine ve havuzlara bir karar ağacı sunar (örneğin, Rubin’in kurallarıyla ilgili tahmin edilen olasılıklarla veya kullanmak).Bu yaklaşım, belirsizliği doğru bir şekilde yansıtıyor ve MAR altında sağlamdır.
Basit Takherasyon Sınırları
Hiçbir engel yöntemi bir panacea. Basit bir engel, özelliklerin ortak dağıtımını bozmak, temiz bölünmeleri bulmak için karar ağaçlarının daha zor hale getirilmesini sağlamak için daha zor hale getirmektir.Son olarak, imkansızlık mekanizmasının ihmal edilebilir olduğunu varsayar - MNAR'ın ekstra modelleme olmadan uygun olmadığını varsayar.
Karar Ağaçlarında Şaşırtıcı Splits
Verilere ön işlemekten ziyade, bazı karar ağacı algoritmaları - özellikle orijinal CART (Klasikleştirme ve Regresyon Ağaçları) - eksik değerleri yerel olarak kullanır:0) Sigortarogate bölünmüşler[Döneticiler[Döneticiler 1) Bu teknik, çiğ verileri değiştirmeden önce ağaç yapısını kendi boşlukları ile uğraşmak için şıkdır.
Nasıl Şaşırtıcı Splitler Çalışıyor
Bir ağaç inşa ederken, algoritma, ana özelliğin tümüne göre en iyi bölünmeleri seçer (örneğin, üniversite mezunu), gelirin gözlemlendiği durumlarda, birincil bölme için mümkün olduğunca fazla bir bölüm üretir.Bir örnek için bir ekin, eğer birincil özellik bir özellik için tanımlanırsa, algoritma da önceki yoldan ayrılır;
Avantajları ve Dezavantajları
Surrogate bölünmeleri, herhangi bir engeli olmayan başlıca avantajlarına sahiptir - ağaçtan gelen tüm verilerden gelen bilgiler zayıftır ve ayrıca ağaç inşaatı sırasında öğrenilen koşulları korur.Ancak, teknik bazı korelasyonların gerçekleştirilmesini talep eder; eksik olan özellik güçlü bir korelasyona sahip değilse, ek olarak, Rgate'in dışına çıkan kutuyu geri döndürebilir.
Model tabanlı yaklaşımlar ve Modern Algorithms
Son yıllarda, eksik değer tedaviyi doğrudan öğrenme algoritmasına dahil eden yüksek çözünürlükte ölçeklendirme çerçevelerinin yükselişini gördük, genellikle hem de tahmin edici performansta kesintiler ve kesintiler.
XGBoost
[FONT:0)XGBoost [[DÜDÜT:1) (Extreme Gradient Boosting) eğitim sırasında eksik değerlerin nasıl kullanılacağını öğrenir, çünkü eksik olan verilerin her biri için bir varsayılan yönü değerlendirmez ve son derece verimlidir, çünkü eksik değerlerin değerlendirilmesi ve hafızanın altında tutulması gerekir.XGBoosts of the default approach by learning if missingness or right.This approach requires no imputation and is highly effective because missing values are representation as sparse matrices, save memory.XGBoosts.
IşıkGBM
[FONT:0]IşıkGBM[[Dönetici:0) Farklı bir rotayı alır: tek bir grup olarak sıfır ve eksik değerleri tedavi eder ve bu grup için bölünmüş yönü optimize eder.Eğitim sırasında, eksik örneklerin sol veya sağ çocuğa ait olup olmadığını öğrenir. XGBoost gibi, yetersiz veriyi etkin bir şekilde idare eder ve sparse verilerini etkin bir şekilde idare eder.
CatBoost
[FONT=0)KatalBoost[[Dönetici:0))) Belirli bir kategori olarak eksik değerleri farklı bir şekilde kullanır ve bu kategoriye bölündüğünde ağaç karar verir. - Tüm üç kütüphanenin üretime hazır olduğunu gösterir.
Uygulamada Eksik Veri Kullanımının Uygulanması
Bir strateji seçmek, araçlama, veri büyüklüğü ve eksiklik desenine bağlıdır. Aşağıda tartışılan teknikleri entegre eden yapılandırılmış bir iş akıştır.
- [[DÜŞÜN:0)Assess eksikliği[[DÜT:1) - özellik başına eksik değerlerin yüzdesini ve örnek başına hesaplamak.Eğer herhangi bir özellik var >% 90 eksik, alan bilgisi güçlü değilse, görsellik korelasyonları eksik olan ve gözlemlenen özellikler arasında ısımap veya ⁇ 2 testi kullanıyor.
- [[DÜDÜ:0) Mekanizmayı[DÜDÜT:1) genişletin - örnek yeterli olup olmadığını küçük eksiklik (<% 5) için MCAR testi daha güvenli. MCAR için ek veriler toplamayı veya desen-mixer modelleri kullanmayı düşünün.
- [FONT:0) Bir yöntemi çerçevenize göre seçin[Dönetici:0): [[Dönetici:2|tamamlama sistemi kullanarak, (g., 03.03.2012) bir engeli kullanın.
- XGBoost/LightGBM/KatBoost kullanıyorsanız, hiçbir engel gerekli değildir - sadece verileri ESFLT:10 ile geçer; çerçeveler onları idare edecektir.
- R'surFLT:11 kullanıyorsanız, ekinleri etkinleştirebilmek için parametrenin askıya alınmasına olanak sağlar.
- [FONT:0) Eksik kullanımları etkileyen yüksek hiperparametreler – XGBoost için, [[Ücretsizler için: www.D:0) ve [[Ücretsiz şube seçimleri etkileyebilir.For CatBoost, [[Düzük değerlerin nasıl tedavi edildiği kontrol edilir (bir sınıf veya yanlış anlaşılır) Test farklı konfigürasyonlar.
- [FONT:0]Validate düzgün bir şekilde[[[Dönetici:0)) - her zaman bir çapraz eşdeğerlik döngüsü içinde eksik veri kullanımı içerir (örneğin, veri sızıntısından kaçınmaya yönelik tren/test bölmeden önce kesinti). Aynı katta farklı yöntemlerin performansı ile istatistiksel önemini sağlamak için.
En İyi Uygulamalar ve Ortak Pitfalls
- [FONT:0) Hedef değişkeni ortadan kaldırmaz (Dönetici:0) - öğrenme sinyalini denetim altına alan bir denetimli bağlamda hedefin ortadan kaldırılması veya hedef eksikliği ayrı bir model problem olarak tedavi etmek (örneğin, ek bir sınıf olarak tedavi).
- [FONT:0) Domain bilgisi - birçok alanda eksiklik bir anlamı vardır. Örneğin, eksik bir laboratuvar testi, doktordan bir koşul önermediğini, faydalı bilgiler sağlamadığını gösterebilir. Bazı ağaç uygulamaları, ağacın çift değişken olarak eksik olmasına izin verir.
- [FONT:0)Yüksek boyutlu sparse verilerinin farkında olun[Dönetici:0) - çoğu özellik sık eksik girişler varsa, yetersizlik oldukça belirsiz hale gelebilir.Böyle durumlarda ağaç tabanlı yöntemler kullanın (XGBoost veya LightGBM)
- [FONT=0)Zizmin modellerine benzeyen bir özelliktir[Dönetici:0)[Dönetici:0)) Bu, finansal olarak ağırdır, ancak MAR altında birden fazla engel ve yanlış karar ağaçları kullanmayı düşünün.
- [[Dönetici performansı[[[Dönetici:0))[[[Dönetici:0)) Takip performansı[[[[Dönetici:0)[[[Dönetici modeli zaman içinde değişebilir (koncept drag). Sürekli olarak eksik fiyatlar ve yeniden eğitim modelleri güncellenen ele alma stratejileri ile.
Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç
Missing data is an inevitable reality in machine learning, and decision tree algorithms are no exception. The appropriate handling strategy depends on the missingness mechanism, the chosen tooling, and the performance requirements. Basic imputation (mean, median, KNN, MICE) remains widely applicable but must be integrated carefully into the modeling pipeline to avoid leakage. Surrogate splits offer a principled, model‑based alternative, though their availability is limited to certainKütüphaneler. Modern gradient-boosting frameworks - XGBoost, LightGBM ve CatBoost - en iyi işlem yapmadan önce, en iyi uygulama, bir nuisance kaynağı olarak eksik değerleme yöntemi kullanarak, uygulayıcılar her iki doğru ve güvenilir olmayan karar ağacı modellerini analiz edebilir.
[FONT:0]Further okuma:0)GUMLU: KAYNAK:0)[FONT=FONT=0)[FONT=FONT=0))[FONT=FONT=0}[FONT=FONT=FONT=FONT=FONT=TR][/TRNT=TR][/FONT=TR][/FONT=))))))))[FONT=[FONT=FONT=[FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=TR][/FONT=FONT=FONT=FONT=FONT=FONT=TR][/TR][/FONT=TR][/TR][/TR][/TRNT=TRNT=TR][/TRNT=TRNT=FONT=FONT=FONT=FONT=TRNT=TR][/FONT=TRNT=TRNT=TRNT=FONT=FONT=FONT=TRNT=TR][/FONT=TR][/FONT=TR][/FONT=TR][/FONT=TRNT=