Karar Ağacı Algoritmalarının Karşılaştırmalı Bir Çalışması: C4.5, Cart ve Chaid
Table of Contents
Karar Ağacı Algoritmalarına Giriş
Karar ağacı algoritmaları uzun zamandır veri madenciliği ve makine öğreniminin temel taşı olmuştur, sınıflandırma ve regresyon görevleri için yorumlanabilir modeller sunar.En yaygın kullanılan C4.5, CART ve CHAID. Her algoritma, verileri nasıl ayırdıkları, çeşitli özellikleri nasıl idare ettiklerine farklı bir yaklaşım getirir ve doğru algoritmayı seçmek, doğru algoritmaların doğru şekilde doğru şekilde doğru şekilde etkili bir şekilde etkili bir şekilde etkili bir şekilde etkili bir şekilde etkili hale getirebilir.
Karar Ağacı Temelleri
Bir karar ağacı, her bir iç düğümün bir özellik üzerinde bir test temsil ettiği bir akış gibidir, her bir şube bu testin bir sonucu temsil eder ve C4.5, CART ve CHAID'nın her bir kritere ilişkin temel farklılıkları, ağaç topolojisi (binary vs. multi-way bölmeleri) olarak inşa edilir.
C4.5 Algorithm
Arka plan ve Geliştirme
Ross Quinlan tarafından ID3'e kadar geliştirildi, C4.5, literatürdeki en etkili karar ağacı algoritmalarından biridir. Özellikle sürekli nitelikleri, eksik değerleri ve ağaç pruningini işlemek için tasarlanmıştır.
Criterion: Bilgi Edinme Oranı
C4.5, hangi özellikleri bölmeye karar vermek için bilgi kazanır. Bilgi kazancı entropiden elde edilir, bilgi teorisinden bir ölçü verilir. Ancak, bilgi kazanç oranı ile ilgili birçok farklı değer (yüksek kartinality) ile ilgili olarak C4.5 daha sağlam hale getirir.Bu önyargıyı düzeltmek için, Quinlan, bu bilgiyi normalleştirmek için, bölünmenin özelliklerini normalleştirmektir.
Sürekli Attributes
Sürekli (numeric) özellikler, değerleri dinamik olarak sıralayarak ve onları iki aralıkta bölmek için en iyi eşi bulmakla ilgilidir. Örneğin, bir özellik 1, 3, 5, 7, algoritma, ≤3 vs. >3, ≤5 vs.5 gibi bölünmüştü ve böylece kazanç oranını en üstlenen olanı seçmek için. Bu işlem her düğümde tekrarlanırsa, C4.5'i diskretleştirme olmadan karışık veri türlerini işlemek için kullanılabilir hale getirebilir.
Eksik Değerler ve Pruning
C4.5 hem eğitim hem de tahminde eksik olan özellikleri yönetir. Bir özellik değeri eksik olduğunda, algoritma bir olasılıksal yaklaşım kullanır, örneğin eğitim verisinde gözlemlenen dağıtıma doğru dağıtılır. Tahmin için, bilinmeyen değerler aynı şekilde ele alınırsa, C4.5 tahmin edilebilir bir şekilde yapılır.Bu, daha basit bir ağaç üretir.).
Anahtar Güçler ve Sınırlar
C4.5 oldukça yorumlanabilir ve genellikle öncekilerden daha küçük, daha doğru ağaçlar üretir. Her iki sınıflandırma ve regresyon (M5 varyant aracılığıyla) ve heterojen verilerle iyi çalışır. Ancak, dinamik eşi arama nedeniyle çok büyük veri kümeleri için hesaplamak pahalı olabilir. ek olarak, algoritmanın çoklu bölmeleri çok fazla sayıda şube oluşturulduğunda verileri parçalayabilir.
C4.5'de daha fazla okuma için Quinlan'ın orijinal çalışmasını bakınız: 03.C4.5: Makine Öğrenmesi için Programlar[DDDDDDDDDD4)
CART Algorithm
Arka plan ve Geliştirme
Sınıflama ve Regresyon Ağaçları (CART) Leo Breiman tarafından tanıtıldı, Jerome Friedman, Richard Olshen ve Charles Stone, C4.5'den farklı olarak, CART kesinlikle ikili ağaçlar üretiyor, yani her bir bölmenin ağaç inşaatı ve yorumunın birçok yönünü basitleştiriyor.
Criterion: Gini Impurity
Sınıf görevleri için CART, node'deki sınıf etiketlerinin dağılımına göre etiketlenen bir unsur olarak kullanır.[0] p i'nin sınıfsal değişkenlerin oranını en düşük seviyeye indirdiği yerde, tüm olası kombinasyonların en düşük düzeydeki değişkenleri gösterir.For regresyon için CART uses theFLT:2.
Ağaç Yapı ve Pruning
CART ikili ağaçlar inşa ettiğinde, aynı niteliklere farklı şubeler boyunca birden fazla bölünme oluşturabilir, ağaç boyutlarını etkili bir şekilde ele alır.Verileri aşırı yüklemeden sonra CART uygulamaktadır:0)cost-complexity pruning).Bu yöntem özellikle sağlam bir parametre (α) bu penalizeler ağacı boyutunu ortaya koyar.
Data Type ve Eksik Değerleri Kullanın
CART hem sürekli hem de kategorik özellikler yerel olarak idare edebilir. Birçok kategori ile kategorik değişkenler için, bu tür verilerin iyi ve tahmin edilebilir gücünü kullanarak değerlendirilebilir.[Döneticileri): birincil bölme özelliği eksik olduğunda, algoritma örnekleme özelliğinin yönünün en iyi şekilde kullanılmasını kullanır.Bu yaklaşım verileri iyi korumayı ve eksik kayıtları ile öngörülebilir gücü de korur.
Anahtar Güçler ve Sınırlar
CART, orta büyüklükteki veri setleri için oldukça sağlam ve hesaplamalı olarak verimlidir. ikili bölmeleri, veri bölmelerini çok yönlü bölünmüşlere kıyasla azaltılabilir. algoritmanın yerleşikleştirilmiş değerleri gerçek dünya verileriyle daha az yorumlayabilme eğilimindedir. Ancak, CART, ikili bölmeler gerektiğinden daha derin bir şekilde üretebilir ve algoritmalar daha belirgin değerlere karşı önyargılı olabilir.
Daha derin bir anlayış için, Breiman ve al.'nin klasik metni bakınız: ESFLT:0)Kırıklık ve Regresyon Ağaçları).
CHAID Algoritma
Arka plan ve Geliştirme
CHAID (Chi-squared Otomatik Interaction dem) 1980 yılında Gordon V. Kass tarafından segmentasyon ve sınıflandırma için bir teknik olarak geliştirildi. C4.5 ve CART'dan farklı olarak, CHAID, istatistiksel bir önem test kullanıyor - özellikle de bağımsızlık testi - bölünmelere karar vermek.Bu, özellikle de kategorik veriler ve piyasa araştırma uygulamaları için uygun olan etkileşimlerin önemli olduğunu anlamayı sağlar.
Criterion: Chi-Square Testleri
CHAID, her tahmin edilebilir değişkeni inceler ve en önemli bölünmüş kategorileri birleştirir, yani bu işlem, ortaya çıkan ağacın yalnızca istatistiksel olarak haklı çıkarabileceğinden emin olur.
Data and Tree Construction
CHAID öncelikle kategorik veya ayrımcılığa dayalı sınıflandırma görevleri için tasarlanmıştır. Sürekli değişkenleri ele alabilirken, genellikle analiz öncesi kategorilere binilirler. algoritma kategorize edilebilir bir kategoriye göre manuel tanımlayamaz; otomatik olarak eklenmiş binler, aynı anlamda C4.5 veya CART olarak tedavi edilemez; daha önemli bölünmeler bulunan ağaç kontrolleri doğrudan kullanıcı tanımlanamazsa, otomatik olarak kategoriye göre değişir.
Anahtar Güçler ve Sınırlar
CHAID'nin ana gücü, istatistiksel olarak rigor'dur, bu da veriye olan doğal grupları ortaya çıkarabilir. Ancak, CHAID, regresyon görevleri için daha az uygun değildir (Regresyon için CHAID adı verilen bir uzatmanın var olduğu gibi). Ayrıca, veri kümeleri için otomatik olarak çok sayıda kategoriye sahip hale getirir ve ona olan bağımlılığın azaltılması, CHAID'nin tekrar tekrar tekrarlama işlemleri için daha küçük bir miktarını kırabilir.
CHAID'de referans için bakınız: 03.Ö.:0) Categorical Data (Kass, 1980) Büyük Sayısal Sayıları Yatırım için Açıklama Teknikleri).
Anahtar Özelliklerinin Karşılaştırma Analizi
Aşağıdaki tablo, C4.5, CART ve CHAID arasındaki en önemli farkları özetliyor.
| Feature | C4.5 | CART | CHAID |
|---|---|---|---|
| Splitting Criterion | Information gain ratio | Gini impurity (classification), variance reduction (regression) | Chi-square test (classification), F-test (ordinal) |
| Tree Structure | Multi-way splits possible | Binary splits only | Multi-way splits (auto-merging categories) |
| Supported Target Types | Categorical (classification), continuous (with modifications) | Categorical and continuous | Primarily categorical; continuous via binning |
| Handling Continuous Predictors | Dynamic threshold search | Dynamic threshold search | Bin into categories (user-defined or automatic) |
| Missing Values | Probabilistic distribution | Surrogate splits | Treated as separate category or mode imputation |
| Pruning Method | Error-based pruning | Cost-complexity pruning | Stopping rule via significance level (no explicit pruning) |
| Scalability | Moderate; expensive for large numeric datasets | Good for moderate-sized datasets | Slower with many categories |
| Interpretability | High (often compact trees) | High (binary splits easy to follow) | High (statistically justified splits) |
| Overfitting Control | Strong via pruning | Strong via cost-complexity pruning | Moderate; controlled by significance threshold |
Bu teknik farklılıkların ötesinde, algoritmaların da, bağlantıdaki kategorilerin hedefle bir etkileşim oluşturup yansıtması gerektiği konusunda farklılıklar gösterir. CART'ın ikili bölmeleri, aynı niteliklere tekrarlanan kategorilerden tekrarlanan karmaşık etkileşimleri modellemesine izin verir. CHAID'nin multi-way bölünmüşleri, birleşme kategorileriyle doğrudan bir araya gelebilir. C4.5, orta bir zemin sunuyor, çoklu-yol bölünmüşler sunar, ancak CHAID'nin performans gösterdiği kategorilerden otomatik para kazanabiliyor.
Algoritma Seçimi için Kılavuz
Doğru karar ağacı algoritmasını seçmek, veri setinizin özel özelliklerine ve analizinizin hedeflerinize bağlıdır: Aşağıdaki yönergeleri kullanın:
- [FONT:0)Choose C4.5, [Dönetici: 0,5] Sürekli ve kategorik verileri işleyen çok yönlü bir algoritmaya ihtiyacınız var, eksik değerler mevcut ve yorum yapmak için kolay bir ağaç istiyorsunuz. C4.5 birçok sınıflandırma görevi için iyi bir varsayılan seçim.
- [FONT:0)Choose CART ne zaman:) Her iki sınıflandırma ve regresyon için sağlam bir algoritma gerektirir, verileriniz birçok eksik değer içerir veya ikili bölünmelerin basitliğini tercih edersiniz. CART'ın gerçek dünya verilerinin desen eksikliği ile güçlü olduğunu.
- [FONT:0)Choose CHAID ne zaman:) birincil ilginiz kategorik değişkenler arasındaki ilişkileri araştırmak, istatistiksel olarak haklı olan bir ağaca ihtiyacınız var veya boyutsallığı azaltmak için kategoriler otomatik olarak para kazanmak istiyorsunuz. CHAID özellikle pazarlama segmentasyonu ve anket analizinde popülerdir.
Ayrıca ağaç büyüklüğü ve doğruluğu arasındaki ticarete de değer vermeye değer. C4.5 ve CART genellikle dikkatli bir şekilde incelenebilir, CHAID'nin önemine dayalı durak kuralı sığamaya eğilimlidir; iyi bir alternatif C4.5'den önce büyük bir algoritmaya başvurmaktan önce bin kategoriye girebilir.
Pratik Uygulamayı Değerlendirme
Tüm üç algoritma popüler veri madenciliği araçları ve programlama kütüphaneleri mevcuttur. C4.5 Weka'da (J48), CART R (rpart paketi) mevcutturken, Python (scikit- learning's DecisionTreeClassifier with default Gini), ve diğer birçok platformda CHAID, SPSS'de ve R (CHAID paketi) Kontrol altına alındığında, C4.5 için dikkat edin.
Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç
C4.5, CART ve CHAID her biri Gini impurity ve maliyet-komblemleri için eşsiz bir avantaj sunuyor. C4.5 Her iki sınıflandırma ve regresyon görevleri için ideal hale getirir, sürekli ve eksik verileri işlemek ve hata bazlı bir şekilde birleştirmek, özellikle de Gini imkansız veri analizi için uygundur.