Karar Ağacı Algoritmalarına Giriş

Karar ağacı algoritmaları uzun zamandır veri madenciliği ve makine öğreniminin temel taşı olmuştur, sınıflandırma ve regresyon görevleri için yorumlanabilir modeller sunar.En yaygın kullanılan C4.5, CART ve CHAID. Her algoritma, verileri nasıl ayırdıkları, çeşitli özellikleri nasıl idare ettiklerine farklı bir yaklaşım getirir ve doğru algoritmayı seçmek, doğru algoritmaların doğru şekilde doğru şekilde doğru şekilde etkili bir şekilde etkili bir şekilde etkili bir şekilde etkili bir şekilde etkili hale getirebilir.

Karar Ağacı Temelleri

Bir karar ağacı, her bir iç düğümün bir özellik üzerinde bir test temsil ettiği bir akış gibidir, her bir şube bu testin bir sonucu temsil eder ve C4.5, CART ve CHAID'nın her bir kritere ilişkin temel farklılıkları, ağaç topolojisi (binary vs. multi-way bölmeleri) olarak inşa edilir.

C4.5 Algorithm

Arka plan ve Geliştirme

Ross Quinlan tarafından ID3'e kadar geliştirildi, C4.5, literatürdeki en etkili karar ağacı algoritmalarından biridir. Özellikle sürekli nitelikleri, eksik değerleri ve ağaç pruningini işlemek için tasarlanmıştır.

Criterion: Bilgi Edinme Oranı

C4.5, hangi özellikleri bölmeye karar vermek için bilgi kazanır. Bilgi kazancı entropiden elde edilir, bilgi teorisinden bir ölçü verilir. Ancak, bilgi kazanç oranı ile ilgili birçok farklı değer (yüksek kartinality) ile ilgili olarak C4.5 daha sağlam hale getirir.Bu önyargıyı düzeltmek için, Quinlan, bu bilgiyi normalleştirmek için, bölünmenin özelliklerini normalleştirmektir.

Sürekli Attributes

Sürekli (numeric) özellikler, değerleri dinamik olarak sıralayarak ve onları iki aralıkta bölmek için en iyi eşi bulmakla ilgilidir. Örneğin, bir özellik 1, 3, 5, 7, algoritma, ≤3 vs. >3, ≤5 vs.5 gibi bölünmüştü ve böylece kazanç oranını en üstlenen olanı seçmek için. Bu işlem her düğümde tekrarlanırsa, C4.5'i diskretleştirme olmadan karışık veri türlerini işlemek için kullanılabilir hale getirebilir.

Eksik Değerler ve Pruning

C4.5 hem eğitim hem de tahminde eksik olan özellikleri yönetir. Bir özellik değeri eksik olduğunda, algoritma bir olasılıksal yaklaşım kullanır, örneğin eğitim verisinde gözlemlenen dağıtıma doğru dağıtılır. Tahmin için, bilinmeyen değerler aynı şekilde ele alınırsa, C4.5 tahmin edilebilir bir şekilde yapılır.Bu, daha basit bir ağaç üretir.).

Anahtar Güçler ve Sınırlar

C4.5 oldukça yorumlanabilir ve genellikle öncekilerden daha küçük, daha doğru ağaçlar üretir. Her iki sınıflandırma ve regresyon (M5 varyant aracılığıyla) ve heterojen verilerle iyi çalışır. Ancak, dinamik eşi arama nedeniyle çok büyük veri kümeleri için hesaplamak pahalı olabilir. ek olarak, algoritmanın çoklu bölmeleri çok fazla sayıda şube oluşturulduğunda verileri parçalayabilir.

C4.5'de daha fazla okuma için Quinlan'ın orijinal çalışmasını bakınız: 03.C4.5: Makine Öğrenmesi için Programlar[DDDDDDDDDD4)

CART Algorithm

Arka plan ve Geliştirme

Sınıflama ve Regresyon Ağaçları (CART) Leo Breiman tarafından tanıtıldı, Jerome Friedman, Richard Olshen ve Charles Stone, C4.5'den farklı olarak, CART kesinlikle ikili ağaçlar üretiyor, yani her bir bölmenin ağaç inşaatı ve yorumunın birçok yönünü basitleştiriyor.

Criterion: Gini Impurity

Sınıf görevleri için CART, node'deki sınıf etiketlerinin dağılımına göre etiketlenen bir unsur olarak kullanır.[0] p i'nin sınıfsal değişkenlerin oranını en düşük seviyeye indirdiği yerde, tüm olası kombinasyonların en düşük düzeydeki değişkenleri gösterir.For regresyon için CART uses theFLT:2.

Ağaç Yapı ve Pruning

CART ikili ağaçlar inşa ettiğinde, aynı niteliklere farklı şubeler boyunca birden fazla bölünme oluşturabilir, ağaç boyutlarını etkili bir şekilde ele alır.Verileri aşırı yüklemeden sonra CART uygulamaktadır:0)cost-complexity pruning).Bu yöntem özellikle sağlam bir parametre (α) bu penalizeler ağacı boyutunu ortaya koyar.

Data Type ve Eksik Değerleri Kullanın

CART hem sürekli hem de kategorik özellikler yerel olarak idare edebilir. Birçok kategori ile kategorik değişkenler için, bu tür verilerin iyi ve tahmin edilebilir gücünü kullanarak değerlendirilebilir.[Döneticileri): birincil bölme özelliği eksik olduğunda, algoritma örnekleme özelliğinin yönünün en iyi şekilde kullanılmasını kullanır.Bu yaklaşım verileri iyi korumayı ve eksik kayıtları ile öngörülebilir gücü de korur.

Anahtar Güçler ve Sınırlar

CART, orta büyüklükteki veri setleri için oldukça sağlam ve hesaplamalı olarak verimlidir. ikili bölmeleri, veri bölmelerini çok yönlü bölünmüşlere kıyasla azaltılabilir. algoritmanın yerleşikleştirilmiş değerleri gerçek dünya verileriyle daha az yorumlayabilme eğilimindedir. Ancak, CART, ikili bölmeler gerektiğinden daha derin bir şekilde üretebilir ve algoritmalar daha belirgin değerlere karşı önyargılı olabilir.

Daha derin bir anlayış için, Breiman ve al.'nin klasik metni bakınız: ESFLT:0)Kırıklık ve Regresyon Ağaçları).

CHAID Algoritma

Arka plan ve Geliştirme

CHAID (Chi-squared Otomatik Interaction dem) 1980 yılında Gordon V. Kass tarafından segmentasyon ve sınıflandırma için bir teknik olarak geliştirildi. C4.5 ve CART'dan farklı olarak, CHAID, istatistiksel bir önem test kullanıyor - özellikle de bağımsızlık testi - bölünmelere karar vermek.Bu, özellikle de kategorik veriler ve piyasa araştırma uygulamaları için uygun olan etkileşimlerin önemli olduğunu anlamayı sağlar.

Criterion: Chi-Square Testleri

CHAID, her tahmin edilebilir değişkeni inceler ve en önemli bölünmüş kategorileri birleştirir, yani bu işlem, ortaya çıkan ağacın yalnızca istatistiksel olarak haklı çıkarabileceğinden emin olur.

Data and Tree Construction

CHAID öncelikle kategorik veya ayrımcılığa dayalı sınıflandırma görevleri için tasarlanmıştır. Sürekli değişkenleri ele alabilirken, genellikle analiz öncesi kategorilere binilirler. algoritma kategorize edilebilir bir kategoriye göre manuel tanımlayamaz; otomatik olarak eklenmiş binler, aynı anlamda C4.5 veya CART olarak tedavi edilemez; daha önemli bölünmeler bulunan ağaç kontrolleri doğrudan kullanıcı tanımlanamazsa, otomatik olarak kategoriye göre değişir.

Anahtar Güçler ve Sınırlar

CHAID'nin ana gücü, istatistiksel olarak rigor'dur, bu da veriye olan doğal grupları ortaya çıkarabilir. Ancak, CHAID, regresyon görevleri için daha az uygun değildir (Regresyon için CHAID adı verilen bir uzatmanın var olduğu gibi). Ayrıca, veri kümeleri için otomatik olarak çok sayıda kategoriye sahip hale getirir ve ona olan bağımlılığın azaltılması, CHAID'nin tekrar tekrar tekrarlama işlemleri için daha küçük bir miktarını kırabilir.

CHAID'de referans için bakınız: 03.Ö.:0) Categorical Data (Kass, 1980) Büyük Sayısal Sayıları Yatırım için Açıklama Teknikleri).

Anahtar Özelliklerinin Karşılaştırma Analizi

Aşağıdaki tablo, C4.5, CART ve CHAID arasındaki en önemli farkları özetliyor.

Feature C4.5 CART CHAID
Splitting Criterion Information gain ratio Gini impurity (classification), variance reduction (regression) Chi-square test (classification), F-test (ordinal)
Tree Structure Multi-way splits possible Binary splits only Multi-way splits (auto-merging categories)
Supported Target Types Categorical (classification), continuous (with modifications) Categorical and continuous Primarily categorical; continuous via binning
Handling Continuous Predictors Dynamic threshold search Dynamic threshold search Bin into categories (user-defined or automatic)
Missing Values Probabilistic distribution Surrogate splits Treated as separate category or mode imputation
Pruning Method Error-based pruning Cost-complexity pruning Stopping rule via significance level (no explicit pruning)
Scalability Moderate; expensive for large numeric datasets Good for moderate-sized datasets Slower with many categories
Interpretability High (often compact trees) High (binary splits easy to follow) High (statistically justified splits)
Overfitting Control Strong via pruning Strong via cost-complexity pruning Moderate; controlled by significance threshold

Bu teknik farklılıkların ötesinde, algoritmaların da, bağlantıdaki kategorilerin hedefle bir etkileşim oluşturup yansıtması gerektiği konusunda farklılıklar gösterir. CART'ın ikili bölmeleri, aynı niteliklere tekrarlanan kategorilerden tekrarlanan karmaşık etkileşimleri modellemesine izin verir. CHAID'nin multi-way bölünmüşleri, birleşme kategorileriyle doğrudan bir araya gelebilir. C4.5, orta bir zemin sunuyor, çoklu-yol bölünmüşler sunar, ancak CHAID'nin performans gösterdiği kategorilerden otomatik para kazanabiliyor.

Algoritma Seçimi için Kılavuz

Doğru karar ağacı algoritmasını seçmek, veri setinizin özel özelliklerine ve analizinizin hedeflerinize bağlıdır: Aşağıdaki yönergeleri kullanın:

  • [FONT:0)Choose C4.5, [Dönetici: 0,5] Sürekli ve kategorik verileri işleyen çok yönlü bir algoritmaya ihtiyacınız var, eksik değerler mevcut ve yorum yapmak için kolay bir ağaç istiyorsunuz. C4.5 birçok sınıflandırma görevi için iyi bir varsayılan seçim.
  • [FONT:0)Choose CART ne zaman:) Her iki sınıflandırma ve regresyon için sağlam bir algoritma gerektirir, verileriniz birçok eksik değer içerir veya ikili bölünmelerin basitliğini tercih edersiniz. CART'ın gerçek dünya verilerinin desen eksikliği ile güçlü olduğunu.
  • [FONT:0)Choose CHAID ne zaman:) birincil ilginiz kategorik değişkenler arasındaki ilişkileri araştırmak, istatistiksel olarak haklı olan bir ağaca ihtiyacınız var veya boyutsallığı azaltmak için kategoriler otomatik olarak para kazanmak istiyorsunuz. CHAID özellikle pazarlama segmentasyonu ve anket analizinde popülerdir.

Ayrıca ağaç büyüklüğü ve doğruluğu arasındaki ticarete de değer vermeye değer. C4.5 ve CART genellikle dikkatli bir şekilde incelenebilir, CHAID'nin önemine dayalı durak kuralı sığamaya eğilimlidir; iyi bir alternatif C4.5'den önce büyük bir algoritmaya başvurmaktan önce bin kategoriye girebilir.

Pratik Uygulamayı Değerlendirme

Tüm üç algoritma popüler veri madenciliği araçları ve programlama kütüphaneleri mevcuttur. C4.5 Weka'da (J48), CART R (rpart paketi) mevcutturken, Python (scikit- learning's DecisionTreeClassifier with default Gini), ve diğer birçok platformda CHAID, SPSS'de ve R (CHAID paketi) Kontrol altına alındığında, C4.5 için dikkat edin.

Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç

C4.5, CART ve CHAID her biri Gini impurity ve maliyet-komblemleri için eşsiz bir avantaj sunuyor. C4.5 Her iki sınıflandırma ve regresyon görevleri için ideal hale getirir, sürekli ve eksik verileri işlemek ve hata bazlı bir şekilde birleştirmek, özellikle de Gini imkansız veri analizi için uygundur.