Karar ağaçları, hem sınıflandırma hem de regresyon görevlerine dayanan temel bir makine öğrenme algoritmasıdır. popülerlik kökleri sezgisel, kural tabanlı bir yapıdan aynalar insan karar verme süreçleri, onları veri bilimcisinin en iyi modellerinden biri haline getirmek, özellikle de karmaşık veya yüksek boyutlu ayarlara dayanan düğümlerden oluşur.
Hangi Karar Ağaçları?
Bir karar ağacı, bölgeye ait olan özelliği tekrar gözden geçirir, her biri bir tahmin tayin eder - regresyon için, bu bölgede ortalama hedef değeri ve sınıflandırma için, sınıflandırma işlemi, yetersizlikteki en büyük azalmayı en aza indiren bölünmeleri seçer; Bu işlem, bir durdurma kriteri olarak kabul edilir veya en yüksek sayıda örnekleme ile sonuçlanabilir.
Bir anahtar özellik, karar ağaçlarının mesafe ölçümlerine veya geometrik mesafelere güvenmediğinindir. Bunun yerine, eş-düşük karşılaştırmalar kullanır: belirli bir özellik için [[FONTD:0)X,2][DÜye Olmayan Durumlar, genellikle değişkenlik içinde kabul edilir.
Yaygın Data Scaling Techniques
Veri ölçeklendirme, veya ölçeklendirme, sayısal özelliklerin ortak bir aralık veya dağıtıma doğru boyutsal özelliklerini değiştirir. En yaygın iki yöntem şunlardır:
- [0,0]Min-Max Scaling[[Dönetici: 1 ) - normalleşme, yeniden ölçekler sabit bir aralıkta, genellikle [0, 1].Her değer aralığın en az ve bölünmesi ile dönüştürülür: [DüzDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜ
- [FONT:0)Standartizasyon (Z-mark Normalizasyon))[değiştir | kaynağı değiştir] - sıfır ve standart bir sapma anlamına gelir:0)X = (X -- μ) / ⁇ [Dörtücük ölçeklendirmeden farklı olarak, standartlaştırma belirli bir aralığına bağlı değildir, bunu daha sağlam bir şekilde dışarıya çıkarmak için daha sağlam yapar.
- [FONT=0]Robust Scaling[[Dönetici: 1 ) – medyan ve interquartile aralığı (IQR) anlamına gelir ve standart sapma yerine, ölçeklendirme parametrelerine karşı dirençliliğe sahip olur.
Bu teknikler, vektör makineleri (SVM) ve k-nearest komşuları (k-NN) gibi algoritmaların kritik olmasına rağmen, bu tür haritalarda mesafeleri hesaplayan, karar ağacı performansındaki rolü daha fazla nuanced.
Ölçeği Ölçeği Ölçeği
Tamamen algoritmalı bir bakış açısıyla, karar ağaçları değişmez çünkü bölme süreci yalnızca özellik değerlerinin siparişi üzerinde karar verir, mutlak büyüklüğü değil.Bir ağaç en iyi bölünmüş nokta için arama yaparken:0)))))[D[Döneticileri değiştirmiş sayarsak, iki değişkenli değerle aynı şekilde ortaya çıkan eşleme noktaların tamamen farklılaşması gerekir.
Bu teorik nedenleme, bölünme algoritmasının tam karşılaştırmaları kullandığı ve yüzen hassaslıkların eserler sunamaması gibi, modern uygulamalar - scikit- learning'sİLFLT:0) ve [[Dönetici ve aynı ağaçlar üreteceği varsayım altında tutar - rescaling'in sayısal konularda sayısal sorunlara neden olmadığı konusunda aynı öngörüler verir.
Scaling Nerede Etkili Performansa Etkileyebilir
Teorik insensitiviteye rağmen, birkaç pratik senaryo, ölçeklendirmenin karar ağacı sonuçlarını etkileyebilir, özellikle de özellik alanı yüksek boyutlu olduğunda, veriler dengesizdir, veya ağaçlar daha karmaşık sistemlerde bileşenler olarak kullanılır.
Yüksek Boyutlu Data
Özellikler büyüdükçe, ağaç daha geniş bir seçim sürecine sahiptir, potansiyel olarak iki özellikle daha büyük bir boşluk sağlar: Özellik 0 ila 1 arasında özel bir dizi özellik, herhangi bir önyargıya sahip olmak için diğer tüm özellikleri belirlemek için daha büyük bir özelliktir.
Dahası, yüksek boyutlu alanlarda, ağaç aşırılığa eğilimlidir, çünkü birçok eşikten yararlanabilir. Scaling doğrudan aşırı yüklemeyi önler, ancak belirli özelliklerin çeşitli tabanlı avantajlarını ortadan kaldırırken, pruning veya normalleştirme teknikleri ile bir araya geldiğinde daha istikrarlı ve genelleştirilebilir bölünmüşlere yol açabilir.
Imbalanced Feature Ranges
Özellikler çok farklı birimler veya büyüklükler olduğunda, ağaç daha büyük aralıklarla daha yüksek önem verebilir, bu özellikler aslında daha fazla ayrımcı değildir. Bu, özellikle veri setleri fiziksel ölçümler (örneğin, Kelvin vs. baskı) veya finansal veriler (örneğin, 18-90 yaş arası bir artış) gibi bir özellik daha açık bir şekilde eşlemez.
Her iki özellik için de en fazla dörtlü ölçeklendirmek, uygulamanın büyüklüğüne eşitlenir, ancak ağacın iç heuristiklerinin davranışlarını artırabilir - bazı uygulamalardaki eşiğine göre daha karşılaştırılabilir hale gelir.
Ensemble Yöntemleri
Karar ağaçları genellikle rastgele altlar gibi benzerliklere bağlı olarak en iyi performanslarını elde ederler, sütun örnekleri veya Random Forests'te her ağaç, sıraların ve rastgele altların örneklerini iyileştirmeye benzer özellikleri gösterir.Eğer özellikleri yaygın olarak farklılaştırırsa, sütun seçimindeki rastgele ayrımlar, sütun seçimi gibi ayrımlar ile etkileşime girebilir. Örneğin, Random Forests'ta her ağaç daha fazla ayrımcılığa yol açan özelliklerin boyutlarını azaltabilir.
Gradient, yöntemleri (örneğin, XGBoost, LightGBM, CatBoost) hataların büyüklüğüne bağlı olarak veya dolaylı olarak ölçeklendirmek için hassas olabilecek sağlam kayıp fonksiyonlarını kullanarak, birçok güçlendirme uygulamalarını ele almak için seçenekler sunar, kedisel özellikler ve kayıp değerler, hataların büyüklüğüne bağlıdır.
Özellik
Veri ölçeklendirme ayrıca, uygulayıcıların karar ağacının nasıl yorumlandığını da etkiler, özellikle de önemli puanlar. Yaygın olarak kullanılan bir öneme sahip olabilir (veya ağaç yapısı değişmeden kalırsa, ağırlıklı boşluk azaltılabilir) farklı ağaçlara (her bir özellikten daha sık seçilebilirler) göre, özellikle de sıralamaların önemini değiştirebilirler.
Pruning ve Düzenlileştirme
Karar ağaçları, alt kutuların ölçülmesi ile ilgili olarak incelenebilir (ccp alpha in scikit- learning), hangi ticarilerin yanlış sınıflamaya karşı ağaç derinliğini azaltabilir, çünkü alt kesimdeki özelliklerin bozulmasına engel olur.
Pratik Öneriler ve Örnekler
Tarif edilen desenlere dayanarak, burada karar ağaçları kullanarak veri bilim adamları ve makine öğrenme uygulayıcıları için dikkatli kılavuzlar:
- [FONT:0) Düşük boyutlu, homojen özellikler için ölçeklendirmeden başlayın.[Dönetici:0) 10'dan daha az özellik varsa, benzer ölçeklerde (örneğin, 1-5), ölçeklendirme gereksizdir.
- [FONT:0) Yüksek boyutlu veri kümelerinde ölçeklendirme ile ilgili ayrıntılı bilgi için;% 1 veya yüzlerce özellik için, özellikle yaş, maaş, mesafe ve sayı gibi birimleri karıştırırken, zaman aralığı, yüksek çözünürlük veya standartlaştırma ve karşılaştırma puanlarını uygularlar.
- [FONT:0)Always ölçek, birçok özellikle birlikte ensemble yöntemleri kullanırken ölçeklenebilir.[FONT:0)Dokuzluklar ağaç çeşitliliğini stabilize edebilir ve hiperparametreleri farklı özelliklerle ayarlamayı sağlar. XGBoost'da, regresyon için hedef değişkenini ölçeklendirmek genellikle gradyan yakınlaşma için faydalı olur.
- [[D:0)Combine özellik seçimi veya boyutsal azalma ile ölçeklendirme[Dönetici:0) PCA veya özellik seçme algoritmaları (örneğin, variance eşleri) uygulamadan önce, değiştirilen özellikler, o zaman çeşitli eserler için endişe duymadan karar ağacının bir araya gelmesini sağlar.
- [FONT:0)Doğallar mevcut olduğunda sağlam ölçeklendirme kullanın.[[DÜT:1) Standartlaştırma, dışlayıcılara karşı hassastır; sağlam ölçeklendirme (ortalama ve IQR), özellikle de karar ağaçları için ilgili birkaç uç noktası engeller, çünkü outliers genelleştirmeyi incitebilir.
- [FONT:0) Notlar için ölçeklendirme seçenekleri[Dönetici:0) Kurulum veya uygulamanız, önceden işleme hattını kaydetmek, aynı parametrelerin (min, max, yani, std) zamanında kullanılmasının sağlanması.
Örneğin, kredi riski veri kümesinin özellikleri ile göz önünde bulundurun: yaş (20–70), gelir (15k-$2M), bağımlı sayısı (0–5) ve borç- gelir oranı (0.0-1.5). ölçeklendirmeden sonra, gelir özelliği bölünmüş adaylara hükmediyor, çünkü yaş için büyük bir aralığı (2 milyon vs 50 dolar) A karar ağacı gelir ve diğer özelliklerin yanı sıra, eklenmedik sinyallerin tamamını arttırabiliyor.
Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç
Karar ağaçları, doğrusal ölçeklendirmeye karşı hassastır, çünkü bölünmüş mantık değerlerin karşılaştırmalarına karşı geri kalanınız, mesafeleri değil, bu teorik değişmezlik tüm gerçek dünya uygulamaları ile daha iyi bir şekilde genişletir.Üst boyutlu alanlarda, özellikle de farklı ölçeklere sahip olduğunda, ölçeklendirmek için ölçeklendirmek, ölçeklendirmek için modellemek ve daha iyi bir şekilde değerlendirme yapmak için doğru bir şekilde modellemek için doğru bir şekilde yapılır.
Daha fazla okuma için, resmi olarak [[Dönetici-öğrenme belgelerine bakınız[Dönetici:0) ve Freud, ağaç bazlı yöntemler hakkında araştırma yazıları üzerine yapılan araştırmalarda, kapsamlı bir akademik tartışma, [Dördüncü Boyutlu Öğrenmenin Özellikleri” [Dörtüncü Boyutlu Öğrenmeler, Tibsani ve Friedman, Tibsani, ve Friedman, ayrıca ağaç bazlı yöntemler üzerinde araştırma makalelerinin değerlendirilmesi ile ilgili olarak, [FLT: 7:6) bu çalışma [Döneticileri üzerinde ölçeklendirmede ölçeklendirmede ölçeklendirmede bulunabilir.