Matematiksel Modelleme Mühendislikte
Zaman Serisi Tahminleri için Karar Ağaçları Kullanımı: Zorluklar ve Çözümleri
Table of Contents
Zaman Serisi Tahminleri için Karar Ağaçlarına Giriş
Karar ağaçları, özellik alanını bölgelere bölmek ve basit karar kurallarına dayanan tahminleri yapmak için denetimli makine öğrenme algoritmalarının bir sınıfıdır. Karar ağaçları, hem sayısal hem de kategorik veriye dayalı olarak, birçok tahmin edici modelde bir temel haline geldi.Son yıllarda, uygulayıcılar karar ağaçları uygulamaya başladı - ve ensemble varyantları - zaman serisi tahminleri, hedefin gelecekteki değerleri tahmin etmek için en iyi tahminlere dayanarak nerede olduğunu tahmin etmeye başladı.
Zaman serisi verileri, gözlemlerin zaman içinde otomatikleştirilmesi veya zamansızlığı ile tanımlanır ve genellikle istasyon dışı davranışlarda bulunmamalıdır. Standart karar ağaçları her örnek bağımsız ve aynı şekilde dağıtılır (örneğin, veri dönüşümü ile), gözlemler otomatik olarak veya zaman içinde geçiş yaparken tutmaz bir varsayım haline gelir. Doğru bir şekilde, karar ağacı, kötü zamanlı dinamikleri yakalamaya devam edebilir, zayıf tahminlere yol açabilir.
Bu makale üç ana bölümde düzenlenir. Birincisi, modern tahmin akışlarında karar ağaçlarının rolü üzerine özgün temel zorlukları detaylandırıyoruz ve daha fazla araştırma için kapsamlı çözümler ve en iyi uygulamalar sunuyoruz.
Karar Ağaçlarını Zaman Serisine Uygulamanın Temel Zorlukları
Zaman serisi tahminleri için karar ağaçları etkin kullanmak için, bir tanesi birkaç temel engeli kabul etmeli ve ele almalıdır. Bu zorluklar hem verilerin hem de algoritmanın doğasından kaynaklanmaktadır.
Temporal Bağımlılığı ve Autocorrelasyon
En önemli meydan okuma, varsayılan olarak, zamansal bağımlılığa sahip olmak için inşa edilmiş bir mekanizmaya sahip değildir. Standart bir karar ağacında, her zaman serisi, zaman değeri olarak kabul edilir.[Döneticileri Göremez], örneğin, yarının sıcaklığının, dünün içindeki sıcaklığın yalnızca ilgili kararların yer aldığı gibi açık bir şekilde öğrenilebilmesi için gerekli olan bir ağaç.
Olmayanlık ve Kavram Drift
Zaman serisi verileri genellikle istasyon dışı olmayan bir şekilde sergilemektedir: Yani, variance veya otokorelasyon yapısı zamanla değişir.Sıra fiyatları, ekonomik göstergeler ve hava modelleri tüm şov trendleri, mevsimsellik veya aniden değişimleri gösterir. Tarihi veriler üzerinde eğitilmiş bir karar ağacı, konsept sürüklenmelerine dayanan sert karar sınırları yaratır.
Noisy veya Sınırlı Verilerde Fazlalık
Karar ağaçları aşırılık eğilimiyle biliniyor, özellikle de kısıtlamalar olmadan derin büyüdüklerinde, gürültü, outliers ve düzensiz çevrimler. Derin bir ağaç, eğitim setinde önemli görünen çok kötü kalıpların üstesinden gelebilir, ancak veri setinde çok daha iyi bir şekilde yaygınlaşır, bu riski geleneksel rastgele tren/test bölmeler geçersiz kılar; eğer bir ağaç geçmişten gelen gürültüyü tahmin ederse, gelecekteki görünmez veriler üzerinde kötüleşir.
Özel Mühendislik Kompleksi
Zaman serisi için tasarlanmış modeller aksine (örneğin, ARIMA, Exponential Smoothing), karar ağaçları, zamansal kalıpları yakalamak için tahmin edilebilir özellikleri gerektirir. Uygun gecikme uzunluğu, yuvarlanma istatistikleri için pencere boyutları ve dış regretörler, mevsimsel desenler ve önemli deneyler için hafta boyunca başka bir karmaşıklığa sahiptir; çok fazla gecikme ve model aşırılık sağlar.
Diğer Performans Ticareti
Tek bir karar ağacının ana avantajlarından biri - dikkat edilebilirlik - rastgele Ormanlar veya Gradient Boosting gibi karmaşık bir araya geldiğinde kaybedilebilir.Tek bir sığ ağaç net karar kuralları sunarken, yüksek tahminlere ulaşmayabilir. Derin ağaçlar veya ensembller performans geliştirir, ancak belirli bir tahminin neden yapıldığını açıklamak zorlaşır. Practitioners genellikle yorumlanabilirlik ve devlet-of-of-the-art sonuçları elde etmek arasında bir ticaretle karşı karşıya kalır.
Karar Ağacı Zaman Serisi Tahminleri için Çözümler ve En İyi Uygulamalar
Zorluklara rağmen, karar ağaçları etkili tahmin modellerine adapte etmek için birçok strateji var. Aşağıdaki bölümler ayrıntılı kanıtlanmış teknikler, veri hazırlığından modelleme ve değerlendirme.
Temporal Structure'ı Yakalamak için özel mühendislik
Karar ağaçları zaman siparişini doğal olarak ele geçiremeyeceğinden, en kritik adım, zaman serisini denetimli bir öğrenme problemine dönüştürmektir. Bu, her satırın bir zamana karşılık geldiği ve içerdiği bir özellik matrisi yaratır:
- [FONT=0)Dönetici:[Dönemli değerler:[Dönetici:0)[Döncükler:[D))[Dönetici:[Dönemli değerler:[Dönemli değerler:[Dönemli:[Döncükler) veya alan bilgisi. haftalık mevsimsel olarak, 7, 14 21 vs.
- [FONT:0) Pencere istatistiklerine dikkat edin:[Dönder:[Dönder: 0,3, standart sapmalar, min, max ve farklı uzunlukların pencerelerini ele geçirmelerine yardımcı olur. Örneğin, 7 günlük bir demiryolu, gürültüyü düzeltirken son seviyeye doğru kodlanır.
- [FONT:0]Calendar ve döngüsel özellikler: Yaz saati, hafta günü, ay, çeyrek ve tatil göstergeleri. Encode Çevrimsel özellikleri, sine ve kosine dönüşümleri kullanarak dairesel sürekliliği korumak için.
- [FONT:0)Döneticileri:[Döneticileri, ekonomik göstergeler veya hava verileri gibi hedefleri etkileyen değişkenler içerir. Karar ağaçları eksik değerleri ele alabilir, ancak dikkatli bir kesinti zaman serisi bütünlüğü için önerilir.
- [FONT:0) Zaman tabanlı özellikler:[Dönetici:[Dönder: 1 ) Zamanları ekle (örneğin, başlangıçtan beri birkaç gün) ağacı doğrusal eğilimleri modelleyebilmelerine izin vermek, ancak doğrusal olmayan eğilimler diğer özellikler tarafından daha iyi yakalanır.
Özel mühendislik, ilgili özellikleri hipotezlere dayanan alan öngörüleri kullanır, sonra eğitimli bir ağaçtan gelen anlamsal olmayanlara dikkat eder.Otomatik ekstraksiyon için kullanılan aletler veya 0:1'i kullanın, ancak her zaman veri sızıntısını önlemek için manuel olarak doğrulanır - geçmiş özellikleri oluşturmak için gelecekteki bilgileri kullanın.
Data Transformations aracılığıyla ayrım yapma
Veriler trendleri veya mevsimlik sergilendiğinde, farklılaşma seri sabit hale getirebilir. İlk sipariş farklılaştırması:0)y'(t) = y(t) - y(t-1)[D)[Dönetici)[Dönetici:2)) - y(t) = y(t)[D)[D)[Döneticisel dönüşümler için)[x-kömürücüksel dönüşümler için)[x-kürücüksel dönüşümler için)
Dönüşümten sonra, orijinal tahminler farklılaşma yoluyla geri alınabilir. yuvarlanma tahminleri için, hata yayılımından kaçınmaya yönelik önemli farklılıklar birikimine ihtiyaç vardır. Alternatif bir yaklaşım, serileri seviyelere taşımakta ancak açık trend ve mevsimsel özellikler içerir, ancak farklılaştırmanın boyutlandırmak için daha sağlamdır.
Başka bir çözüm, Gradient gibi en fazla yöntemler kullanmak, fark edilen veriler üzerinde artırmak, bu daha iyi ikamet etme eğiliminde. random Forest kullanarak, bu da eğitim verilerin yelpazesinin ötesinde fazlapolate olmayan, farklılaştırma özellikle yararlıdır çünkü hedef sıfır ve ekstrapolasyon riskini azaltır.
Aşırı yüklemeyi azaltmak ve Doğruyu Geliştirmek için Ensemble Methods to Reduce Overfitting and improve Truth
Tek karar ağaçları, yüksek değişkenlik nedeniyle tahmin etmek için nadiren kullanılır. Ensemble yöntemleri, aşırı yükleme ve tahmin edici performansı artırmak için birden çok ağacı birleştirir:
- [FONT:0]Random Forest:[Dönetici:[Döncükler) Birçok ağaç çizmeli örnekler ve rastgele özellik alt setleri. Zaman serisi için, blokaj botları kullanarak, zaman zaman aralığına saygı gösteren tıkayın.
- [FONT:0)Gradient Boosting Machines (GBM):[Dönetici: 0:0)[değiştir | kaynağı değiştir] Ağaçların önceki modellerin yanlış hatalarına işaret ediyor. XGBoost, LightGBM ve CatBoost, altsampletlar.
- [FONT:0)Extreme Random Trees (Extra Trees):[Döneticileri ile birlikte, rastgele eşleme bölünmüşler ile, daha fazla varyansiyon azaltılabilir. Bu özellik alanı gürültülü olduğunda etkili olabilir.
Ensembles ayrıca özellik önemli puanlar sağlar, hangi gecikmelerin veya dış değişkenlerin en tahmin edici olduğunu tanımlamaya yardımcı olur.Remutasyon önemini veya yerleşik modelleme ve modelleme model davranışını yorumlamaya dayalı önem kullanın.
Zaman Serisi-Specific Cross-Validation
Standart k-katılımlı karfles verilerinin zaman serisi için geçersiz olduğu anlamına gelir, çünkü geçmiş verileri tahmin etmek, aşırı iyimser doğrulukla yol açan gelecekteki verileri kullanır.
- [FONT:0]Walk- ileri geçerlilik:[Dönetici:[Dönetici:0)))) Son verilerin genişleyen veya kayan pencerelere doğru tren ve bir sonraki blokta test. Örneğin, 13 ay içinde 1-12, test; o zaman 14 ay içinde tren, bu mimiks gerçek dünya tahmin koşulları.
- [FONT:0) Zaman serisi bölünmüş:[Dönetici:0)Eğitim seti her zaman test setinden önce, sabit veya büyüyen eğitim büyüklüğü ile bir değişkendir. Scikit-learn'in [[Dönetici:2) uygun bir uygulamadır.
- [FONT:0) Zaman serisi çapraz-validasyon: [Dönelgesel döngüler için dikkate alınması gereken, her geçerlilik katlarının katlanmadan kaçınmak için tam mevsimsel dönemler içerir.
Hiperparametreleri ayarlandığında, nested çapraz-validasyon kullanın: hiperparametre arama için içsel bir döngü ( eğitim verileri üzerinde yürüyüş yapmak) ve performans tahminleri için dış bir döngü sağlar.Bu, öngörülemeyen hata tahminleri sağlar ve bilgi sızıntısını ayarlayın.
Düzenlileşme ve Ağaç Pruning
Aşırılık kontrolü için, doğrudan ağaç büyümesi için düzenlileştirme uygulayın:
- [FONT=0)Limit ağacı derinliği:[Dönetici:[Dönetici:0)))Yüksek derinlik (örneğin, max derinlemesine=5), belirli bölünmeleri önlemek için.
- [FONT:0)Dönemli örnekler yaprak başına:) yaprak düğümlerinde gerekli minimum sayıda örnek (örneğin, min samples leaf=5), bölünmelerin genelleştirilebilir olmasını sağlamak için.
- [FONT:0)Minimum yetersizlik azalır:) Bir bölünmeyi haklı çıkarmak için minimum azaltımı gerektirir.
- [FONT:0)Köst-komplexite (CCP): [Döneticileri kullanın ([Döneticileri [[Döneticileri) eğitimden sonra özellikle de ince şubelere sahip olmak için.
Modelleri artırmak için, geçerli bir kurulum setinde 0.1'den daha az öğrenme oranı kullanın ve altsample sütunları ve satırlar. Bu teknikler kolektif olarak eğitim dönemi ötesinde genelleştirilmiş daha sağlam bir model yaratır.
Çoklu Mevsimliklerin Kullanımı
Zaman serisi genellikle çok sayıda mevsimsel döngüler sergilemektedir (örneğin, günlük, haftalık olarak), karar ağaçları mevsimsel olarak uygun bir özellik ile mevsimsel olarak mevsimsel olarak mevsimsel olarak, haftanın gün ve hafta boyunca bir kategorik özellik içeriyor.
Daha uzun mevsimsel dönemler (yılın) bir “günlük” özelliği eklemek veya Fourier terimleri kullanmak (sine/kosine çiftleri farklı dönemlerle) mevsimsel enkoding boyutlarını azaltabilecek şekilde.Bu özelliklerden mevsimsel olarak ayrılmaya kadar ayrım yapabilir. Alternatif olarak, serisini trende, mevsimsel olarak, ve zihinsel bileşenleri STL dekompozisyonla, sonra karar ağacı ile mükemmel bir şekilde modelleyebilir.
Pratik Çalışma akışı: Bir Adım-by-Step Örnek
Kavramları göstermek için, rastgele bir Orman modeli kullanarak günlük elektrik talebini tahmin edin. Veri seti, dış sıcaklık okumalarıyla iki saatlik bir veri içerir.
- [FONT:0)Data hazırlığı:[Dönemli karara dönüştürülür, eksik değerleri (geçmiş) ele alır ve geçerli bir süre yaratır (son 3 ay). trendi kaldırmak için (ilk sipariş) sonuçları bir sabit seride çıkarır.
- [FONT:0)İş yaratılması: [Dönetici: [Dönetici: 0, gün, hafta), sıcaklık (saat, gün), ortalamalar (24 saatlik pencere), günün saat (si/kosine), hafta (bir-hot) ve tatil günü (bir-hot)
- [FONT:0) Model kurulumu: [Dönetici: [Dönemli Orman 200 ağaçla, max derinlemesine=10, min samples leaf=5 ve saat bağlı tutma süresi ile önyükleme.
- [FONT:0)Validation:[Dönetici:[Dönetici: 1 gün bir test adım ve 60 günlük eğitim penceresi ile geçerli olan bir ağ aramayı kullanarak). TuneurFLT:4).
- [FONT:0)Forecast nesli:[[Dönemli)[[Dönemli) Tahmin edilen değeri kullanarak bir adım önceden tahmin edin, güncelleme gecikme özellikleri tahmin edilebilir değer kullanılarak ve her ufuk için ayrı modeller devam edin.
- [FONT:0)Evaluation:[Dönlendirme:[Dönlendirme:[Dönlendirme:[Dönlendirme:[Dönlendirme:[Dönlendirme:[Dönlendirme:[Dönlendirme)) Geri kalan otokorelasyon için kontrol etmek için gerçeklere karşı öngörüler.
Bu iş akışı genellikle naif kalıcı tahminlerin ortaya çıktığı bir model verir ve daha karmaşık sinir ağları ile rekabetçidir, ancak özellik önemi ile yorumlanabilir.
Diğer Tahmin Modelleriyle Karşılaştırma
Karar ağacı tahmin ekosisteminde orta bir zemin işgal ediyor. Lineer modeller (ARIMA, Exponential Smoothing) daha esnektir, çünkü LSTM olarak çok uzun süreli ilişkileri ve etkileşimleri modelleyemezler ve manuel özellikler olmadan daha az karmaşık ve daha hızlı trene gidebilirler. (LSTM, Transformers), ve diğer yandan daha az veri işleme gerektiren sorunlar için daha az veriye sahip olabilir, MGB yarışları ve en uzun menzilli sistemlere göre daha sık sık sık sık sık sık sık sık sık sık sık sık sık sık sık sık sık sık MGB’ye göre.
Zaman serisi yöntemlerinin daha derin bir karşılaştırması için, bakınız:0)Forecasting: Principles and Practice Ders Kitabı[[Döneticileri ve makine öğrenme yaklaşımlarını kapsayan). Practitioners ayrıca özel zaman serisi kütüphaneleri keşfetmeli:2).sktime).
Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç
Zaman serisi tahminleri için karar ağaçları kullanmak, onları bağımsız verilere uygulamak kadar basit değildir, ancak zorluklar sistematik olarak üstesinden gelebilir.Dönemli zaman özellikleri geri dönüş değişkenleri ve yuvarlanma istatistikleri aracılığıyla, sabitleme veya dönüşümler yoluyla, en yakın yöntemler kullanarak, arazileri azaltmak ve yürüyüşe başvurmak için sistematik olarak yorumlanabilir ve yorumlanabilir tahmin modelleri oluşturabilir.
Araştırma ilerlemeleri olarak, genelleştirilmiş rastgele ormanlar ve sinirsel temel genişleme analizi gibi yeni teknikler (N-BEATS) ağaç tabanlı ve derin öğrenme tahminleri arasındaki boşluğu kapatıyor. Ancak, birçok gerçek dünya uygulamaları için yorumlanabilirlik ve hesaplama verimliliği öncelikler, karar ağaçları değerli bir araç olarak kalıyor.
[0]Further Reading: [Dönem: [Düzd:0)
- [FONT:0)Scikit- learning Ensemble Methods Documentation[Dönem: 1)
- [0]"Zaman Serisi Tahmini İçin Makine Öğrenmesi" - Akademik Kağıt[Dönemli: 1 )
- [0]Kaggle Time Series [[Dönetici: 1 )