Makine Öğrenme Algoritmalarını Dinamik Ortamlarda Pid Tuning için Nasıl Kullanır
Table of Contents
Giriş: PID Tuning'in Dinamik Sistemlerdeki Mücadelesi
Proportional-Integral-Derivative (PID) kontrolörleri endüstriyel otomasyon, süreç kontrolü ve robotların temelleri olarak kalır.(+) Sıcaklık, hız, basınç ve akışlar için ilk seçim yapar.[Dörtücükler, PID kontrolleri, üç kazancın ayarlandığında; [Dönemli)[Dönemli)[Dönemli:)
Makine öğrenimi bir paradigma değişikliği sunuyor: ayar PID'nin elde edilmesi yerine veya kural tabanlı heuristics ile algoritmaların temelleri kaplayabiliyoruz, algoritmaların ), sistem davranışından ve gerçek zamanlı uygulamadaki parametreleri ayarlar, gerçek zamanlı olarak, kontrol algoritmalarının nasıl kullanılabileceğini ayrıntılı olarak kılavuzlar.
PID kontrolörlerini Anlamak: Bir Yenileme
Bir PID kontrolörü bir hata değerini hesaplamaktadır:0)[t)[Dönemli bir set noktası arasındaki fark[Dönetici:2)[Dönemli ve sıralamalı terimler:)[Dönemli:0)[Dönetici:0)[Dönetici:0)[Dönetici:0)[Dönetici:)[Dönemli, integral ve türevsel terimler:
[DÜŞÜNÜ:0][DÜDÜDÜDÜŞÜŞÜŞÜŞÜŞÜŞÜye: Üye Olmayanlar İçin ⁇ .
Her kazanç ayrı bir amaç hizmet eder:
- [FONT:0)Proportional kazan (K))[Dönetici:2)[Dönetici:0))[Dönemli hataya tepki verir, zaman azalır, ancak potansiyel olarak aşırıya neden olur.
- [FONT:0) Integral kazanır (K)[Dönetici:2)[Dönetici:2)[Dönemli) Sürekli devlet dengesini ortadan kaldırmak için geçmiş hataları bir araya getirir, ancak çok yüksek olursa gecikme veya istikrarsızlığı da beraberinde getirebilir.
- [FONT:0)Derivative kazanç (K[DÜT:2)[Dönemli:0)[değiştir | kaynağı değiştir], sönüme ve aşırı yüklemeye dayalı gelecekteki hataları tahmin eder, ancak gürültüyü azaltır.
Bu üçünün Balancing PID ayar sanatıdır. Geleneksel yöntemler sabit bir bitki modeli varsayılır; örneğin, bir robot kolu farklı maaş yüklerini veya katalizörü yaşlanmayı deneyimleyen kimyasal bir reaktördür - melodik kazançlar yetersiz hale gelebilir, osilasyonlara yol açabilir, hatta dengesiz yanıt verebilir.
Neden Geleneksel Tuning Falls Dinamik Ortamlarda Kısa
Teknikler: 0,2.Etçeler [Döneticileri [Döneticileri: Adım cevabı veya kapalı-loop nihai kazanç) makul başlangıç noktaları sağlar, ancak sadece lineer, zaman değişken sistemler için geçerlidir.In practice, systems Sergiler[Döneticiler[Döneticiler:2).[Döneticiler, histerler, histerler), [[Döneticileri bir noktada çalışır.
Makine öğrenme, bu, gözlemlenen verilere dayanan kazanımlara sürekli olarak adapte ederek, geniş bir işletim kabuğunda optimal kontrolü korumak mümkün kılar. Bu, gümüş bir mermi değildir - veri kalitesi, model karmaşıklığı ve hesaplama kısıtlamaları önemlidir - ancak modern otomasyon için güçlü bir araçtadır.
Makine Öğrenme Yaklaşımları PID Tuning
Çeşitli makine öğrenme paradigmaları PID ayarına uygulanabilir. Seçim sistemin doğasına, verilerin erişilebilirliği ve gerçek zamanlı gereksinimlere bağlıdır.En umut verici yaklaşımlar da vardır.[0]Dönetici öğrenme (RL)).
Adaptif PID Kontrol için Öğrenme
Dondurma öğrenimi doğal bir uyumdur çünkü bir politikayı öğrenir (devletlerden eylemlerine kadar) mutlak hata (IAE))[değiştir | kaynağı değiştir] ve ödül, üç kazanç (veya artacaktır.
Common RL algoritmaları, [[DQN) [DQN) , [[Dönetici:2)Proximal Policy Optimizasyonu (PPO)) ve [[DQN)[DQS)[DQN)[D 5 )[DQN)[D: 5 ))))[Düzücük, gerçek sistemdeki (güvenli) bir kez eğitilmiş olarak, sistem dinamikleri değişim olarak gerçek zamanlı olarak elde edilebilir. Örneğin, bir PPO tabanlı PID melodi cihazı, farklı bir yük yükleyicisi altında sabit yükleyici ödeme yükleyicisi veya sabit yükleyicisi altında tutabilir.
RL'nin temel avantajları karmaşık, çok adımlı karar problemlerini işlemek ve uzun vadeli performans için optimize etmek (örneğin, zaman içinde genel hata). Ancak, RL devlet gösteriminin dikkatli bir tasarımını gerektirir (örneğin, hata, hata, hata, hata türü, mevcut kazanımlar) ve keşif sırasında tehlikeli davranışları önlemek için ödüllendirme.
Neural Network Direct Tuning
RL yerine, bir sinir ağı doğrudan çıktı PID kazanımlara doğrudan doğruya trenle bir ağ kurabilir ve bu, iyi niyetli bir kontrolden toplanan verileri kullanarak çevrimdışı olarak eğitilebilir veya en iyi şekilde bilinen (Dönetici) yaklaşımı ile ağ, hata, set noktası, süreç değişkeni ve son tarih gibi girişlerle besleme mimarisine sahip olabilir.
Daha gelişmiş bir değişken şu ki:0) Adaptif sinir PID[Dönetici: 1) Bu yaklaşım, kontrol ve melodi arasındaki hattın kendisini uyguladığı, bilgi birikiminin çok yüksek veya giriş gürültüsünün filtrelenmemesi durumunda yüksek doğrulukla risklerin yüksek düzeyde veya girişte olduğu anlamına gelir.
Bayesian Optimizasyonu Güvenli, Örnek-Efficient Tuning
Veriler pahalı veya riskli olan sistemler için Bayesian optimizasyon (BO) bir örnek verimli yöntem sunar. BO, bir olasılıksal ekseç modeli (tipik olarak Gaussian süreci) performans ölçümlerinin bir fonksiyonu olarak ölçülmesini sağlar. Daha sonra insan gözetiminin gerekli olduğu bir satın alma fonksiyonunu (örneğin, beklenen bir iyileştirme) değerlendirmek için bir sonraki kazanımlara sahiptir.
BO, yeni toplu verilere dayanan kazanımlara dayalı olarak periyodik olarak çalıştırılabilir.PID ayarlandığında yüksek çözünürlükte kullanılabilir.[FONT=0}[FONT=2][/FONT=3][/FONT=3][/FONT=3][/FONT=3][/FONT=3][/FONT=3][/FONT=3][/FONT=3][/FONT=3][/FONT=3][/FONT=3][/FONT=3][/FONT=3][/FONT=3][/FONT=3][/FONT=))
Evrimsel ve Genetik Algoritmalar
Genetik algoritmaları (GAs) ve parçacık swarm optimizasyonu (PSO), ilk tahminin zayıf olduğu zaman küresel olarak en iyi optimizasyon yöntemleridir.
Adım-by-Step Uygulamalı ML-Based PID Tuning
Şimdi algoritmaları araştırdığımızda, PID ayarını dağıtmak için pratik bir boru hattı üzerinden yürüelim. Bu işlem modülerdir ve herhangi bir algoritma seçeneğine adapte edilebilir.
Adım 1: Kontrol Objektifini ve Metriklerini Tanımlayın
Herhangi bir makine öğreniminden önce, "iyi" ne anlama geldiğini belirtmeniz gerekir: Common metrics şunları içerir:
- [FONT=0)IAE[DÜT:1][/FONT=0)
- [FONT:0)ITAE[DÜT:1][/FONT=C)
- [FONT=0)Percent Overshoot[[Dönemli)[[[F]
- [FONT:0]Settling Time[[Dönemli: 1)[Dönemli:2).
- [FONT:0)Zaman[[DÜT 1:0)[Dönemli değil (Dönemli)
- [FONT=0)Denet Effort[[[Dönetici:0)
Bunlar RL veya bir kayıp fonksiyonu için RL için bir ölçeklendirme ödülüne katılabilirler. Güvenlik-kırık sistemler için, kısıtlamalar (örneğin, maksimum aşırı yükleme:0)Adım 2: Data Collection (Offline Baseline)
) Adaptif bir RL için bile, farklı kazanımlar altında sistem davranışına temel veri toplamak yardımcı olur.Bu, tarihsel işlemden manuel adım testleri veya simülasyondan gelebilir.
Adım 3: Modeli seçin ve Tren
Dondurma Öğrenmesi:
- Devlet vektörü (örneğin, ⁇ e, d/dt(e) setpoint, K))
- Define aksiyon alanı: ya doğrudan değer (kontinuous) veya artışlar (kontinuous or Broken)
- Çevre inşa edin: bitkinin simülasyonu (örneğin standart modeller) [FONTT:0)Simulink) veya )Python) veya gerçek bitki güvenlik monitörleri ile gerçek bitki
- Uygulama algoritması (örneğin, [[Dönetici:0)
- platoyu ödüllendirip güvenlik eşlerini aşarak trenle tren
- Dağıtımdan önce doğrulamada Geçerlilik
Neural Network Direct Tuning:
- Giriş- ⁇ veri kümesi oluşturun: her zaman adım için, giriş özellikleri ( terörizm, vb.) ve hedef kazanımlar elde eder.
- 2-3 gizli katmanla bir yem ağı kullanın (ReLU aktivasyon)
- Parlamental gradient iniş ile Tren, uygun normalleştirme kullanarak
- Her kontrol adımında çağırılabilecek bir işleve dönüştürülür
Adım 4: İşsizlik ve Gerçek Zaman Adaptasyon
Kontrol döngüsüne eğitim edilen modeli bütünleştirir. Bu genellikle PID güncelleştirme oranından daha düşük bir frekansta çalışır (örneğin, her 10-100 PID döngüleri) hesaplamak için hesaplamak için hesaplamak için.
Eleştirel: uygulamaFL:0) güvenlik sınırları[Dönetici: 1) Sistemin istikrarsızlığa girmesini önlemek için kazanımlara sahip olmak. Örneğin, tanımlanmış aralıklara geçiş kazançları da dahildir.
Adım 5: Sürekli İzleme ve Yeniden Eğitim
Dinamik ortamlar zamanla sürüklenir. ML modeli, işlem sırasında toplanan taze verileri düzenli olarak yeniden eğitilmelidir. Bu, online (incremental learning) veya toplu yeniden eğitim yoluyla (örneğin, bir gecede) yeniden programlayarak, kazanımlar, hata ve performans ölçümlerinin tespit edilmesi için istatistiksel süreç kontrolünü kullanarak yeniden eğitilmelidir.
ML-Based PID Tuning'in Pratik Avantajları
Manuel veya sabit ayardan ML-güdümlü ayara geçmek dinamik ortamlarda birkaç somut fayda sağlar:
- [FONT:0)Real-Time Adaptasyon:[Dönetici:[Döneticileri otomatik olarak ayarlayın – örneğin, çeşitli kütlenin robotlu bir kolu, tutarlı yörünge doğruluğuna dair nesneler tutar.
- [FONT:0)Redük Mühendislik Effort:[Dönetici:[Dönetici:0)Redüktör Mühendisliği Effort:[Dönetici:[Dönetici:[Dönetici: 1 ) Setleme sürecinin Otomasyonu, manuel olarak ayrıştırma kazanımlarını harcanan saatler boyunca kesintiye uğratmıştır, özellikle de büyük kontrolcüler için.
- [FONT:0) Belirsiz Performans Uncertainty:) ML modelleri lineer olmayanları ve zaman gecikmelerini lineer kazanç zamanlamasından daha iyi halledebilir.
- [FONT:0)Scalability:[Dönetici:[Dönetici: 0,3) Tek bir model, benzer sistemlerin bir ailesi için eğitilmiş olabilir, sonra minimum verilerle ünite başına iyi niyetli.
- [FONT:0) Öngörücü Bakım ile Integration:) Aynı ML boru hattı sistem yanıt ve bayrak bakımı ihtiyacında bozulmayı tespit edebilir.
Gerçek Dünya Uygulama Senaryoları
Robotik ve Özerk Sistemler
Inurpert:0)quadcopter kontrolü[Dönetici: DDDDDDDDD:0)))))))) Test edilen bir araç testinin gerçek zamanlı PID ayarlanması için DQN yaklaşımı göstermesi gerekir.
Endüstriyel Süreç Kontrol Kontrolü
Kimyasal reaktörler, ısı değiştiricileri ve distillasyon sütunları, katalizör deactisyon veya fouling nedeniyle zaman-varying dinamiklerini sergileyebilir. Bayesian optimizasyon, çeyrek olarak tekrar-tune döngüleri için kullanılabilir, ancak bir NN tabanlı melodik hızlı-responding döngüleri için çalıştırılabilir.
Otomotiv ve Mechatronics
Elektrikli güç yönlendirme sistemleri veya aktif süspansiyon kontrolleri, yol koşullarına ve sürüş tarzına adapte olan sinir PID ayarlarından yararlanır.
Meydanlar ve düşünceler
Umut verici olsa da, ML tabanlı PID ayar takmaz ve oyun. Kaçmak için birkaç tuzak vardır:
- [FONT:0)Sample Verimliliği:[Dönetici:[Dönetici: RL) RL milyonlarca adım gerektirebilir; dağıtımdan önce eğitim için simülasyon gereklidir.
- [FONT=0)Stability Garantileri:[[Dönetici:[Dönetici: 0) ML modelleri siyah kutulardır; resmen istikrar sağlamak zordur. Güvenlik aşırılıkları kullanın (kendisi, model doğrulama).
- [FONT:0)C ⁇ Latency:[Dönetici:[Dönetici: 0) Kontrol döngüsü içinde bir sinir ağının uygulanması gecikmeyi içerir.
- [FONT:0)Data Dağıtımı:[Dönetici:[Dönetici:0) Sistem eğitim sırasında görülmediğinde, model uygun olmayan kazanımlar üretebilir. Sürekli izleme ve sağlam devlet gösterimi bunu hafifletebilir.
- [FONT:0)Yönerge ve Sertifika Hurdles: [Dönetici veya tıbbi cihazlarda, Adaptif algoritmaları sıkı standartları karşılamalıdır (örneğin, DO-178C).Mevcut ML yöntemleri açıklanabilirlik ve doğrulama ile mücadele eder.
Future Yol Tarifi
Makine öğrenimi ve kontrol sistemlerinin kesiştiği hızla gelişmektedir. Gelişen eğilimler [FONTD:0)meta-öğrenme[Döneticileri)[Döneticileri olmayan ilk modele göre, algoritmalar:2 Model tabanlı RL[Döneticileri öğrenmek için) ve her kontrol mühendisinde standart bir araç olmasını bekleyebiliriz.[FONTT:5)
Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç
PID kontrolörleri ubiquitous, ancak uygulama için sürekli adaptasyon gerektirir. Makine öğrenme algoritmaları - bu makalede belirtilen adımları takip ederek, evrimsel ve optimize etmek için sistematik bir yol sunar.PID ayarlandığında, anahtar, net ölçümler tanımlamak için, ilgili verileri toplamak, uygulama için doğru algoritmayı seçin ve güvenlik kısıtlamaları uygulayın.Bu makalede belirtilen adımları takip ederek, daha karmaşık bir dünyada daha karmaşık bir şekilde kontrol sistemleri oluşturabilirsiniz.
Daha fazla okuma için, [[0)PID kontrolörü Wikipedia'da klasik ayar ve RL üzerinde araştırma:2) PID kontrolü için RL üzerinde araştırma[DÜDÜDÜSÜSÜSÜSÜye Olmayanlar İçin Daha Derin Bir Akademik Bakış[Üye Olmayanlar İçin Tıklayınız.