Matematiksel Modelleme Mühendislikte
Pid Para Optimizasyonu için Modelsiz Dondurucu Öğrenmenin Faydaları
Table of Contents
Öğrenme ve PID Kontrolü: Yeni Bir Paradigm
Proportional-Integral-Derivative (PID) kontrolörleri, endüstriyel kontrol sistemlerinin her şeyde kullanılan, robotik kol pozisyonuna yönelik üç kazanımlar (Kp, Ki, Kd) sabit bir şekilde, yanıt veren davranışlar, klasik bir mühendislik meydan okuması olarak kalır.
Model-Free Dondurucu Öğrenme Nedir?
Dondurucu öğrenme, bir ajanın bir ortamda etkileşime girerek kararların bir sırasını elde etmeyi öğrendiği bir makine öğreniminin bir şubesidir. Ajans eylemleri alır (örneğin PID kazanımlar), sonuçlanan durumu ve bir ödül sinyalini gözlemler ve politikayı zaman içinde en iyi şekilde optimize etmeyi öğrenir. Modelsiz RL, ajan ortamın geçiş dinamikleri veya fonksiyonunun modelini öğrenmeye çalışmaz.
Bu, model tabanlı RL'ye karşı, ilk olarak çevrenin iç modelini inşa eden ve sonra gelecekteki eylemleri planlamak veya simülasyon yapmak için bu modeli kullanır. Model tabanlı yaklaşımlar örnek olarak verimli olabilir, model önyargılı ve başarısız olabilir, DDPG, PPO gibi, onları sürekli kontrol görevleri için olağanüstü bir başarı gösterdi, böylece PID (DQ) politika gradients (REINFORCE) ve aktör-critic mimarileri (A2C, DDPG, PPO), onları doğal PID için ayarlamalar yaptı.
Model-Free Works for Control
Kontrol sistemleri, özellikle PID tarafından yönetilenler, sürekli bir aksiyon alanında yaşarlar: kazanımlar, sınırları olan gerçek sayılar olabilir. Model-free RL algoritmaları Deep Deterministic Policy Gradient (DDPG) veya Proximal Policy Optimizasyonu (PPO) gibi, Gaussian gürültülerini tam olarak ele almak için tasarlanmıştır.
PID Tuning için Model-Free RL'nin Avantajları
Gerçek- AdaptTimeability
Birçok pratik senaryoda, bir bitkinin dinamikleri, aşınma, çevresel değişimler veya farklı yük koşulları nedeniyle zamanla değişir. Bir PID kontrolörü geleneksel uçuş yöntemleri ile altoptimal olur ve hatta sabit hasarlar haline gelebilir. Model-free RL online adaptasyonda başarır: Ajan sistemi ve politikasını iyileştirmeye devam eder. Örneğin, bir RL-tuned PID for a quadcopter can maintain maintain maintain run speed as the blood occur. Model-free RL points.
Sistem Modelinginin Belirlenmesi
Karmaşık bir endüstriyel sürecin doğru matematiksel bir modelini inşa edin - kimyasal bir reaktör, esnek bir robot kolu veya rüzgar türbini - haftalar veya uzman çaba gerektirir. Model asla mükemmel değildir ve daha önce modelsiz RL ile kontrol performansına sahip basitleştirmeleri sağlar, tek ihtiyaç fiziksel sistemi (veya yüksek sadakatli bir hata simülatörü) çalıştırma yeteneğidir ve bir ölçeklendirme sinyalini dramatik bir şekilde azaltır.
Doğru olmayanlar ve Uncertainties
Geleneksel PID ayar genellikle bir işletim noktası etrafında lineerizasyona dayanmaktadır. Sistem çok doğrusal olduğunda - manyetik kullanım, hidrolik eylemciler veya biyomedikal cihazlar - lineer simetrik etkiler, sabit bir bölgenin dışına da ayrılır. Modelsiz RL, birçok etkileşim bölümünden bir politika öğrenmekle, RL ajanı histerileri, sürtünme, ölü bölgeleri ve diğer sert-to-model etkilerle de ilgilidir.
Otomatik, End-to-Bitiş Optimizasyonu
PID ayar çok fazla toparlayıcı bir problemdir: biri hızlı bir şekilde yükselerek, minimum aşırı yükleme, küçük sabit devlet hatası ve rahatsız ediciliği rahatsızlıklara karşı dayanıklıdır. Geleneksel yöntemler, tasarımcıyı bu hedeflere manuel olarak ticarete ihtiyaç duyar. Modelsiz RL, tüm bu hedefleri doğrudan ödüllendirici bir şekilde optimize edebilir.Örneğin, tüm ekranlama işlemine uygun olarak, aynı şekilde dağıtıldığında, aynı şekilde sabitlenmiş veya aynı şekilde çalışan bitkilerin aynı şekilde kullanılması gerekir.
PID Optimizasyonu için Model-Free RL'nin uygulanması
Devlet ve Eylem Uzaylarını Tanımlamak
Devlet temsili, iyi PID kazançlarını belirlemek için gerekli tüm bilgileri yakalamalıdır. Ortak seçimler takip hatasının son birkaç örneği içerir, hata integrali ve hata türü, muhtemelen mevcut PID kazanımlara sahip olmak için gereklidir. Bazı uygulamalarda, devlet basitçe normalleştirilmiş bir hata, integral ve türev (üçüncü bileşendeki PID eylemleri) eylemleri içerir.
Ödül
Ödül fonksiyonu muhtemelen negatif cezaların en kritik yönüdür: 0 ). Kötü tasarlanmış bir ödül, osilasyonlara veya agresif davranışlara veya yakınlaştırmaya yol açabilir.A good practice is to define a decision that is a kilo sumed of negative sentences: d) = 0.0r(t) = - [w1·|e(t)|t)|enjecteratif bir şekilde kontrol edilebilir.
Algorithm Selection
Sürekli aksiyon alanları için, en yaygın kullanılan algoritmaları şunlardır:
- [DDPG) [DFLT:0) Deep Deterministic Policy Gradient (DDPG))[Döneticisel bir politika ve Q-işlevsel bir yöntem.
- [FONT:0)Proximal Policy Optimizasyonu (PPO))[T)[değiştir | kaynağı değiştir], büyük değişikliklerden kaçınmak için politika güncellemesini kısıtlayan bir yöntem. PPO daha geniş bir hiperparametreler arasında daha istikrarlı ve genellikle güvenilir olan gerçek dünya sistemleri için tercih edilir.
- [0]Twin Gecikmiş DDPG (TD3)[D)[DDPG üzerinde bir gelişme, daha iyi performans ve istikrar sunan DDPG üzerinde bir gelişme.
Daha basit, düşük boyutlu durumlar için, temel tabular Q-öğrenme veya SARSA, devlet ve eylem alanlarının diskretize olup olmadığı durumlarda kullanılabilir, ancak sürekli kazanç için nadiren pratiktir.
Simülasyonda Eğitim vs. Real Hardware
Bir RL ajanı doğrudan fiziksel bir sistemde eğitim, gerçek sisteme (gerçekten binlerce) birçok bölüm (potansiyel olarak binlerce) bir araya gelmeleri için bir uygulamadır. Eğitim sırasında ilk trene veya zaman gecikmesine yardımcı olur - MuJoCo, Gazebo veya dijital ikiz gibi bir fizik motoruna veya dijital ikize - ve sonra öğrenilen politikayı küçük öğrenme oranları ve güvenlik görevlileriyle transfer etmeye devam edebilir.
Neural Network Architecture Düşünceleri
PID için ayar, politika ve değer ağları genellikle küçük - her biri 64-256 nöronlarla iki veya üç gizli tabaka. giriş katmanı düşük boyutlu olduğu için (üç-10) ve çıkış katmanının üç nöronları vardır (345Kp, {{Ki, {{Kd). ReLU aktivasyonları gizli katmanlarda yaygındır, bakır veya lineer bir aktivasyon ile yapılır.
Meydanlar ve düşünceler
Örnek Verimlilik ve Convergence Time
Modelsiz RL genellikle on binlerce ila milyonlarca zaman adımını iyi bir politikaya yaklaştırmak için gerektirir.Gerçek zaman ikincisinin bir adıma karşılık verdiği yavaş endüstriyel bir süreç için, eğitim saat veya günler sürebilir.Bu, hızlı bir simülasyon (profesyonel eğitim ortamları daha hızlı çalıştırılabilir veya model tabanlı bir şekilde başlamak için önemli bir engeldir).
Arama sırasında güvenlik
Eğitim sırasında, RL ajanı daha iyi politikalar bulmak için harekete geçme alanı keşfetmeli. PID kazanımlarının rastgele keşfine neden olabilir, sistemi güvenli bölgelere yönlendirmek veya güvenli sınırlar içinde uygulamak önemlidir: eylem klibi, güvenli sınırların üzerinden cezalar, bilinen bir stabil temel politikaya karşı retorik olmalıdır.
Ödül Mühendisliği ve Çok-Objective Trade-offs
İstenen davranışı zamanından önce veren bir ödül işlevi tasarlayın. Ajan, tasarım fonksiyonunu, tasarım aşamasındaki hataların ancak eylemcinin zamanla çeşitli ödül formülasyonlarını test etmek ve eğitim sırasında ek metrikleri izlemek için çok önemlidir.
C ⁇ Kaynakları
Derin RL ajanları önemli bir hesaplama gücü gerektirir (GPU for nasyonal ağ güncelleştirmeleri için). Ancak, PID ayar için devlet ve eylem alanları küçük, hesap talebi mikrosaniyelerde ileri giden bir politikadan çok daha düşük, ancak orta sınıf bir GPU ile modern bir dizüstü bilgisayar, nispeten basit bir bitki için birkaç saat içinde bir PPO ajanı eğitebilir.
Yorumlama ve Geçerlilik
Klasik PID ayar yöntemleri açık matematiksel öngörüler verir: marjlar, faz marjları, kök locus, vs. Bir RL-tuned politika, diğer yandan, politikadan veya RL ajandan alıntılanan bazı araştırmacılar, ancak bu konuya yönelik olarak öğrenilen politikayı analiz edebilir ve yanıtların iyi niyetli olduğunu doğrulayabilirler. Bazı araştırmacılar, ancak RL ajandayı kullanarak, yalnızca RL ajandayı kullanarak, önceden hazırlanmış bir portföy oluşturma konusunda isteksiz olabilirler.
Gerçek Dünya Uygulamaları ve Vaka Çalışmaları
Model tabanlı PID ayar birkaç alanda gösterildi:
- [FONT:0)Robotics:[DÜDÜDÜDÜDÜDÜDÜSTRİYE:0)ZAMAL:[DÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜSÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜ
- [FONT:0)Process Control:[Döneticileri)[Döneticileri ısı, basınç ve sinerjik reaktör için optimize edilmiş, bitkisel informatikte yayınlanan kimyasal bitkilerde akış.]
- [FONT=0)Power Electronics:[Dönetici: [Dönetici:0)Grup Elektronik: [Dönetici:0)Exp Elektronik: [Dönetici: [Döneticiler için LNT PID kontrolörleri ve motor sürücüleri, farklı yük koşullarının düşük performans gösterdiği motor sürücüleri. RL-tuned kontrolörler, daha hızlı geçici kurtarma ve daha iyi verimlilik gösterdi.
- [FONT:0)Automotive:[Dönetici:[Dönetici:[Dönetici:[Dönetici:[Dönetici:[Dönem:)) PID parametrelerini yol koşullarına ve sürüş tarzına göre ayarlamayı öğrenen Adaptif bir seyir kontrol ve süspansiyon sistemleri.
Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç
Modelsiz takviye öğrenme, PID parametre optimizasyonu için zorlu bir yol sağlar, özellikle doğrusal olmayanlık, belirsizlik ve dinamikleri ile karakterize eden sistemlerde.Açık bitki modellerine ihtiyaç duyar ve gerçek zamanlı adaptasyona izin vererek, RL, talep edilen uygulamalarda mühendislik çabasını ve kontrol performansını önemli ölçüde artırabilir. ancak, uygulayıcılar klasik verimlilik, güvenlik, ödül ve hesaplamalı kaynak gereksinimlerine ilişkin zorlukları dikkatli bir şekilde yönetebilirler. Simülasyon araçları olarak, donanım hızlandırma ve sağlam algoritmaları sürekli olarak olgunlaştırmaya devam eder.
Daha fazla okuma için, kontrol için RL üzerinde kapsamlı bir ankete bakınız:0)Busoniu et al. (2018)) ve [[Dönem:2) PID ayar için pratik kılavuzluk) Kontrol ve Otomasyon topluluğundan.