Sürekli Pid Parametre Optimizasyonu için Betonlama Öğrenmesi Kullanımı Dinamik Sistemlerde Optimizasyon
PID kontrolörlerine ve onların Sınırlarına Giriş
Proportional-Integral-Derivative (PID) kontrolörleri, endüstriyel kontrol sistemlerinin çalışmalarından oluşur. Kimyasal reaktörlerde havalimanlarını stabilize etmek için, PID kontrolörleri kapalı olan hemen hemen hemen her sektörde bulunur ve iyi bir performans elde etmek için bu üç parametreyi ayarlar: orantılı (P), integral (I), ve türev (D), her biri kendi kazanç parametresi (Kp, Ki, Kd).
Geleneksel ayar yöntemleri – Ziegler-Nichols, Cohen-Coon veya manuel deneme-ve-terör gibi - sabit dinamiklerle sistemler için kabul edilebilir sonuçlar üretebilir. ancak, birçok gerçek dünya sistemi suboptimal veya hatta istikrarsız hale gelir: 0). Bu sınırlama, özellikle de yükleme yöntemleri nedeniyle zaman içinde değişir, bileşen aşınması, çevresel değişimleri veya doğrusal olmayanlıkları.[TRL)[TFLT)[TFLT)[TID kontrolörleri otomatik olarak sabitlenebilir.
Dondurma Öğrenme, sistemin açık bir modelini gerektiren PID parametrelerinin sürekli, gerçek zamanlı optimizasyonu için bir çerçeve sunar. Bunun yerine, RL ajanı doğrudan etkileşimden öğrenir, kontrol performansı yansıtacak bir ödül sinyalini optimize etmek için kazanımlar sağlar.Bu yaklaşım özellikle manuel retuning'in pratik veya performans talepleri yüksek olduğu konusunda umut vericidir.
Kontrol Context'de Dondurma Öğrenmesini Anlamak
Dondurma Öğrenme, bir ajanın bir ortamda bir ortama etkileşim yoluyla karar vermelerini öğrendiği bir makine öğreniminin bir şubesidir.Her seferinde, ajan mevcut durumu gözlemler (örneğin, hata sinyali, hata türü, sistem çıktı), bir eylemi seçmek için tasarlanmıştır (örneğin, Kp, Ki, Kd veya Kd), ve sonuç hakkında bir ödül alır.
Bir RL tabanlı PID ayar sistemindeki anahtar bileşenler şunlardır:
- [FONT:0)Environment:[Dönetici:[Dönetici: 0,4] Kontrol altında dinamik sistem (örneğin, bir motor, robot kolu veya kimyasal süreç) sensör geri bildirim ve eylemci sınırları ile birlikte.
- [FONT:0)Agent:[Dönetici:[Dönetici:[Dönetici:[Dönetici:[Dönetici: RL algoritması) PID kazançlarını nasıl değiştireceğine karar veren RL algoritması.
- [FONT:0)State representation:[Dönetici:[Dönetici:0) Tipik olarak hata sinyalini (e), integrali ( ⁇ e dt), ve türevleri (de/dt) içerir, ancak tarihi devletler veya sistem çıktılarını da içerebilir.
- [FONT=0]Action alanı:[[Dönemli veya ayrı ayrı ayarlamalar Kp, Ki ve Kd. Daha gelişmiş uygulamalarda, ajan doğrudan kazanımlara çıktı.
- [FONT:0)Öyle işlevi:[[Dönetici:[Dönetici:0) Kontrol kalitesi ölçeklendirmek, genellikle hata izlemek için terimler birleştirin, aşırı yükleme, zaman, kontrol çaba ve kararlılık marjı.
Q-öğrenme gibi klasik RL algoritmaları sürekli eylem alanları için davalıdır. Bu nedenle, PID ayar için modern RL uygulamaları:0)Derin takviye öğrenme) ile ilgili yöntemler, sinir ağları yaklaşık politikalar ve değer işlevleri içerir. Popüler algoritmaları Deep Deterministic Policy Gradient (DDPG), Proximal Policy Optimizasyonu (PPO), ve Soft Aktör-Critic (SAC).
Dondurma Öğrenme PID Parametrelerini Sürekli Olarak Nasıl Geliştirir
Temel fikir, her kontrol aşamasında PID kazançlarını değiştirirken, devletin bitki ve istikrar konusunda ilgili bilgileri topladığı bir Markov Kararı Süreci (MDP) olarak ayarlanır.
Eğitim Prosedürü
Eğitim genellikle fiziksel sistem modelleri olan bir simülasyon ortamında meydana gelir. Ortak bir yaklaşım, her bölüm boyunca yazılım-in-loop (SIL) veya donanım-in-the-loop (HIL) simülasyonları yapılır ve RL ajanı birçok bölüm üzerinden simülasyonla etkileşime girer, her bölüm bir hatayla çalışır.Her bölüm boyunca, ajanlar PID parametrelerini gerçek zamanlı olarak toplar ve simülasyon hesaplamaları sonucu elde edilen sistem yanıtını değiştirir.
PID kontrolörleri şöyledir: 0.Dönsüz)) ( integral terim hafıza sağlar, ancak elde edilen değerler, tutarlılık ve performans sağlamak için, artan hata ve daha yavaş artış süresini gözlemleyebilir.For PID kontrolörleri, Ki-parçayı korumak için güçlendiricileri artırabilir.
Ödül
Ödül fonksiyonunun tasarımı en kritik adımlardan biridir. Kötü tasarlanmış bir ödül, güvenli veya kararsız davranışlara yol açabilir. Ortak ödül formülasyonları şunları içerir:
- [FONT:0)Quadratic maliyeti:[Dönetici:[Dönetici:0)[Dönemli hatanın integralini (ISE) artı kontrol çabasında bir ceza.
- [FONT:0) Çok-objective:[Dönetici:[Dönlendirme için bir araya gelmek, zaman yerleşmek, zaman ve kullanıcı tarafından sürekli olarak belirlenmiş ağırlıklarla sürekli devlet hatası.
- [FONT=0)Stability marjları:[Dönetici:[Dönetici:0) Kabul edilebilir kazanç ve faz marjlarını korumak için bir bonus hazırlamak, genellikle basitleştirilmiş bir modelden türek.
RL ajanı deneme ve terörle ilgili öğrenir, ödül fonksiyonu erken keşif sırasında da davranış şekline sahip olmalıdır (bir temel PID'den) eğitim sırasında felaket hataların riskini hızlandırabilir ve azaltılabilir.
Dondurma Öğrenme Algoritmaları PID Tuning için Uygun
Doğru RL algoritması verimliliğini, örnek karmaşıklığı ve son kontrol performansını etkiler. Aşağıda bu alanda en yaygın kullanılan algoritmaları vardır:
Deep Deterministic Policy Gradient (DDPG)
DDPG, sürekli aksiyon alanları için tasarlanmış bir dışsal algoritmadır. Bu durumda, PID'in düzeltmeleri ve Q-değer (ekizleyici bir şekilde ödül alır). DDPG örnek olarak verimlidir çünkü tekrar tekrar oynatıcı deneyimlere kaydedilir. Ancak, bu durumda, PID'nin hiperparametrelere ve en yüksek önyargılara karşı hassas olabilir.
Orijinal kağıtta DDPG hakkında daha fazla bilgi edinin:0) "Çeviri ve Elle Dondurma Öğrenme ile Zor Kontrol" (İngilizce).
Proximal Policy Optimizasyon (PPO)
PPO, uygulama basitliği ve performansı arasında bir dengeyi vuran bir on-politik algoritmadır. Politika güncelleştirmelerini sınırlamak için bir klip kullanır, yıkıcı büyük politika değişikliklerini önlemek için daha düşük örnek verimliliği sağlar. PPO birçok kontrol görevinde istikrarlı ve güvenilir olmak için bilinir.For PID ayar, PPO, agresif kazanç dalgalanmalarından kaçınmak için önemli olan pürüzsüz politikalar öğrenebilir, ki bu da eylemcinin yıpranması ve güvenliği için önemli.
Derin bir açıklama için, OpenAI kağıdı bakınız: “Ücret Politikası Optimizasyon Algoritmaları” ).
Yumuşak Aktör-Critic (SAC)
SAC, yalnızca beklenen geri dönüş değil aynı zamanda politikanın entropisi, araştırma teşvik edici ve sürekli kontrol kriterleri üzerinde sürekli performans elde ediyor.PID ayar bağlamında, SAC otomatik olarak denge ve sömürüyüp, sağlam ve uyarlayıcı kontrolörlere yol açabilir.
Orijinal SAC kağıdını okuyun: “Soft Aktör-Critic: Off-Policy maximum Entropy Deep Donment Learning with a Stochastic Aktör” by Haarnoja et al.
Diğer Notable Approaches
Araştırmacılar ayrıca, PID parametreleri üzerinde ayrı eylemlere de başvurdular ve [TRPO) [DFLT:2) DDPG, PPO ve SAC, en pratik seçimlerle ilgili olarak en pratik seçenekler olarak kalır.
Simülasyon Ortamları ve RL-Based PID Tuning için Araçlar
PID ayar için RL ajanlarını geliştirmek ve test etmek esnek bir simülasyon ortamı gerektirir. Birkaç çerçeve ortaya çıktı:
- [FONT=0)OpenAI Gym / Gymnasium:) Standart arayüz RL ortamları için standart arayüzler inşa edilebilir.Özel ortamlar, [[FONTD:2|net[DÜDÜDÜDÜye) veya [[Python) veya [[DÜye ait (Pymulink) ).
- [FONT:0)MuJoCo: [Dönetici: 1) Bir fizik simülatörü robotik için yaygın olarak kullanılan bir fizik simülatörü. karmaşık dinamik sistemler (örneğin, robot kolları, insanoidler) PID kontrolörleri yaygındır.
- [FONT=0]Gazebo + ROS: [Dönetici: [Dönetici: 1) Daha gerçekçi robot simülasyonları sensör gürültü ve eylemci sınırları ile simülasyonlar için. Robot İşletim Sistemi (ROS) gerçek veya simdi donanımla arayüz RL ajanlarına standart bir yol sağlar.
- [FONT:0]Dymola / DÖRÇÜ: [Dymola / DÖRÜŞÜN: [Dymola / DÖRÜŞÜN: [DÜDÜSTRİYE] Büyük ölçekli endüstriyel sistemler (örneğin, PID kontrolörleri, HVAC) PID kontrolörleri bol bol miktarda. Bu araçlar işlevsel Mock-up Interface (FMI) ile bağlantılı olabilir.
DDPG'nin hazır kullanımı için kullanılan yüksek çözünürlükte bulunan ve diğerlerinden dolayı, mühendislere çevre tasarımı ve şekillendirme olanağı sağlar.
Vaka Çalışmaları ve Gerçek Dünya Uygulamaları
Gerçek dünya dağıtımına simülasyondan geçiş hızlanır. Aşağıda RL tabanlı PID optimizasyonunun ölçülebilir avantajları gösterdiği örneklerdir:
Quadrotor Attitude Control
Quadrotors oldukça dinamik sistemler, rüzgar gusts'e tabi, para yükü değişiklikleri ve batarya gerilimi dalgalanmaları. Sabit giriş PID kontrolörleri genellikle farklı uçuş modları için yeniden hazırlıklara ihtiyaç duyuyor (hover, agresif manevralar) araştırmacılar Stanford Üniversitesi ve ETH Zürih, bir RL ajanının PPO'yu kullanarak sürekli olarak PID kazançlarını sürekli olarak uyarabileceğini gösterdiler.
Robotik Manipulator Değişken Payload ile
Santral hatlarında endüstriyel robotik kolları genellikle farklı kütle nesneleri ele alır. statik bir PID kontrolörü, kol boş olduğunda ve 10x ödeme aralığında% 5 oranında kesintiye uğramaya yol açar.
Power System Frekans Kontrolü
Elektrik şebekelerinde, otomatik nesil kontrol (AGC), mikrogridlerdeki birden fazla PID'in kazanımlarını optimize etmek için PID benzeri kontrolörleri kullanır, yakıt tüketiminin %40'ını azaltır.
RL-Based PID Optimizasyonunda Meydanlar ve Davalar
Sürekli PID ayar için RL'nin pratik dağıtımı birkaç engelle karşı karşıya:
Örnek Verimliliği Örnek
Birçok RL algoritmaları, pahalı fiziksel donanım için uygun olmayan milyonlarca zaman adımını gerektirir.ASIFLT:0)Çözümler:[Döneticileri:[Döneticileri) Yüksek sadakat simülasyonlarını kullanın, transfer öğrenme (m-gerçekten) veya önceki bilgi (örneğin, Ziegler-Nichols) öğrenme sürecine ilk kazanımlar.
Öğrenme sırasında Stability during Learning
Araştırma sırasında, bir RL ajanı, osilasyonlara veya hatta sistem zararlarına neden olan kazanımlara izin verebilir.ETHFLT:0) Solutions:) Uygulamalı güvenlik katmanları, Lyapunov tabanlı güvenlik eleştirmenleri için değişiklikler elde edebilir veya kısıtlanmış RL çerçevelerini kullanabilir.
Ödül
Kötü bir şekilde şekillendirilmiş bir ödül, ödülü yerel olarak tatmin eden davranışlara yol açabilir, ancak küresel olarak istenmeyen (örneğin, ISE'yi en aza indiren yüksek frekanslı osilasyonlar).[/FLT:1).
Genelleştirme ve Adaptasyon
Belirli bir sistem üzerinde eğitilmiş RL politikası, farklı dinamiklerle diğer sistemlere genelleştirmeyebilir.ETHFLT:0)Çözümler:) Sistem parametrelerinin dağılımına (bölge rastgeleleşmesi) veya meta-öğrenme, böylece ajan hızla yeni ortamlara adapte olabilir.
Diğer Adaptive Control Yöntemleri ile Karşılaştırma
RL, uyarlanabilir bir PID ayar için tek paradigma değildir. RL'nin nerede parladığı ve hangi alternatiflerin yeterli olabileceğini anlamak yardımcı olur:
- [FONT:0) Model Referansı Adaptive Control (MRAC):) Referans modeli gerektirir ve bilinen bir yapı ile sistemler için etkilidir, ancak belirsiz parametreler. RL sistem modeli karmaşık veya bilinmeyen olduğunda daha esnektir.
- [FONT=0)Fuzzy Mantık Tuning:[Dönersiz kurallar, doğrusal olmayan sistemler için iyi, ancak genellikle kuralı otomatik olarak tasarlamak için uzman bilgi gerektirir. RL kuralları otomatik olarak öğrenir.
- [FONT:0)Kendi-Tuning Düzenlemeleri (STR):[Dönetici: 0,3) Kontrol tasarımı ile birlikte yapılan Online parametre tahminleri, ancak tipik zaman değişken dinamikleri varsayılır. RL daha doğal olarak değişmez.
RL'nin ana avantajı, açık modelleme olmadan, karmaşık, multi-objective hedefleri olan sistemler için ideal hale getirmek için keyfi performans ölçümleri optimize etme yeteneğidir.
Future Yol ve Araştırma Trendleri
Alan hızla ilerliyor. Birçok umut verici yol araştırılıyor:
Model tabanlı Donma Öğrenme
Pure model-free RL örnek olarak tasarlanmıştır. Model tabanlı RL, bitki dinamikleri modelini öğrenir ve birçok potansiyel geleceği simüle etmek için kullanır, büyük ölçüde örnek verimliliğini geliştirir. PID ayarında, öğrenilen bir model, acentenin önümüzdeki planı planlamasına izin verebilir.
Dağıtılmış ve Çok Amaçlı PID Tuning
Modern sistemler genellikle PID kontrolörlerini (örneğin, koordineli robot kolları veya güç ızgaraları) çok-agent RL (MARL) algoritmaları tüm parametreleri aynı anda ayarlar, darbe etkileri için muhasebe. Erken çalışma, merkezileştirilmiş eğitimin bağımsız RL ajanlara üstün olabileceğini gösteriyor.
RL ile güvenlik-Critical Control
Endüstriyel uygulamalar için, güvenlik kısıtlamaları önemlidir. Araştırmacılar, eylemci sınırları veya gerilim sınırları gibi zor kısıtlamalar ihlal etmediğinden emin olarak Lyapunov yöntemlerine RL çerçevelerine entegre edilir.Bu yöntemler, uyarlanabilir kazanımlar asla zor kısıtlamaları ihlal etmediğinden emin olur.
Edge Cihazlarında İşsizlik
Mikrodenetleyiciler veya FPGA'lar üzerinde eğitimli bir RL politikası ortaya çıkan bir meydan okumadır. Hafif sinir ağ mimarisi (örneğin, küçükML) ve ölçümlenen politikalar, gerçek zamanlı olarak düşük hesaplama maliyetine olanak sağlar.
Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç
Dondurucu Öğrenme, DDPG, PPO ve SAC gibi sürekli optimizasyon için güçlü bir çerçeve sağlar.Viaksiyon ve statik kazanımlar elde etmek, deneyimden öğrenilen, kontrol sistemleri, değişen koşullar karşısında zirve performansı koruyabilir ve DDPG, PPO ve SAC gibi doğrusal olmayan algoritmaların yanı sıra, yüksek sadakatli bir tasarımla birlikte, simülasyon ve gerçek dünya uygulamaları ile birlikte göstermiştir.
Ancak, zorluklar kalır: örnek verimsiz, istikrar garantileri ve ödül tasarımı dikkatli bir dikkat gerektirir. Model tabanlı RL tabanlı yöntemlerde devam eden araştırmalar, güvenlik kısıtlayıcı yöntemleri ve kenar dağıtım RL tabanlı PID optimizasyonu daha erişilebilir ve güvenilir hale getirme vaatleri.PID ayar akışına sahip mühendisler için, RL'yi modernize etmek isteyen mühendisler için, daha akıllı, daha dayanıklı otomasyona yönelik pratik bir adımdır.
Daha fazla okuma için, bu temel kaynakları düşünün: 0:0)OpenAI Spinning Up in Deep RL) ve )Reinforcement Learning: An Introduction" by Sutton and Barto).