Sürekli Pid Parametre Optimizasyonu için Betonlama Öğrenmesi Kullanımı Dinamik Sistemlerde Optimizasyon

PID kontrolörlerine ve onların Sınırlarına Giriş

Proportional-Integral-Derivative (PID) kontrolörleri, endüstriyel kontrol sistemlerinin çalışmalarından oluşur. Kimyasal reaktörlerde havalimanlarını stabilize etmek için, PID kontrolörleri kapalı olan hemen hemen hemen her sektörde bulunur ve iyi bir performans elde etmek için bu üç parametreyi ayarlar: orantılı (P), integral (I), ve türev (D), her biri kendi kazanç parametresi (Kp, Ki, Kd).

Geleneksel ayar yöntemleri – Ziegler-Nichols, Cohen-Coon veya manuel deneme-ve-terör gibi - sabit dinamiklerle sistemler için kabul edilebilir sonuçlar üretebilir. ancak, birçok gerçek dünya sistemi suboptimal veya hatta istikrarsız hale gelir: 0). Bu sınırlama, özellikle de yükleme yöntemleri nedeniyle zaman içinde değişir, bileşen aşınması, çevresel değişimleri veya doğrusal olmayanlıkları.[TRL)[TFLT)[TFLT)[TID kontrolörleri otomatik olarak sabitlenebilir.

Dondurma Öğrenme, sistemin açık bir modelini gerektiren PID parametrelerinin sürekli, gerçek zamanlı optimizasyonu için bir çerçeve sunar. Bunun yerine, RL ajanı doğrudan etkileşimden öğrenir, kontrol performansı yansıtacak bir ödül sinyalini optimize etmek için kazanımlar sağlar.Bu yaklaşım özellikle manuel retuning'in pratik veya performans talepleri yüksek olduğu konusunda umut vericidir.

Kontrol Context'de Dondurma Öğrenmesini Anlamak

Dondurma Öğrenme, bir ajanın bir ortamda bir ortama etkileşim yoluyla karar vermelerini öğrendiği bir makine öğreniminin bir şubesidir.Her seferinde, ajan mevcut durumu gözlemler (örneğin, hata sinyali, hata türü, sistem çıktı), bir eylemi seçmek için tasarlanmıştır (örneğin, Kp, Ki, Kd veya Kd), ve sonuç hakkında bir ödül alır.

Bir RL tabanlı PID ayar sistemindeki anahtar bileşenler şunlardır:

Q-öğrenme gibi klasik RL algoritmaları sürekli eylem alanları için davalıdır. Bu nedenle, PID ayar için modern RL uygulamaları:0)Derin takviye öğrenme) ile ilgili yöntemler, sinir ağları yaklaşık politikalar ve değer işlevleri içerir. Popüler algoritmaları Deep Deterministic Policy Gradient (DDPG), Proximal Policy Optimizasyonu (PPO), ve Soft Aktör-Critic (SAC).

Dondurma Öğrenme PID Parametrelerini Sürekli Olarak Nasıl Geliştirir

Temel fikir, her kontrol aşamasında PID kazançlarını değiştirirken, devletin bitki ve istikrar konusunda ilgili bilgileri topladığı bir Markov Kararı Süreci (MDP) olarak ayarlanır.

Eğitim Prosedürü

Eğitim genellikle fiziksel sistem modelleri olan bir simülasyon ortamında meydana gelir. Ortak bir yaklaşım, her bölüm boyunca yazılım-in-loop (SIL) veya donanım-in-the-loop (HIL) simülasyonları yapılır ve RL ajanı birçok bölüm üzerinden simülasyonla etkileşime girer, her bölüm bir hatayla çalışır.Her bölüm boyunca, ajanlar PID parametrelerini gerçek zamanlı olarak toplar ve simülasyon hesaplamaları sonucu elde edilen sistem yanıtını değiştirir.

PID kontrolörleri şöyledir: 0.Dönsüz)) ( integral terim hafıza sağlar, ancak elde edilen değerler, tutarlılık ve performans sağlamak için, artan hata ve daha yavaş artış süresini gözlemleyebilir.For PID kontrolörleri, Ki-parçayı korumak için güçlendiricileri artırabilir.

Ödül

Ödül fonksiyonunun tasarımı en kritik adımlardan biridir. Kötü tasarlanmış bir ödül, güvenli veya kararsız davranışlara yol açabilir. Ortak ödül formülasyonları şunları içerir:

RL ajanı deneme ve terörle ilgili öğrenir, ödül fonksiyonu erken keşif sırasında da davranış şekline sahip olmalıdır (bir temel PID'den) eğitim sırasında felaket hataların riskini hızlandırabilir ve azaltılabilir.

Dondurma Öğrenme Algoritmaları PID Tuning için Uygun

Doğru RL algoritması verimliliğini, örnek karmaşıklığı ve son kontrol performansını etkiler. Aşağıda bu alanda en yaygın kullanılan algoritmaları vardır:

Deep Deterministic Policy Gradient (DDPG)

DDPG, sürekli aksiyon alanları için tasarlanmış bir dışsal algoritmadır. Bu durumda, PID'in düzeltmeleri ve Q-değer (ekizleyici bir şekilde ödül alır). DDPG örnek olarak verimlidir çünkü tekrar tekrar oynatıcı deneyimlere kaydedilir. Ancak, bu durumda, PID'nin hiperparametrelere ve en yüksek önyargılara karşı hassas olabilir.

Orijinal kağıtta DDPG hakkında daha fazla bilgi edinin:0) "Çeviri ve Elle Dondurma Öğrenme ile Zor Kontrol" (İngilizce).

Proximal Policy Optimizasyon (PPO)

PPO, uygulama basitliği ve performansı arasında bir dengeyi vuran bir on-politik algoritmadır. Politika güncelleştirmelerini sınırlamak için bir klip kullanır, yıkıcı büyük politika değişikliklerini önlemek için daha düşük örnek verimliliği sağlar. PPO birçok kontrol görevinde istikrarlı ve güvenilir olmak için bilinir.For PID ayar, PPO, agresif kazanç dalgalanmalarından kaçınmak için önemli olan pürüzsüz politikalar öğrenebilir, ki bu da eylemcinin yıpranması ve güvenliği için önemli.

Derin bir açıklama için, OpenAI kağıdı bakınız: “Ücret Politikası Optimizasyon Algoritmaları” ).

Yumuşak Aktör-Critic (SAC)

SAC, yalnızca beklenen geri dönüş değil aynı zamanda politikanın entropisi, araştırma teşvik edici ve sürekli kontrol kriterleri üzerinde sürekli performans elde ediyor.PID ayar bağlamında, SAC otomatik olarak denge ve sömürüyüp, sağlam ve uyarlayıcı kontrolörlere yol açabilir.

Orijinal SAC kağıdını okuyun: “Soft Aktör-Critic: Off-Policy maximum Entropy Deep Donment Learning with a Stochastic Aktör” by Haarnoja et al.

Diğer Notable Approaches

Araştırmacılar ayrıca, PID parametreleri üzerinde ayrı eylemlere de başvurdular ve [TRPO) [DFLT:2) DDPG, PPO ve SAC, en pratik seçimlerle ilgili olarak en pratik seçenekler olarak kalır.

Simülasyon Ortamları ve RL-Based PID Tuning için Araçlar

PID ayar için RL ajanlarını geliştirmek ve test etmek esnek bir simülasyon ortamı gerektirir. Birkaç çerçeve ortaya çıktı:

DDPG'nin hazır kullanımı için kullanılan yüksek çözünürlükte bulunan ve diğerlerinden dolayı, mühendislere çevre tasarımı ve şekillendirme olanağı sağlar.

Vaka Çalışmaları ve Gerçek Dünya Uygulamaları

Gerçek dünya dağıtımına simülasyondan geçiş hızlanır. Aşağıda RL tabanlı PID optimizasyonunun ölçülebilir avantajları gösterdiği örneklerdir:

Quadrotor Attitude Control

Quadrotors oldukça dinamik sistemler, rüzgar gusts'e tabi, para yükü değişiklikleri ve batarya gerilimi dalgalanmaları. Sabit giriş PID kontrolörleri genellikle farklı uçuş modları için yeniden hazırlıklara ihtiyaç duyuyor (hover, agresif manevralar) araştırmacılar Stanford Üniversitesi ve ETH Zürih, bir RL ajanının PPO'yu kullanarak sürekli olarak PID kazançlarını sürekli olarak uyarabileceğini gösterdiler.

Robotik Manipulator Değişken Payload ile

Santral hatlarında endüstriyel robotik kolları genellikle farklı kütle nesneleri ele alır. statik bir PID kontrolörü, kol boş olduğunda ve 10x ödeme aralığında% 5 oranında kesintiye uğramaya yol açar.

Power System Frekans Kontrolü

Elektrik şebekelerinde, otomatik nesil kontrol (AGC), mikrogridlerdeki birden fazla PID'in kazanımlarını optimize etmek için PID benzeri kontrolörleri kullanır, yakıt tüketiminin %40'ını azaltır.

RL-Based PID Optimizasyonunda Meydanlar ve Davalar

Sürekli PID ayar için RL'nin pratik dağıtımı birkaç engelle karşı karşıya:

Örnek Verimliliği Örnek

Birçok RL algoritmaları, pahalı fiziksel donanım için uygun olmayan milyonlarca zaman adımını gerektirir.ASIFLT:0)Çözümler:[Döneticileri:[Döneticileri) Yüksek sadakat simülasyonlarını kullanın, transfer öğrenme (m-gerçekten) veya önceki bilgi (örneğin, Ziegler-Nichols) öğrenme sürecine ilk kazanımlar.

Öğrenme sırasında Stability during Learning

Araştırma sırasında, bir RL ajanı, osilasyonlara veya hatta sistem zararlarına neden olan kazanımlara izin verebilir.ETHFLT:0) Solutions:) Uygulamalı güvenlik katmanları, Lyapunov tabanlı güvenlik eleştirmenleri için değişiklikler elde edebilir veya kısıtlanmış RL çerçevelerini kullanabilir.

Ödül

Kötü bir şekilde şekillendirilmiş bir ödül, ödülü yerel olarak tatmin eden davranışlara yol açabilir, ancak küresel olarak istenmeyen (örneğin, ISE'yi en aza indiren yüksek frekanslı osilasyonlar).[/FLT:1).

Genelleştirme ve Adaptasyon

Belirli bir sistem üzerinde eğitilmiş RL politikası, farklı dinamiklerle diğer sistemlere genelleştirmeyebilir.ETHFLT:0)Çözümler:) Sistem parametrelerinin dağılımına (bölge rastgeleleşmesi) veya meta-öğrenme, böylece ajan hızla yeni ortamlara adapte olabilir.

Diğer Adaptive Control Yöntemleri ile Karşılaştırma

RL, uyarlanabilir bir PID ayar için tek paradigma değildir. RL'nin nerede parladığı ve hangi alternatiflerin yeterli olabileceğini anlamak yardımcı olur:

RL'nin ana avantajı, açık modelleme olmadan, karmaşık, multi-objective hedefleri olan sistemler için ideal hale getirmek için keyfi performans ölçümleri optimize etme yeteneğidir.

Future Yol ve Araştırma Trendleri

Alan hızla ilerliyor. Birçok umut verici yol araştırılıyor:

Model tabanlı Donma Öğrenme

Pure model-free RL örnek olarak tasarlanmıştır. Model tabanlı RL, bitki dinamikleri modelini öğrenir ve birçok potansiyel geleceği simüle etmek için kullanır, büyük ölçüde örnek verimliliğini geliştirir. PID ayarında, öğrenilen bir model, acentenin önümüzdeki planı planlamasına izin verebilir.

Dağıtılmış ve Çok Amaçlı PID Tuning

Modern sistemler genellikle PID kontrolörlerini (örneğin, koordineli robot kolları veya güç ızgaraları) çok-agent RL (MARL) algoritmaları tüm parametreleri aynı anda ayarlar, darbe etkileri için muhasebe. Erken çalışma, merkezileştirilmiş eğitimin bağımsız RL ajanlara üstün olabileceğini gösteriyor.

RL ile güvenlik-Critical Control

Endüstriyel uygulamalar için, güvenlik kısıtlamaları önemlidir. Araştırmacılar, eylemci sınırları veya gerilim sınırları gibi zor kısıtlamalar ihlal etmediğinden emin olarak Lyapunov yöntemlerine RL çerçevelerine entegre edilir.Bu yöntemler, uyarlanabilir kazanımlar asla zor kısıtlamaları ihlal etmediğinden emin olur.

Edge Cihazlarında İşsizlik

Mikrodenetleyiciler veya FPGA'lar üzerinde eğitimli bir RL politikası ortaya çıkan bir meydan okumadır. Hafif sinir ağ mimarisi (örneğin, küçükML) ve ölçümlenen politikalar, gerçek zamanlı olarak düşük hesaplama maliyetine olanak sağlar.

Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç

Dondurucu Öğrenme, DDPG, PPO ve SAC gibi sürekli optimizasyon için güçlü bir çerçeve sağlar.Viaksiyon ve statik kazanımlar elde etmek, deneyimden öğrenilen, kontrol sistemleri, değişen koşullar karşısında zirve performansı koruyabilir ve DDPG, PPO ve SAC gibi doğrusal olmayan algoritmaların yanı sıra, yüksek sadakatli bir tasarımla birlikte, simülasyon ve gerçek dünya uygulamaları ile birlikte göstermiştir.

Ancak, zorluklar kalır: örnek verimsiz, istikrar garantileri ve ödül tasarımı dikkatli bir dikkat gerektirir. Model tabanlı RL tabanlı yöntemlerde devam eden araştırmalar, güvenlik kısıtlayıcı yöntemleri ve kenar dağıtım RL tabanlı PID optimizasyonu daha erişilebilir ve güvenilir hale getirme vaatleri.PID ayar akışına sahip mühendisler için, RL'yi modernize etmek isteyen mühendisler için, daha akıllı, daha dayanıklı otomasyona yönelik pratik bir adımdır.

Daha fazla okuma için, bu temel kaynakları düşünün: 0:0)OpenAI Spinning Up in Deep RL) ve )Reinforcement Learning: An Introduction" by Sutton and Barto).