Model-Free Feedback Control Giriş

Modern kontrol mühendisliği, dinamiklerin kötü anlaşılmış, çok doğrusal olmayan veya öngörülemeyen rahatsızlıklara maruz kalmamaktadır. Geleneksel model tabanlı kontrol teknikleri - PID ayar, devlet uzay tasarımı veya optimal bir sistem modeli gerektiren durumlarda - bu modeller, temel kavramları, hızlı bir şekilde değiştirmek, mühendislere alternatif yaklaşımlara ihtiyaç duyar. Model tabanlı kontrol stratejileri, doğrudan bu boşluğu doğrudan öğrenerek veya kontrol eylemleri ölçen verileri kullanarak kontrol etmeyi veya uygun bir sistem modeli gerektirmeden.Bu makale, modellemek için kapsamlı bir araştırma sağlar.

Modelsiz kontrol tek bir algoritma değil, aynı zamanda ortak bir felsefeyi paylaşan bir yöntemdir: Sistemi istenen bir davranışa doğru kullanmak için gerçek zamanlı giriş- ⁇ ölçümlerini kullanın. Bu yöntemler özellikle robotik, otonom araçlar, endüstriyel otomasyon ve biyomedikal sistemler gibi alanlarda değerlidir, doğru modeller ya da elde etmek için pratik veya imkansız.

Model-Free Feedback Control

Onun özünde, modelsiz geri bildirim kontrolü bitkiyi kara kutu olarak görür. Kontrol istenen set noktası ve gerçek çıktı arasındaki hatayı gözlemler, o zaman bu hata ve son tarihe dayanan kontrol sinyalini tamamen ayarlar. Model tabanlı kontrolörler aksine, transfer fonksiyonları hakkında açık bir bilgi yoktur, devlet denklemleri veya parametre değerleri.

Anahtar anlayışı, sistemin yanıtları hakkında gerekli tüm bilgilerin giriş-öğrenme veri akışı içinde yer almasıdır, çünkü bu verileri gerçek zamanlı olarak işlemeye dayalı olarak, modelsiz bir kontrol, eylemlerinin etkisini ve politikasını buna göre değiştirebilir.Bu yaklaşım doğal olarak zaman-varying dinamikleri, doğrusal olmayan rahatsızlıkları ele alır, çünkü sürekli kontrolel değişiklikler taze gözlemlere dayanan güncellemeler.

Modelsiz geri bildirim kontrolü üç büyük kategori vardır: Adaptif kontrol, takviye öğrenme (RL), ve sürüklenme modu kontrolü (SMC) Her biri farklı avantajları ve ticaret devreleri sunar ve seçim uygulama gereksinimlerine, hesaplama kısıtlamalarına ve güvenlik dikkatelerine bağlıdır.

Adaptif Kontrol

Adaptif kontrol teknikleri istenen performansı korumak için online kontrol parametrelerini ayarlar, hatta bitki dinamikleri değişir. Modelsiz adaptive control (MFAC), kontrol cihazı, bir parametrik model gerektirmez, ancak bunun yerine dinamik bir lineerizasyon yaklaşımı kullanır - pnömatik-partiyel türevleri ile - bu şekilde artan kontrol girdileri ve çıktı değişiklikleri arasındaki ilişkiyi tahmin edin. Popüler yöntemler Hou ve Jin tarafından önerilen modeli-yeterleyici bir kontrol çerçevesi içerir.

Bir başka yaygın olarak kullanılan adaptive tekniği, bir sonraki kontrole (ILC), bu, birçok işin tekrarlanan doğasını (örneğin, robotik seçici ayarlı ve yer, wafer tarama) bir sonraki kontrol için kontrol sinyalini geliştirmek için model tabanlı bir kontrole bağlı olarak kabul edilir. ILC, online olarak sabit bir bitki modeline bağlı değildir.

Öğrenme (RL)

Dondurma öğrenimi karmaşık kontrol görevleri için güçlü bir modelsiz strateji olarak ortaya çıktı. RL, bir ajan (kontrolcü) bunu, çevreyle ilgili olarak, sinir ağları kullanarak en iyi şekilde politika öğrenir.

Geri bildirim kontrolünde kullanılan anahtar RL algoritmaları, Deep Q-Networks (DQN) ayrık eylemler için, Deep Deterministic Policy Gradient (DDPG) ve Soft Aktör-Critic (SAC) sürekli eylemler için ve Proximal Policy Optimizasyonu (PPO) için, sabit eğitim için kritik bir avantajdır.

Sürme Mode Control (SMC)

Kaymaklı mod kontrolü, sistemin devlet yörüngesini önceden tanımlanmış bir kayan yüzeyi üzerinde zorlamak için kasıtlı olarak son derece kontrol tekniğidir. Sistem arzulanan dinamikleri gösterir (örneğin, üstteki yakınlaşmalar için telafi edilen bir geçiş dönemidir). SMC, sadece belirsizlerin ve rahatsızlıkların üst sınırlarını zorlamak için özgürdür, kesin yapısından değildir.

Geleneksel SMC ile ana meydan okuma sohbet ediyor - yüksek frekanslı osilasyonlar geçiş terimine yol açan kontrol sinyalinde. Chattering, modelsiz dinamikleri ve hasar eylemcileri kullanarak sohbet etmek, daha yüksek siparişli kayma modları ve süper-twisting algoritmaları gibi, kayma işlemine geçiş işlemine başvurmak için sohbet etmek.

Model-Free Strategies Avantajları

Modelsiz geri bildirim kontrolü, geleneksel model tabanlı yaklaşımlar üzerinde birkaç ilgi sunar:

  • [FONT:0) Hiçbir model gerekli değildir:[Dönetici:[Dönetici:0))) Karşılaştırma ve hata-prone sistem tanımlama süreci. Bu, özellikle bilinmeyen veya kısmen bilinen fizik sistemler için değerlidir, örneğin yumuşak robotik, biyolojik dokular veya karmaşık reaksiyon kinetiği ile kimyasal süreçler.
  • [FONT:0)Robustness to belirsizlikler: Çünkü kontrol sürekli olarak adapte olur veya muhafazakar geçiş kullanır, parametre varyasyonlarını, sensör gürültüyü ve performans bozulmaları olmadan dış rahatsızlıkları idare edebilir.
  • [FONT:0] Lineer olmayan sistemler için lexability: Modelsiz yöntemler lineer olmayan bitkiler için doğal olarak uygun hale getirmez. Bu, histerileri, sürtünmeyi, dourasyonu ve ölü bölgeleri içerir.
  • [FONT=0) Basitleştirilmiş ayar:[Dönetici:[Dönetici:0) Birçok modelsiz kontrolörler daha az kullanıcı tanımlı parametreye sahiptir (örneğin, öğrenme oranları, faktörleri, faktörleri unutmayın) otomatik olarak ayarlanabilir veya ayarlanabilir, uzman müdahale ihtiyacını azaltır.
  • [FONT:0)Transfer öğrenme potansiyeli:[Dönetici:[Dönetici:0) Simülasyonda eğitilmiş bir modelsiz kontrol genellikle minimum modifikasyonla gerçek sisteme aktarılabilir, özellikle de alan rastgeleleştirme kullanılır.

Uygulamayı Değerlendirme

Modelsiz kontrol modelleme adımını ortadan kaldırırken, mühendislerin güvenilir dağıtım için ele alınması gereken yeni zorluklar tanıtmaktadır. Aşağıda kontrol sisteminin bileşeni tarafından organize edilen kritik uygulama gözleriyle düzenlenir.

Data Acquisition and Processing

Gerçek zamanlı veriler, herhangi bir modelsiz kontrolörün yaşam damarıdır. Yüksek frekanslılar, düşük çözünürlükte bir bitki çıkışı olmadan sistem dinamiklerini yakalamak için yeterli olacaktır (örneğin, pozisyon, hız, sıcaklık, baskı) gerekli. Sensörler gürültüyü azaltmak için filtrelenir ve filtrelenmelidir.In adaptive and RL kontrolörleri için, örnekleme oranı, bilgisayar kapasiteleri yakalamak için yeterince hızlı olmalıdır.In practice, a sample rate at least 10 times the highest expected closed-loop access. Data pre processing contains outlier reddedilme, sinyal doğrulama ve muhtemelen kontrol cihazı ile eşleştirmek için yeterlidir.

Stability and Convergence

Ensuring stabilitesi bir model olmadan daha zor. Adaptif kontrolörler, adaptasyon kazanımı çok yüksek veya modelsiz zaman gecikmesi halinde sabitlenebilir. Lyapunov tabanlı yöntemler ve ekleme modu kontrolü, doğal olarak sağlamlığı garanti edebilir, ancak dinamik bir kontrol sınıfları için stabilite sağlayabilir. RL için, stabilite genellikle güvenli keşif teknikleri ile doğrulanır (örneğin, kontrol bariyer işlevleri, Lyapunov tabanlı işlemler) ve agresif kontrol işlemlerine bağlı olarak kontrol işlemleri sağlar.

C ⁇ Constraints

Gerçek zamanlı kontrol döngüleri katı sonları getiriyor -tipik örnekleme süreleri mikrosaniyelerden (güç elektronik) milisaniyelere (robotik kolları) kadar hızlanan veya sabit olmayan bir sistem için çok yavaş olabilir.

Güvenlik ve Güvenilirlik

Modelsiz kontrolörler öğrenme sırasında güvenli RL ajanlar ile ilgili olarak güvenli RL ajanları araştırılabilir. Güvenlik kısıtlamaları, denetim parametrelerini gerçekçi olmayan değerlere sürüklemek için uygulanabilir.Redt sensörleri ve saat boyunca alıcıları öğrenme kontrollerinde standarttır.

Model-Free Control Uygulamaları

Modelsiz geri bildirim kontrolü çeşitli alanlarda başarıyla dağıtıldı. Aşağıdaki alt bölümler temsilci kullanım vakalarını ve uygulanan spesifik teknikleri vurgulamaktadır.

Robotik ve Özerk Araçlar

Robotik manipülatörler bilinmeyen maaş yükleri veya eklem sürtünme yararlarını yörünge izleme doğruluğu korumak için uyarlanabilir bir kontrolden yararlanırlar. Modelsiz RL çevik manevraları gerçekleştirmek için dörtlü (pir, dalışlar) ve bacaklı robotlar, yürüyüş gaitsleri normal bir araziye kadar öğrenmek için çok iyi bir şekilde çalışır.

Endüstriyel Süreç Kontrol Kontrolü

Kimyasal reaktörler, distillasyon sütunları ve kağıt değirmenleri genellikle bir topludan diğerine takip etmeyi, zaman-varyasyon davranışını sergileyerek ürün kalitesini korumak için uygulanabilir bir kontrol uygulanır.Tonyalators, retorik incelemeler için, iteratif öğrenme kontrolü bir sonraki performansa göre takip eder, atık ve enerji tüketimine sahiptir. Çelik endüstri, yuvarlanma işlemine yol açma davranışı için kayma kontrol kullanır.

Yenilenebilir Enerji Sistemleri

Rüzgar türbini kontrol, güneş paneli maksimum güç noktası izleme (MPPT), ve pil yönetimi sistemleri tüm belirsiz, zamansız dinamikler için anlaşma sağlar. Modelsiz MPPT yöntemleri (örneğin, perturb ve gözlem, arter), rüzgar çiftliklerinde daha gelişmiş RL tabanlı MPPT, zayıf ızgaralar için güçlü bir gerilim düzenleme sağlar.

Biyomedikal Cihazlar

Anesthesia teslimatı, insülin pompaları ve kalp atışları, hastalanabilirliklere rağmen güvenilir şekilde çalışmalıdır.F-free adaptive control of anestezi derinliği, klinik çalışmalarda gösterilmiştir, otomatik olarak ilaç infüzyon oranları EEG veya hayati işaretlere dayanarak. Deep RL, kapalı şeker kontrolü için test edilmiştir, sürekli olarak insülin pompalarını kullanarak sürekli olarak kontrol edilir.

Meydanlar ve Sınırlar

Onların sözüne rağmen, modelsiz stratejiler panacea değildir. Anahtar zorluklar şunları içerir:

  • [FONT:0)Sample inactive:[Dönetici:[Dönetici: 0) RL algoritmaları genellikle iyi bir politika öğrenmek için milyonlarca etkileşim gerektirir, bu pahalı veya yavaş sistemler için uygun olabilir (örneğin, kimyasal bitkiler). Offline RL ve sim-to-real transfer bunu hafifletebilir, ancak gerçek bir boşluk sunabilir.
  • [FONT=0)Lack of Explainability:[Dönetici:[Dönetici kontrolleri siyah kutular, beklenmedik davranışları veya güvenlikleri teşhis etmek zorlaşır. Adaptif ve sürüklenme modu kontrolörleri daha şeffaftır, ancak yine de evrim kazanmak için uzman yorumlama gerektirir.
  • [FONT:0)Hızlı dinamiklerlePoor performansı:) Sistem bant genişliği arttıkça, hesaplama ve veri oranları şişenler haline gelir.Çok hızlı sistemler için (örneğin, güç dönüştürücüleri 100 kHz'ye geçiş), modelsiz yöntemler genellikle basit bir adaptif veya kayma modunda döngülerle sınırlıdır.
  • [FONT=0)Initial:[Dönetici:[Döneticileri) Adaptive kontrolörler ilk adaptasyon sırasında büyük aşırı yükleme veya osilasyonlar sergileyebilirler, eğer öğrenme oranı agresifse. Güvenli başlangıçlama (örneğin, muhafazakar bir PID ile başlayın) genellikle gereklidir.

Future Yol Tarifi

Modelsiz geri bildirim kontrolündeki araştırmalar, makine öğrenimi ve bilişim donanımlarındaki gelişmeler tarafından hızlanıyor. Gelişen trendler şunları içerir:

  • [FONT:0]Hybrid model tabanlı/model-free methods:[[Dönetici: 1) Tahmin için basit bir yaklaşık model kullanan ve belirsizlerin tazminatı için modelsiz bir bileşen. örnekler model tabanlı RL ve sinirsel Lyapunov kontrolü içerir.
  • [FONT:0) Güvenli takviye öğrenme:[Dönetici:[Dönetici:0) Net destek öğrenme:[[Dönetici:0)[değiştir | kaynağı değiştir]
  • [FONT:0]Meta-öğrenme hızlı adaptasyon için öğrenme: Eğitim, farklı ortamlarda hızlı bir şekilde yeni dinamiklere hızlı bir şekilde adapte olmak için bir kontrol cihazı sağlar.
  • [FONT:0)Edge AI ve gömülü hız: Mikrokontrolörlere yönelik hafif RL veya adaptif kontrol sistemleri, sayısal ağları ve verimli gerçek zamanlı işletim sistemleri kullanarak.

Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç

Modelsiz geri bildirim kontrol stratejileri, bilinmeyen veya belirsiz dinamiklerle kontrol sistemleri için güçlü bir araçta bulunuyor. Adaptif kontrolden online parametre ayarını öğrenme politika optimizasyonu ve kayma modu kontrolünin sağlam geçişini güçlendirecek şekilde, mühendisler artık model tabanlı yöntemlere çok daha uygun alternatifler sunuyor.Her teknik kendi güçlü ve kısıtlamalara sahip oluyor ve en iyi seçim sistemi daha uzun bir şekilde modellemek için sistemdeki bir pratik gerçekliktir - alan olgunluğumuz, hibrit yaklaşımlar ve gelişmiş güvenlik garantileri.