Giriş: Derin Öğrenmenin ve Optimal Kontrolünün Convergence

Optimal kontrol teorisi uzun zamandır modern mühendislik temelleri olmuştur, dinamik sistemler için matematiksel çerçeveler sağlamak için, istenen davranışlara karşı, minizor maliyet veya en yüksek performansa sahipken, uzay dışı denetimlere uygun olarak, gerçek zamanlı kısıtlamalara tabi olmak. Ancak, son yıllarda, derin öğrenme sadece en iyi kontrol için alternatif bir hesaplama için değil, özellikle de bilgisayar destekli işlemleri en iyi şekilde azaltıcı durumlarda, en iyi şekilde kısıtlayıcılar için gerekli olan pratik çözümlerden kaçınarak, özellikle de pratik olmayan bir şekilde daha karmaşık hale gelmektedir.

Bu makale, en derin öğrenme tekniklerinin optimal kontrolü nasıl yeniden şekillendirdiğini, temel ilkeleri, anahtar avantajları, gerçek dünya uygulamaları ve kalan zorluklarla ilgili olarak incelenir. Hedef, mühendisler için kapsamlı, yazarlı bir genel bakış sağlamak, araştırmacılar ve uygulayıcılar kontrol problemlerini daha verimli bir şekilde çözmek için zorlayıcı ağlarla ilgileniyorlar.

Optimal Kontrolünü Anlamak: Kısa Bir Primer

Bir kontrol kanunu bulmakla ilgili olarak, zaman ufkuna bir performans kriteri, sistem dinamiklerine ve kısıtlamalarına tabi olan bir kontrol kanunu bulmakla ilgili olarak, problem şöyle ifade edilebilir:

[0] Kontrol girişi u(t) bu, J = {{(x(t f) + ⁇ L (x(t), u(t) dt = f(x(t)) , u(t) , t)

Burada, x (t) devlet vektörü, u(t) kontrol girişi ve J bu problemin tipik olarak sistemi zamanında ileri sürmek ve geri çözmeyi içeren sayısal yöntemler gerektirir - yüksek boyutlu sistemler için, boyutsallıkların laneti dinamik programlamayı engelleyici hale getirir.

Doğrudan kollokasyon veya birden fazla atış gibi geleneksel yaklaşımlar, hala önemli hesaplama kaynakları talep edebilir, kararların milisaniyelerde yapılması gerektiği, bağımsız sürüş veya robotik manipülasyon gibi uygulamalarda kullanılmasını sınırlandırır.

Kontroldeki Hız Maddeleri Neden Kontrol Ediyor

Birçok gerçek zamanlı sistemlerde, devlet ölçüm ve kontrol eylemi arasındaki boşluk, genellikle basitleştirilmiş modeller olmalıdır - her ikiyüzlülük veya uyum sağlamak için bu ticarette, en iyi şekilde kontrol problemini her seferinde çözerek, en az geç olmadan online olarak yürütmek için bir yol sunar.

Bir Nutshell'de Derin Öğrenme

Derin öğrenme, yapay sinir ağları birçok katmanla (hence "deep") karmaşık, doğrusal olmayan ilişkiler modellemek için kullanılan bir makine öğreniminin alt kümesidir. Yeterli veri ve hesaplama kaynaklarına göre, derin bir sinir ağı, her zaman sürekli bir işlevin keyfine kadar - evrensel bir yaklaşım olarak bilinen bir özelliktir.

Böyle bir ağ genellikle denetimli öğrenme ( geleneksel çözücülerden üretilen verileri kullanarak) veya güçlendirme öğrenme (sistemin simülasyonuyla etkileşim kurarak ağ öğrenilir). Her iki yaklaşım da başarılı bir şekilde kullanılmıştır, her biri kendi güçlü ve ticari-offs ile.

Politika Approximation için Süperviz Edildi

Denetimli öğrenmede, bir çok açık-loop optimal kontrol problemlerini çevrimdışı bir şekilde çözerek, bir kez eğitilmiş olan en iyi kontrol cihazını en iyi şekilde sınıflandırmak için eğitilmiştir.Bir kez eğitilmiş, ağ neredeyse anında yeni devletler için çok sayıda açık-optimal kontrol işlemine uygun şekilde üretebilir.Bu yöntem özellikle dinamiklerin bildiği ve maliyet yapısını en iyi şekilde tanımlandığında etkilidir.

Doğrudan Politika Araması için Öğrenmek

Dondurma öğrenme (RL), ajanın devlet alanını keşfetmesi ve deneme ve hata yoluyla öğrenerek ön talep edilen verilere ihtiyaç duyar. Algoritmalar Deep Q-Networks (DQN), Proximal Policy Optimizasyon (PPO), ve Soft Aktör-Critic (SAC) özellikle de kontrol görevlerini yerine getirerek, Atari oyunlarını karmaşık robotik manipülasyona yönlendirmek için dikkat çekici bir başarı göstermiştir.

Nasıl Derin Öğrenmeyi Hızlandırır Optimal Kontrol Dengeleri

Ana ivme mekanizması ise şöyledir:0) Kontrollü bir yaklaşım[Dönetici: 1) Geleneksel çözücüler her seferinde doğrulayıcı optimizasyon gerektirir - Jacobians, bu tür operasyonları ikinci olarak gerçekleştirebilir veya bir şekilde entegre eden bir sinir ağı, aksine, sadece bir dizi matris multiplikasyonu ve doğrusal olmayan aktivasyon gerektirir. Modern donanım (GPUs, BTCs) ikinci olarak milyarlarca işlemi yapabilir, yani trenin mikrosaniyede kontrol işlemleri yapması için saatlere kadar bir ağ uygular.

Çiğ hızının ötesinde, derin öğrenme de aynı zamanda GÜNDÜ:0) Adaptif ve tahmin edilebilir kontrol[Döneticileri değiştir], koşullar değiştiğinde, bir ağ görünmez devletlere genelleştirebilir, eğitim alanı yeterince geniş sağlar. Bu genelleştirme kapasitesi, sistemleri değişen dinamiklerle ilgili özellikle çekici bir öğrenme yeteneğidir, örneğin bilinmeyen bir ödeme yükü taşıyan bir robot gibi, silinebilir nesnelerle etkileşime girebilir.

Offline vs. Online Computation

Bir önemli ayrım, hesaplama çabanın nerede olduğunu. Geleneksel optimal kontrol, online hesaplama kaynaklarının sınırlı olduğu ağır kullanım uygulamaları için idealdir. Deep learning changings most of the computation çevrimdışı: eğitim ağına göre hesaplamak yoğun, ancak inference ucuz.Bu ticaret-off, online hesaplama kaynaklarının sınırlı olduğu gerçek zamanlı uygulamalar için idealdir, ancak çevrimdışı eğitim güçlü kümelerde yapılabilir.

Ayrıca, bir kez eğitilmiş olarak, aynı ağ, mütevazı hafıza ve işlemci yetenekleri ile gömülü sistemler üzerinde konuşlandırılabilir. Örneğin, bir kuotorun uçuş kontrol cihazı, minimum güç tüketimi ile mikrokontrolör üzerinde çalıştırılabilir, ancak tam en iyi politikayla ilgili eylemleri üretebilir.

Deep Learning'in temel avantajları - Temel Optimal Kontrol

  • [FONT:0) Gerçek zamanlı performans: [Dönemlisan aralığındaki İnference gecikme süresi, kilohertz alanında kontrol döngülerini sağlar.
  • [FONT=0)Yüksek boyutlardaki farklar: [Dönetici ağları yüksek boyutlu devlet uzaylarını (örneğin, kameralardan gelen görüntüler, LiDAR noktası bulutları) aşırı derecede geleneksel devre dışı bırakacaktır.
  • [FONT:0]Adaptability and transfer learning:) Networks, sıfırdan yeniden eğitim almadan yeni görevler veya ortamlar için iyi niyetli olabilir, gelişim süresini azaltır.
  • [FONT:0]Handling of nonlinearities:) Deep modeller karmaşık, kapalı form çözümlerine meydan okumaz.
  • [[Döneticileri mükemmel bir şekilde bilinen, yerine verilere dayanan en iyi kontrolleri öğrenebiliyor.

Gerçek Dünya Uygulamaları

Derin öğrenme ve en iyi kontrol füzyonu zaten birden çok alanda etkileyici sonuçlar vermiştir. Aşağıda birkaç belirgin örnek vardır.

Özerk Araçlar

Kendi sürüş arabaları dinamik ortamlara ayak uydurarken bölünmüş ikinci kararlar almalı. Geleneksel model tahmin edici kontrol (MPC) iyi çalışır ancak yüksek sadakat modelleri kullanarak hesaplamalı olarak ağır olabilir. Araştırmacılar, bilgisayar ağları kullanarak yönlendirme ve throttle komutlarına uygun performans elde etmek için eğitilmiştir.

Örneğin, 2020'den itibaren bir çalışma:0)UC Berkeley), tam bir MPC'nin otomotiv şeritinde tam bir devreyi değiştirebilecek derin bir öğrenme tabanlı kontrol gösterdi, güvenliklerini korumak için zaman ayırın.

Robotik ve Manipulation

Bir delik veya bir kapı açmak gibi iletişim-zengin manipülasyon politikaları öğrenmek için en uygun kontrolden faydalanır.Sally RL, bir delik veya bir kapı açmak gibi iletişimin analiz edilmesi için de uygulanabilir. Önemli bir örnek, iş yükünü )OpenAI bir robotlu küpü çözmek için bir eldivenle birlikte, bir alan tarafından üretilen bir politikayı rastgeleleştirmek için bir el üzerinde bir şekilde bir araya getiren.

Bu senaryolarda, sinir ağı sadece ortak torklar değil aynı zamanda noktaları ve kuvvet profillerini de tahmin etmeyi öğrenir, tüm gerçek zamanlı olarak hızlanan dinamik dinamik dinamikleri hesaplamaları ve doğrudan yüksek boyutlu devlet gözlemlerini haritalamaktan gelir (örneğin, ortak açı, tactile geri bildirim)

Enerji Sistemleri ve Akıllı Beyaz

Elektrik şebekeleri giderek karmaşıktır, stoklama politikasını tarihsel verilere tanıtmak için yenilenebilir kaynaklarla, milisaniyelerde denge sağlamak ve talep etmek için kullanılır. Bununla birlikte, Nature Energy'de 2023 yılı boyunca tüm en iyi güç akışı problemini çözmek NP-hard'dır. Derin öğrenme tabanlı yaklaşımlar, örneğin en iyi enerji akışının mikrosaniyenlere kadar öğrenme süresini azaltabilir, gerçek zamanlı ağ yönetimine olanak sağlar.

Havacılık ve Uzay

Quadrotors ve diğer hava araçları, 1 kHz'yi aşan kontrol oranlarına sahip olmak için yüksek bant genişliği kontrol döngüsü gerektirir. Model tahmin edici kontrol yaygın olarak kullanılır ancak genellikle hesaplama sınırları nedeniyle 50-100 Hz'de çalışır.Bir sinir ağı ile çözümleyicisi takip ederek, araştırmacılar kontrol oranlarının 1 kHz. Örneğin, Zürih'ten bir çalışma:0).

Meydanlar ve Sınırlar

Onun vaadine rağmen, optimal kontroldeki derin öğrenme bir panacea değildir. Güvenlik-kritik sistemlerde yaygın dağıtımdan önce birçok önemli zorluk ele alınmalıdır.

Güvenlik ve Robustness

Neural ağları eğitim dağıtımını açıkça tahmin edemez. Durumda küçük bir perturbasyon – sensör gürültüsünden, reklamdan gelen giriş veya öngörülemeyen çevresel değişiklikler – sistemin kısıtlarını ihlal eden bir kontrol eyleminin ortaya çıkmasına neden olabilir.

Yorumability

Geleneksel optimal kontrol açık bir anlayış sağlar: çözümün maliyet fonksiyonunu, kısıtlamaları ve dinamikleri. Deep networks, kontrastla, tıkanıklığı neden belirli bir eylemi seçtikleri, bu da karmaşıklık, sertifikasyon ve düzenleyici onayı birleştiren Hybrid yaklaşımlar.

Veri Gereksinimleri ve Genelleştirme

Süpervize öğrenme büyük, en iyi çözümlerin temsilcisini talep eder. Bu tür verileri hesaplamak pahalı olabilir ve sonuçlanan ağ sadece eğitim setinde bulunanlara benzer devletler üzerinde iyi performans gösterebilir.Finans öğrenme öğrenme ön talep edilen verilerle ancak milyonlarca etkileşim gerektirebilir, bu da yavaş veya yanlış olabilir. Domain rastgeleizasyon - Eğitim sırasında simülasyon parametrelerini artırabilir - genelleştirmede yardımcı olur ancak görünmeyen rejimlerde başarısızlığın riskini ortadan kaldırır.

C ⁇ Eğitim Maliyeti

İnference ucuz olsa da, kontrol görevleri için derin ağ eğitimi zaman yoğun ve kaynak-hungry olabilir. Kompleks bir sistem için tek bir politikayı kullanarak, per-application eğitim yükünü azaltılabilir.This cost is accepted for mass-made products (e.g., independent car denetleyicis) but be banned for custom, one-off systems.Ancak, transfer öğrenme ve meta-öğrenme öncesi modeller için yollar sunabilir.

Future Path and Hybrid Approaches

En umut verici yol, geleneksel optimal kontrol teorisinin ve derin öğrenmenin güçlü yönlerini, karşılıklı olarak kendilerini tedavi etmek yerine, birçok gelişmekte olan trendleri bu sentezü göstermektedir.

Neural Network Model Tahmini Kontrol (NN-MPC)

Kontrol eylemi için bir sinir ağı kullanmak yerine, MPC'nin sıkı bir şekilde çalışmasını sağlamak için bir sinir ağı kullanabilir.Örneğin, öğrenilen bir model, bir sinir ağı tarafından sağlanamaz, doğru dinamikler için doğru bir şekilde ısıtılabilir, MPC'nin daha düşük hesaplamalı bir şekilde çalışmasını sağlar. Alternatif olarak, çözümün ilk tahminine göre - bu güçlü bir şekilde yakınlaşma hızını etkiler - bir sinir ağı tarafından sağlanır - optimizasyona daha hızlı ısınır.Bu karma yaklaşımları, hız için öğrenmeyi korur.

Constraint Memnuniyeti için Öğrenme

Önemli engellerden biri kısıtlamalar içindir (örneğin, engel kaçınılması, tork sınırları) bir sinir politikasında. Son çalışma, [[Dönetici bariyer işlevleri) veya )) ile ilgili derin öğrenme biçimini birleştirir.

Güvenli Donma Öğrenme Öğrenme

Mevcut RL algoritmaları genellikle güvenlikleri sadece yumuşak bir ceza olarak kabul eder. Future yöntemleri araştırma ve optimizasyon sırasında zor kısıtlama uygulamalarını entegre edecektir, RL gerçek dünya endüstriyel uygulamaları kilidini açmak için potansiyelle aktif araştırma alanlarıdır.

Sensörden son öğren

Alg, devlet tahminleri ve kontrolü için ayrı modüller olduğundan, son derece öğrenme, doğrudan düşük seviyeli komutlara doğrudan ham sensör verilerini haritalamayı amaçlamaktadır. Zorlu olsa da, bu yaklaşım sistem mimarisini basitleştirebilir ve bileşikleme hataları ortadan kaldırır. Başarılar drone yarışlarında ve otonom sürüşü son derece-son kontrolünün, yeterli veri ve simülasyon sadakatinin performansının aşabileceğini önerebilir.

Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç

Derin öğrenme, robotik, havacılık, enerji ve ötesindeki en iyi denetimleri tekrarlayabilir. Ancak, kabul edilebilirlik ve veri verimliliği önemli engeller olarak kalacaktır.En başarılı çözümler, klasik kontrollerin rigorunu derin öğrenme ile ilişkilendiren karma çerçevelerden ortaya çıkabilir. Ancak, mühendisler ve araştırmacılar için, her iki dünyanın da kabul edilebilirliği ile birlikte yol artık zorunlu değildir: güvenlik garantileri, yorumlanabilirlik ve veri verimliliği kritik engeller.

Daha fazla okuma için, "Optimal Control Theory: An Introduction" kitabını Donald Kirk veya anket makalesi:0) Karşılaştırmalı Kontrol İçin Derin Öğrenme" (İngilizce) olarak düşünün.