Yüksek boyutlu Optimal Kontrol Sorunları için Hızlı Sayısal Çözme Sorunları Geliştirmek

Büyüyü Verimli Solvers için Gerekli

Optimal kontrol, modern mühendisliğin kalbinde, finans ve özerk sistemlerde yatıyor.Uzmanlıkta güç şebekelerini optimize etmek için rüzgarlar atmaktan, altta yatan sorunlar genellikle onlarca veya yüzlerce devlet değişkeni ile açıklanan sistemleri içerir; Bu boyutlar arttıkça, geleneksel sayısal devreler üst düzey hesaplama maliyetleri altında kırılır - yüksek boyutlu optimal kontrol problemleri için hızlı sayısal devreler geliştirmek için hızlı sayısal devreler geliştirmek.

Yüksek boyutlu optimal kontrol problemleri, robotik manipülasyon ve havacılık yörüngesinden portföy optimizasyonu ve iklim politikası analizi için yapılan uygulamalarda ortaya çıkıyor.Her senaryo, klasik ağ tabanlı yöntemler kullanarak yüksek boyutlardaki bir politikayı gerektirir.Bu makale, temel zorlukları, durum-Bellman (HJB) kısmi diferansiyel denklemi veya Bellman denklemini ayrı ayarlarken, her ikisine de klasik ağ tabanlı yöntemler kullanarak yüksek boyutlarda tutar.

Yüksek Boyutlu Optimal Kontrolünü Anlamak

Anada, en uygun kontrol sorunu bir kontrol yasası arar:0)[x, x)[Dönetici: 4 )[Dönetici: 4 ), s.4|Düzersiz) s.

Yüksek boyutlu optimal kontrol, bu nedenle, değer fonksiyonunu veya sorunu açıkça temsil etmeden en iyi politika ile karakterize edilir. Bu, çeşitli açısal genişlemeler ve gerçek zamanlı fonksiyonlar dahil olmak üzere, doğrusal olmayan bir çerçeveye yol açtı.

Boyutsallık eğriliği

Boyutsallık laneti, 1950'lerde Richard Bellman tarafından getirilen bir terim, 10 boyutlu problem için yoğun bir şebekeye atıfta bulunmak, boyuta 100 puan ekleyen bir şebekeyi 10010 = 1020 puan, mevcut olan örneklerin sayısını üst düzeye çıkarmak anlamına gelir.

Bu lanet sadece pratik bir rahatsızlık değildir; temel olarak klasik dinamik programlamanın uygulanabilirliğini sınırlar. Bunu aşmak için araştırmacılar, sömürücü yapısı (örneğin, düşük seviyeli, kesintiler, separability, sparsity) veya ölçeklenebilirlik (örneğin, Monte Carlo örnekleme, modelleme kontrolü) konusunda titiz garantiler sağlamak.

Numerical Solver Development'de Zorunlu Meydanlar

Yüksek boyutlu optimal kontrol için hızlı bir sayısal çözüm oluşturmak, birkaç kilit zorluktan yoksundur. Bu zorluklar, sayısal stabilite, adaptasyon ve gerçek zamanlı performans için taleplerin ötesinde genişletilebilirlik sağlar.

C ⁇ Kompleksiity

İlk engel, sabit veya yüksek oranda yükseltilebilir, HJB denkleminin birden çok değerlendirme gerektiren, dinamiklerin ve maliyet işlevlerinin gerektirdiği birçok algoritmanın karmaşık veya simülasyonun pahalı olup olmadığının belirlenmesidir.

Ayrıca, dinamik programlama içindeki optimizasyon adım genellikle her eyalette kontrol alanı üzerinde bir minimizasyon problemini çözmeyi içerir. Sürekli kontrol ayarlarında, bu, hesaplamalı maliyet katmanını eklemek için başka bir katman eklemek isteyebilir. Strategiess about dynamic programming (ADP) ve bu maliyeti bir parametreleme modeli ile azaltarak ve yaklaşık politika değerlendirmesini kullanarak azaltmayı gerektirir.

Numerical Stability and Truth

Yüksek boyutlu çözücüler sayısal istikrarsızlıka eğilimlidir, özellikle de değer iterasyon veya politika iterasyon gibi değer yöntemleri kullanarak.Sekizle ilgili olarak getirilen yaklaşım hataların, osilasyon veya ayrımcılığa yol açabilir ve liderlik edebilir.Ensuring monotonluk, tutarlılık ve istikrar ağları genellikle eğitim için dikkatli bir şekilde tasarım gerektirir. Örneğin, sinir ağları kullanarak, değer fonksiyonunu kullanarak, non-convex optimizasyon manzaralarını kullanarak, düşük yerel minima ile sonuçlanabilir.

Finansal seçenek fiyatlarında, yüzde birkaçının hataları kabul edilebilir olabilir; otonom sürüşte, bir inaktif kontrol politikası felaket başarısızlıklara yol açabilir. Bu nedenle, çözücü geliştiriciler hata sınırları ile hesaplama verimliliğini dengelemelidir.Son çalışma hakkında bilgilendirici programlama).

Gerçek Zamanlı Uygulamaların Uygunluğu

Birçok yüksek boyutlu en iyi kontrol sorunları, kararların milisans'ta yapılması gerektiği bağlamında ortaya çıkmaktadır. Örneğin, bir dörtlü bir ortamda, bir klişe ortamın yeniden yapılandırılması, yeni engeller olarak yörüngeye yeniden katılması gerekir. Geleneksel çözücüler bu zaman kısıtlamalarını karşılayabilirler. Bu nedenle hızlı bir şekilde çözülür (örneğin, bir sinir ağı politikası) ve online yürütme (örneğin, politikayı teşvik eder.

Gerçek zamanlı ölçeklenebilirlik ayrıca verimli kod talep eder, genellikle GPU ivmesini, vektörizasyonunu ve dikkatli hafıza yönetimini gerektirir: Algoritma yöntemleri ve onor dekompozisyonları paralel hale getirilebilir, ancak eşdeğer algoritmaların I/O sınırları olabilir.

Hızlı Solvers geliştirmek için Stratejiler

Son iki yılda, yüksek boyutlu optimal kontrolle mücadele etmek için zengin bir araç kutusu ortaya çıktı. Bu yöntemler boyutsal azalmaya geniş ölçüde kategorize edilebilir, sparse temsilleri, makine öğrenimi ve paralel hesaplamalar sunar. Her biri boyutsallık lanetine doğru ilerlemek için farklı bir yol sunar.

Boyutlu Reziğe Dayanıklılık Teknikleri

Sistem düşük boyutlu yapıyı gösterirse, etkili boyutsallık nominal devlet boyutunun çok daha düşük olabilir. Boyutsal azalma bu yapıyı tanımlar ve kullanır.

Proper Orthogonal Decomposition

Proper orthogonal decomposition (POD), aynı zamanda veri bilimindeki temel bileşen analizi olarak da bilinir, simülasyon verilerinden gelen baskın modları alabilir.En uygun kontrolde, POD, yüksek boyutlu bir devlet alanını, dinamiklerin yaklaşık olarak yakalanabilmesine olanak sağlar. Bu, değer fonksiyonundaki özgürlük sayısını azaltır.[örneğin, akış kontrolü, POD, Navier-Stokes denklemlerini bir avuç modda azaltmak için uygulanabilir.

Tensor Decompositions

Tensor decompositions matrix faktörizasyonlarını daha yüksek sipariş dizilerine genelleştirir.En iyi kontroldeki değer fonksiyonu düşük seviyeli onrankor olarak temsil edilebilir, depolama ve hesaplamayı büyük ölçüde azaltır.Theur-based solutionrs have given problems with to 10-20nating[D)

Sparse Grid Yöntemleri

Sparse ızgaralar, Sergey Smolyak tarafından tanıtıldı, noktaların büyüklüğüne aykırı bir şekilde kırılabilmenin bir yolunu sunuyor. Tam onor ürün ızgara yerine, sparse ızgaraları, 10-15 boyutuna dayanan sorunlar için dikkatli bir seçim kullanıyor.Kapitli karma türevlerle fonksiyonlar için, daha fazla ölçek artırıcı olmayan noktalarla yüksek doğruluk elde etmek için, daha da iyi bir şekilde adapte olmak için HJB denklemleri çözmek için uygulanıyor.

Bir meydan okuma, sparse ızgaralarının düzgün değer fonksiyonları için en iyi şekilde çalışmasıdır.En uygun kontrolde, değer fonksiyonu genellikle kinks veya sonsuzluklar veya patlama-kırık kontroller nedeniyle (örneğin, yerel rafineriler ile yakınlaşma) bu kadar iyi yönetilemez özellikleri ile başa çıkabilir, ancak teorik garantiler zayıftır. Bununla birlikte, sparse ızgaralar sağlam kontrol ve hassas kontrol gibi sorunlar için güçlü bir seçenek olarak kalır.

Makine Öğrenme ve Neural Networks

Derin öğrenmedeki hızlı ilerleme, HJB denklemlerini en iyi şekilde öğrenme için yeni bir avenues açtı - "Polerkin yöntemi" veya "fiziksel ağlar" (kırıklıklı temsiller için ihtiyaç duyulan) Bu yöntemlerde HJB denklemlerinin oturma süresi, denetimsiz öğrenme yoluyla en aza indirmek için derin sinir ağları kullanıyor - bu şekilde "eski Galer yöntemi" veya "fiziksel ağlar" (köpektifler) olarak bilinen bir yaklaşımdır.

Diğer algoritmaların aile desteği, eleştirmenlerin (değer işlevleri) ve aktörlerin (politikalar) sinir ağları tarafından temsil edilmektedir. Deep Deterministic Policy Gradient (DDPG) ve Soft Aktör-Critic (SAC) aktif bir alandır, sürekli olarak devlet ve aksiyon alanları, HJim denklemleri için çok miktardaki baskı gerektirir[değiştir | kaynağı değiştir]

Önemli olarak, sinir ağı tabanlı çözücüler gümüş bir mermi değildir. Eğitim yavaş olabilir ve altoptimal politikalarına yakın olabilir. Zorlu kısıtlamalarla ilgili sorunlar için, fizibilitenin sıklıkla bariyer işlevleri veya projeksiyon adımları gibi ek teknikler gerektirir. Bununla birlikte, sinir ağları esnekliği onları modern çözünürlükte önemli bir malzeme haline getirir.

Paralel ve Dağılım

Boyutsal azalma ile bile, kalan hesaplama iş yükü önemli olabilir. Paralel hesaplamalar hıza kadar bir brute-force yol sunar. Birçok işlem en uygun şekilde kontrole - birden çok eyaletteki maliyeti değerlendirmek gibi, rulolar veya bilgisayar gradyanları - çok-core CPU'ları, GPU'ları ve bu görevleri hızlandırmaları için kümeler.

Örneğin, sparse ızgaralarla değerleme, yüksek boyutlu kontrol görevleri için farklı ağ noktaları atamak tarafından paralelleştirilebilir. Benzer şekilde, sinir ağ tabanlı yöntemlerde, mini-batch eğitimi doğal olarak GPU paralelliği ilerleyebilir. daha ileri tekniklere sahip olabilir.

Son gelişmeler ve Gelişen Teknikler

Kombinasyon sınırı sayısal analiz, makine öğrenmesi ve kontrol teorisi arasındaki çapraz-pollinasyonla tanımlanır. Birkaç yeni ilerleme, daha yüksek verimlilikle daha yüksek boyutları ele almak için potansiyellerini öne çıkarır.

Numerical Methods ile Derin Öğrenmenin Entegrasyonu

Derin öğrenmeyi bir standalone yaklaşımı olarak tedavi etmek yerine, araştırmacılar geleneksel sayısal yöntemlerle bir araya geliyorlar. Örneğin, "Deep BSDE" yöntemi, yüksek boyutlu para PboDE'leri çözmek için geri dönüşümlü bir denklem formülü kullanır, HJB denklemleri de dahil olmak üzere. Bu yöntem, Monte Carlo örneklemelerini kullanarak elde etmek için nöral ağlardan yararlanıyor.

Bir başka hibrit yaklaşım, "Multi level Picard Iteration", HJB denkleminin integral gösterimini kullanan bir Monte Carlo'nin en üst boyuttaki farkları, pratik verimliliğin belirli bir problem yapısına bağlı olmasına rağmen teorik bir araştırma yönüdür.

Hybrid Model-Based ve Data-Driven Approaches

Saf model tabanlı yöntemler (örneğin, klasik dinamik programlama) her iki dünyanın en iyi modellerini almak için örnek olarak, model tabanlı güçlendirme öğrenme algoritmalarının veriden dinamik bir model öğrenmesini ve daha sonra planlama veya politika optimizasyonu için kullanabileceğini gerektirir.The learning model can be a nöral ağ, a Gaussian process, or a indirgenen bir model.For using the model to generated rollouts, the model to generate-order-order-order-order-order-order-order-order-order-order-order-order-order model.

Başka bir umut verici yön, farklı sistemlerde özellikle başarılı olan, yörünge optimizasyonuna olanak sağlayarak, kontaklarda ve çarpışmalarda organik olmayanlar bir meydan okuma olmaya devam eder.Bu özellikle de robotikte başarılı olmuştur.

Future Yol ve Açık Meydanlar

Önemli ilerlemeye rağmen, birçok açık zorluk kalır. Belki de en acil durum, makine öğrenimine dayalı çözücüler için titiz teorik garantiler için ihtiyaçtır.

Başka bir sınır, yüksek boyutlu stochastic optimal kontrol problemlerini gürültülü dinamikler veya kısmi gözlemlerle idare edebilecek olan çözücülerin gelişimidir. Bu sorunlar, sabit olmayan volchastic volatilite modelleri ile finanse edilmektedir ve iklim kontrolü ile belirsiz daha fazla tartışmanın dahil edilmesiyle ortaya çıkmaktadır.

Gerçek zamanlı, on-device inference bir engel olmaya devam ediyor. Bir politika çevrimdışı olarak hesaplanabilirse, sınırlı hafıza ve hesaplama ile gömülü donanıma giriş yapmak genellikle sıkıştırma gerektirir (örneğin, nükleer ağları veya pruning). Solvers, aklınızdaki donanım kısıtlamaları ile birlikte tasarlanmalıdır.

Son olarak, karşılaştırmanın zorluğu var. Alan bu boşluğu doldurmaya çalışan standart yüksek boyutlu test problemleri var, ancak daha geniş kabul edilen aileler arasındaki adil karşılaştırmaya izin veriyor.AR:0).HighDimOptControl kriter paketi)

Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç

Yüksek boyutlu optimal kontrol problemleri için hızlı sayısal devreler geliştirmek, özellikle de sayısal tekniklerle derin öğrenme alanıdır, boyutsal boşlukların yüzlerce boyutsal azaltımı, sparse ızgaralar, makine öğrenimi ve paralel hesaplamalar dahil olmak üzere, özellikle de sayısal öğrenme ile ilgili olarak, sayısal yöntemler ile ilgili olarak, teknolojik gelişmelerin sınırlandırılması, bu nedenle, daha büyük ölçüde gerekli olan birkaç boyuta kadar, teorik garantiler, gerçek zamanlı dağıtım, ve belirsizliklerin kullanımı, makine öğrenimi, özellikle de kontroller arasındaki disiplinler arası işbirliği içinde devam etmektedir.