Rekabetçi Kontrollü Oyun Teorisinin Temelleri
Diferansiyel oyun teorisi, birden çok karar vericinin, yaygın olarak belirlenmiş oyuncuların, sürekli bir zaman ufukta dinamik bir sistemi etkileyen stratejik etkileşimleri analiz etmek için titiz bir matematiksel çerçeve sunar. Bu disiplin, en iyi kontrol teorisi ve klasik oyun teorisinin kesiştiği noktada, analistlerin tüm ortamın yörüngesini doğrudan etkileyen model sistemlerine olanak sağlar.
Tipik bir ayrım oyununda, her oyuncu bir kontrol eylemi dizisi seçer:0)[Dönetici:2)[Dönetici:2)[Dönemli oyunlar veya ekstraksiyonlar için[Dönemli)[Dönemli oyunlardan (düşük)[Dönemli) veya/düşükücük olmayan oyunlardan (d)) [Dönemli) = x (t)[Dönemli) = x (t))
Farklı oyun teorisinin ayrıntılı bir şekilde anlaşılması, birkaç anahtar matematiksel konseptle aşinalık gerektirir. Hamilton-Jacobi-Bellman (HJB) denklemi, örneğin, sürekli zamanlı optimal kontrol için dinamik programlama analogu olarak hizmet eder.Çok sayıda değişken ve Hamiltonian bu araçlar, her oyuncu için çözüm değer fonksiyonlarını sağlayan bir sistem haline gelir. Conversely, Pontryagin minimum prensibi daha fazla yollanabilir, yine de en iyi şekilde hesaplamak için, en iyi mekaniksel yöntemlere göre yaklaşım.
[0]) Bir diferansiyel oyun, bir kontrolden daha iyi bir kontrol problemidir, her biri muhtemelen çatışma hedefleri ile. ”- Rufus Isaacs, diferansiyel oyunların öncülüğü.).
Okuyucular daha derin bir matematiksel tedavi arıyorlar, bu temelleri özel alanlara genişleten geçici araştırmalar. [FONTS Operations Research magazine) ve ).SIAM Journal on Control and Optimization
Rekabetçi Kontrol Dinamikleri
Uygulamalı oyun teorisini pratik kontrol senaryolarına uygulamak için, bir oyun tanımlayan birkaç yapısal elementi içselleştirmelidir. Bu elementler hem sistem hem de oyuncular arasındaki etkileşimleri tanımlamak için gramer oluşturur.
Devlet Değişkenleri ve Sistem Dinamiği
Devlet değişkenleri, sistemdeki durumu zamanında tanımlamak için gerekli olan temel bilgileri ortaya koyar. rekabetçi bir bağlamda, bu değişkenler, tüm oyunculardan gelen kontrol girişlerini içeren bir değişkene göre (örneğin, bir ikili piyasadaki konumdaki konumdaki konum, pazar payı yüzdeleri) veya performans ölçümlerine (örneğin, toplam 7) göre değişir.
Kontrol Değişkenleri ve İzinsiz Stratejileri
Kontrol değişkenleri her oyuncu sistemi etkileyebilir.Sağlayıcılar, genellikle fiziksel, ekonomik veya düzenleyici kısıtlamalarla kısıtlanabilirler. Bir siber diskoyu (kontrol değişkeni) ve kapalı-loop stratejilerinin yoğunluğu olabilir; çünkü savunmacı, genellikle mevcut veya geçmiş devlet bilgilerini kontrol etmek için haritalar oluşturabilir.
Payoff Fonksiyonlar ve Hedefler
Her oyuncunun en üst düzeye kadar en iyi şekilde ifade ettikleri bir ücrete sahip olduğu bir ücrete sahip olduğu bir fonksiyoneldir.Her oyuncunun kazandığı zaman ufk artı bir terminal ödülü olarak ifade edilir, ödeme oyunu, toplam hasar, yakıt tüketimi veya diğer bazı metrik. sıfır-sum diferansiyel oyunlarda, paraoffların toplamı sürekli olarak etkiler - bir oyuncunun kazancı tam olarak diğerin kaybıdır.
Equilibrium Kavramları: Nash ve Beyond
En yaygın olarak kabul edilen çözüm konsepti, non-cooperatif olmayan diferansiyel oyunlar için geçerli değildir. 0)Nash dengesi, oyuncunun tek başına ödemelerini geliştirebileceği bir dizi strateji olarak tanımlanırken, bu konsept, her oyuncunun stratejisinin başkalarına en iyi bir yanıt olduğunu ifade eder. sıfır oyun için, denge, minimax çözümü ile çakışan bir araya getirir, birçok Nash equilibria var olabilir.
Dinamik ortamlarda denge hesaplamaları anlamak için yararlı bir kaynak, metindir.D:0]).Differential Games: A Mathematical Theory with Applications to War and Pursuit, Control and Optimization by Rufus Isaacs, birçok çalışma örneği ile temel teori sağlar.
Bireysel Kontrollü Scenarios'ları Rekabetçi Kontrole Direnme Teorisini Uygulayın
Farklı oyun teorisinin pratik uygulaması, bir dizi modelleme, analiz ve çözüm adımlarını takip eder. Gerçek hedefleri yakalamak için gerçek dünya rekabetçi bir kontrol sorunu gerektirir: biri zaman ufkuyu tanımlamak, oyuncuları ve izinsiz kontrolleri tanımlamak, sistem dinamiklerini gerçek hedefleri yakalamak için tanımlamak gerekir.
Adım 1: Sistem Modelleme ve Değişken Seçimi
Fiziksel, ekonomik veya siber sistemi göz önünde bulundurarak başlayın. Her aracın sürekli olarak hangi miktarların oyuncu tarafından etkileyebileceğini ve örneğin, iki özerk araç, temel bir otoyol üzerinde bir para toplama senaryosu gezinmelidir. Devlet değişkenleri her aracın uzun süredir kullanılabilir eylemleri hıza sahip olabilir.
Adım 2: Payoff Fonksiyonelleri Yapın
Her oyuncunun ödemesi gerçek hedeflerini yansıtmalıdır, genellikle rakip arzular arasında bir ticaret-off. iki firma arasında bir reklam yarışında, ödeme ücreti toplam olarak toplam olarak toplam olarak toplam klasört satış maliyetleri olabilir, nihai bir planlamada, takip eden bir oyunda, takip eden bir ödeme yapmak için zaman olabilir, ancak evader aynı anda aynı süreyi en üst düzeye çıkarmak için çalışır - sıfır-um etkileşimi.
Adım 3: Diferansiyel Oyun Çözüntü
Model belirtilmiş olduğunda, çözüm süreci küçük ölçekli, lineer-kudratik oyunlar için, Riccati denklemleri aracılığıyla analitik çözümler var. Daha genel olarak, sayısal yöntemlere güvenmek gerekir. Ortak bir yaklaşım zaman domaini ayırıyor ve zaman içinde statik Nash oyunlarının bir dizisini geri çevirmektedir (dinamik programlama).
Örnek: Dinamik Oligopoli'deki Ekonomik Rekabet
[FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=[FONT=)[[değiştir | kaynağı değiştir]
Bu tür ayrımcılık, belirli doğrusal-kudratik varsayımlar altında analitik olarak çözülebilir, kapalı-loop Nash denge stratejilerinin ortaya çıkmasını sağlar[/FONT=D=D=D=D=D=D) + α[D][/FONT=[D][/FONT=D][/FONT=D][/FONT=D=D=D=D=)[D=[D=2][/FONT=[D][/FONT=)[D=[D=[D=2|D=)
Örnek: Özerk Araç Merging
Otomatik sürüşte, para toplama sorunu iki oyuncu olmayan bir şekilde modellenebilir (kolision, açık bir dengeyi ayırt edebilir) Bir geri bildirim (kapılı hız. Kontroller hıza doğru ilerlerken, kooperatif koordinasyonunu sağlar.Son çalışmalar, etkileşim verileriyle ilgili değer fonksiyonlarını yaklaşık olarak kullanır ve güvenliği sağlar (kolision kaçınmadan kaçınır).
Bu tür uygulamalar hakkında çağdaş bir inceleme için, makale bakınız:0) IEEE Transactions on Otomatik Kontrol), bu sık sık oyun-theoretic control for Cyber-physical systems.
Pratik Uygulamada Zorluklar
Teorik zarafetine rağmen, gerçek rekabetçi kontrol senaryolarına göre farklı oyun teorisini uygulamak mümkün olmayan engeller için sunar. Bu zorluklar genellikle ders çözümlerinin doğrudan kullanımını önleyerek ve her iki modelde inovasyon talep eder.
C ⁇ Kompleksiity
Farklı bir oyun çözümü, birden fazla oyuncudaki devlet kartjektörleri ve stratejilerinin eş zamanlı olarak tedavi edilmesini gerektirir. çift HJB denklemleri, iki veya üç devlet değişkeninin nadiren yollanabilir olan üst boyutlu kısmi diferansiyel denklemlerdir. Boyutlu değişkenliklerin eğriliği hızla hakimler: bir tane daha devlet değişkeni, büyüklüğün emirleriyle hesaplamalı gereksinimleri çoğaltabilir. Araştırmacılar, modelin tahmin edici kontrolünü (MPC) oyundaki düzeltme-horizon versiyonunu çözmüşlerdir.
Bilgi Yapıları
Gerçek oyuncular nadiren mükemmel bir devlet geri bildirimine sahiptir. Gürültülü ölçümler, gecikmiş sinyalleri veya sadece agresyon istatistikleri gözlemleyebilirler. “bilgi seti” kavramı kritik hale gelir: bir filtre (kalpıcı filtre) ve bu tahminlere göre stratejilerini temelletir.Bu bilgiler yapısı, HJB denklemlerini önemli ölçüde zorlar.
Uncertainty ve Stochasticity modelleme
Birçok rekabetçi kontrol sistemleri doğal olarak stochastic: rastgele şoklar talep ediyor, hava hava drone operasyonları ya da öngörülemeyen rakip eylemleri meydana geliyor.Dillman-Isaacs denklemi genişletmek için alternatif olmayan diferansiyel denklemleri daha gerçek bir şekilde ele alıyor (SDE)
Doğrulama ve Geçerlilik
Şık bir Nash dengesi çözümü bulunduğında bile, gerçek dünya davranışlarına karşı doğrulanmalıdır. Oyun yapısı hakkındaki mükemmel rasyonellik ve yaygın bilgi nadiren memnundur. Davranışsal ekonomi, insan oyuncularının sistematik olarak tahminlerini yerine getirdiğini göstermektedir.In otonom multi-agent systems, trust in algorithmic strategy must be built through intense logicity and common knowledge of research, with techniques like inverse specific games ( learning the cost functions from watching trajectories) getting boks.
Gelişmiş Konular ve Gelişen Yollar
Farklı oyun teorisi alanı, bilişim, yapay zeka ve yeni uygulama alanlarının ilerlemeleri ile gelişmeye devam ediyor. Çeşitli temalar özellikle rekabetçi kontrol senaryoları için umut verici.
Ortalama-Field Games
Oyuncuların sayısı büyük büyürken (örneğin, binlerce özerk sürüş-pay araç veya finansal pazarda sayısız yatırımcı), bireysel etkileşimleri takip etme karmaşıklığı, oyun (MFG) teorisi, tüm ajanlar, kablosuz ağlar ve yüksek frekanslı ticaret stratejileri ile etkileşime giren birçok oyuncu oyunuyla ilgilidir.
Asymmetric Information ile Diren Oyunlar
Birçok rekabetçi senaryo, bir oyuncunun kendi yetenekleri veya hedefleri hakkında sahip olduğu özel bilgileri içerir. Örneğin, bir savunucuları saldırıcının tercih edilen hedef setini bilmiyor olabilir.Bu tür oyunlar eksik bilgi ile şemsiyesi altında düşebilir. analizler genellikle zaman içinde özel bilgileri açığa çıkarır.
Diferansiyel Oyunlarda Öğrenme
Son çalışma, dinamik oyun teorisini çok-agent takviye öğrenme (MARL) ile birleştirir, çünkü sürekli zamanlı ortamlardaki denge stratejileri açık bir şekilde tanımlamak yerine, genellikle sinir ağları yaklaşımlarını kullanarak, bu veri odaklı yaklaşım, devlet uzayının büyük olduğunda boyutsallık lanetini engelleyebilir.
Donanım-in-Loop ve Real-Time Uygulamalar
Parasal oyun teorisinin uygulanmasının nihai hedefi, gerçek zamanlı olarak çalışan kontrollere yol açan stratejileri aktarmaktır. Özerk sürüş, drone yarışları veya robotik futbol gibi uygulamalar için, kontrol cihazı sadece milisans içinde en iyi yanıt hesaplamalıdır.Bu talepler sadece çevrimdışı bir çözüm değil, aynı zamanda oyun çözümünde eğitim gören bir geri bildirim politikası sunar.
Analistler ve mühendisler için pratik bir kılavuzluk
Dinamik oyun teorisini rekabetçi bir kontrol senaryosu için uygulamak isteyen uygulayıcılar için, bir metodolojik yaklaşım önemlidir. İşte birkaç eylem edilebilir adım:
- [FONT:0] Küçük başlayın.[DÜDÜDÜDÜDÜDÜDÜDÜŞÜNİVERSİTESİ:0) Küçükbaşlangıçta (DÜDÜDÜDÜDÜDÜDÜDÜDÜDÜ) Problemin en basit non-trivial versiyonunu modellemek - iki oyuncu, bir devlet boyutu, lineer dinamikler ve dörtlü maaşları. Kompleksili veya karmaşıklık eklemeden önce sezgi kazanmak için en az sayısal ücretle.
- [FONT=0) Bilinen sınırların karşısında dikin;[Dönetici 1 ) Çözümün tek bir oyuncu en iyi kontrol problemine indirgendiğini kontrol edin.Eğer yaparsa, diferansiyel oyun formülü tutarlıdır.
- [FONT:0) Açık-loop ve kapalı-loop stratejileri arasında yer alan Choose.[D:0] Oyuncular gerçek zamanlı olarak durumu gözlemleyemezlerse (örneğin, uzun vadeli yatırım kararları).
- [FONT=0)Exploit simetrisi[Dönetici:0)[Dönetici ve ödeme noktaları) ise, denge genellikle arama uzayının boyutunu azaltır.
- [FONT:0)Instri belirsizlik yavaş yavaş yavaş yavaş.[DÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜNÜDÜDÜDÜDÜDÜDÜDÜŞÜNÜDÜDÜDÜDÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞ
- [FONT:0] Simülasyonla güncellenme.[DÜDÜDÜDÜDÜDÜDÜDÜ:0)[Üye Olmayan Bir Değerlendirmede Karar Vermek veya Politika Bulundığında, kapalı-loop sistemini gürültü modeliyle simüle etmek ve parametre değişikliklerine duyarlı test etmek. Robustness genellikle kesin bir dengeden daha önemlidir.
- [FONT:0]Review the literatürü gözden geçirmektedir.[[Döneticiler için, literatürdeki önceki modeller için arama. Ekonomi, ekoloji, robotik ve savunmada birçok rekabetçi kontrol sorunu, ve savunma, diferansiyel oyunlar kullanarak modellenmiştir; çözümleri başlangıç noktaları olarak hizmet edebilir.
- [[Dönetici araçları [Dönetici:0)Consider sayısal araçlar.[[Dönetici:0)Consider sayısal araçlar.[[Dönemli değer fonksiyonu yaklaşımlar için) veya MATLAB'in Optimizasyonu Toolbox ( doğrudan transkripsiyon) gibi paketler prototypingi hızlandırabilir.
Tartışma: Concluding Synthesis
Alternatif oyun teorisi, zaman içinde kararların ortaya çıktığı rekabetçi kontrol senaryolarını anlamak için güçlü bir dil ve analitik bir çerçeve sunar.Oyun teorisinin stratejik nedeni ile sürekli zamanlı sistemlerin dinamikleri ile evlenmek, hem de pratik olarak aktif olan zengin matematiksel teorinin bina bloklarına zenginleştirir.
Hesaplama karmaşıklığının zorlukları, bilgi asimetrik ve model belirsizlik devam ederken, sayısal yöntemlerdeki gelişmeler, gelecekteki rekabetin daha iyi donanımla değil, daha iyi matematiksel ve algoritmalı çevreleri tanımlayan etkileşimli dinamiklerin anlaşılması için sürekli olarak daha iyi hale gelecektir.
Son bir not olarak, uygulayıcılar, bir araç olarak bir zihniyet olarak farklı bir şekilde yaklaşmalı. Sistemetik olarak düşünmek için bir güç: “Benim karar, rakipimin gelecekteki seçeneklerini etkilemeye geri dönüyor.”Bu perspektifi etkileyebilir -ki nicel rigor ile birlikte -bir dinamik, yarışmalı bir dünyada stratejik kontrole doğru ilk adım.