Multi-agent Systems'in Optimal Kontrolü Cooperatif Görevler

Multi-agent sistemler (MAS), tek bir ajan kapasitesine sahip olmak için paylaşılan birden çok özerk ajandan oluşur - depolama otomasyonlarından ve arama-ve-yaşlı görevlerden bağımsız otoyollara ve algılamaya kadar her biri güvenilir, verimli ve ölçeklenebilir bir çok-ajan işbirliğine sahip olmak için temeldir.

Multi-agent Systems

En uygun kontrole girmeden önce, çok-ajanlı sistemlerin temel bina blokları anlamak önemlidir. Ajanslar şunlar olabilir:0)homojeneous) veya [[Döneticisel inif ve davranış) veya [[Dönetici[Dönetici[Döneticiler[Döneticiler, yazılımlar veya roller)[değiştir | kaynağı değiştir][değiştir | kaynağı değiştirilenler arasındaki iletişim[Döneticisel bir koordinasyon mekanizmalarına sahiptir.

Graph-Theoretic Representation

Çok-ajanlı sistemlerdeki etkileşim topolojilerini modellemek için ortak bir matematiksel araç grafik teorisidir. Agents bir grafikte düğümler olarak temsil edilir ve iletişim veya algılayıcı bağlantılar kenarlardır.Her bir ajan kendi devlet ve ağırlıkları arasındaki farkı günceller. Laplacian matrix örnek olarak, aritmetik ve senkronizasyon özelliklerini analiz etmek için kullanılır.For example, in aurpert:0Consensus protokolü), her bir ajan kendi devlet ve komşularının ortalamaları arasındaki farkı güncelleştirir.

Multi-agent Koordinasyonunun Vergisi

Kooperatif görevler birkaç kategoriye ayrılabilir: [[Üye Olmayanlar[Döneticiler): [Döneticiler ortak bir değere doğru giderler), [[Döneticileri kontrol etmek[Döneticiler için); ve onlar için istenen geometrik bir şekil tutarlar (örneğin, spertmeler);[Döneticiler bir alana yayarlar (örneğin,) ve her türlü balık kontrolleri ve diğer tüm alt alanlarının uygun şekilde kontrol altına alır.

Problem Optimal Kontrol için Formülasyon

Çok-ajanlı sistemlerin engeli, her bir ajandayı en aza indiren bir kontrol noktası olarak algılanır[Dönemli)[Dönemli)[Dönemli)[Dönemli)[Dönemli)[Dönemli)[Dönemli)[Dönemli)[Dönemli)[Teltilmiş olan (Düzücükler)[TFLT: 16/T)[Tf: 16/T)

[FONT:0]kooperatif yönü [[Dönetici: 1) Maliyet fonksiyonu ve kısıtlamalarında görünüyor: ajanlar, birbirleriyle çarpışmalardan kaçınmalıdır veya form oluşturmadan kaçınmalıdır.

Multi-agent Systems'in Optimal Kontrolü

Çok-ajan işbirliğinin yararları açık olsa da, pratikte en iyi kontrol elde etmek birkaç temel zorlukla karşı karşıyadır. Bunlar sadece teknik değildir, ancak belirsizliğin altında dağıtılmak üzere temel karmaşıklıklardan kaynaklanır.

Scalability

Hesaplama ve iletişim yükü, ajan sayısı ile dramatik bir şekilde büyür. Merkezleştirilmiş çözümler, tek bir kontrol cihazının tüm multi-agent optimizasyonunu çözdüğü, yüzlerce veya binlerce ajan takım için uzun süre boyunca uygulanabilir hale gelebilir. Devlet alanı patlamaları ve küresel olarak en uygun kontrol eylemleri hesaplamaları gereken zaman gerçek zamanlı kısıtlamaları aşabilir. Scalable algoritmalarının doğrusal olarak (veya alt-lineerly) ajanların sayısı ile genellikle dekompozisyon ve yerel etkileşim yoluyla elde ettiği karmaşıklığa sahip olması gerekir.

İletişim Eklenmeleri

Güvenilir bilgi değişimi gerçek dünya dağıtımlarında garanti edilmez. Agents deneyimleyebilir:0) İletişim gecikmeleri), [[FONTD:2|kavuş kaybı), ancak gerekli olduğunda, ağ yükü, veya geçici bağlantı kurma işlemlerinin kesintiye uğraması gerekir. Kontrol stratejileri bu hataları tahmin etmek için sağlam olmalıdır.For example, inFLT:6

Şehir merkezileştirme ve Gizlilik

Birçok uygulamada, merkez kontrol cihazı gizlilik kaygıları, güvenlik riskleri veya altyapı sınırlamaları nedeniyle istenmeyen değildir.Meryemin kontrolü, her ajanın tüm takımdan ödün vermeden kontrol eylemlerini hesaplaması ve sınırlı komşu güncelleştirmeleri gerekir.Bu ihtiyaçlar dağıtım algoritmaları).

Heterojenlik

Ajansların farklı dinamikleri, yetenekleri veya kısıtlamalar olduğunda, kontrol sorunu daha karmaşık hale gelir. Örneğin, sabit uçak ve dörtlücopters ekibi farklı kontrol yasaları ve koordinasyon stratejileri gerektirir, çünkü hareket modelleri önemli ölçüde farklıdır. Maliyet fonksiyonu bu farklılıklar için dikkate almalıdır ve görev tahsis algoritmaları en uygun şekilde ajandaları eşleştirmek zorundadır.

Robustness to Uncertainty

Gerçek ortamlar stochastic: sensörler gürültülü ölçümler üretir, eylemciler hataya sahiptir ve dış rahatsızlıklara sahiptir (rüz, arazi, insan eylemleri) ajan davranışlarına etki eder. nominal model için en uygun bir kontrol politikası bu belirsizlikler altında performans gösterir. )Robust kontrol). ve [[köpektif en iyi kontrol) Yöntemler performans sınırlarını garanti etmeyi veya en aza indirmek için tasarlanmıştır.

Optimal Kontrol Stratejileri

Yukarıdaki zorluklara değinmek için geniş bir yöntem geliştirildi. Strateji seçimi takım büyüklüğü, iletişim becerileri, görev gereksinimleri ve mevcut hesaplama kaynaklarına bağlıdır. Aşağıda en belirgin yaklaşımları tarif ediyoruz.

Model Tahmini Kontrol (MPC)

Model Tahmini Kontrol, çok-ajanlı bir koordinasyon için bir temel haline geldi çünkü doğal olarak kısıtlayıcılar ve gelecekteki devletlerin tahminlerini dahil edebilir.In aENFLT:0Contaized MPC (“FLT:1 framework), tek bir kontrol cihazı, her bir ajandayı kontrol etmek için kendi yerel MPC problemini çözmüş durumda.

Örneğin, otonom araç platosunda, her aracın MPC modülü, güvenli inter-vehicle mesafelerini korumak için güvenli bir şekilde kontrol edilen hız aralıklarını garanti eder[Döneticisel iletişim bağlantısı üzerinden hızlananlar tarafından, platoon dize stabilitesi elde eder.]

Dağıtılmış Optimizasyon

Küresel maliyet fonksiyonu yerel maliyetler artı darbe şartlarının toplamı olarak ortaya çıkabilirken, her ajandanın çoklu algılama değişkenleri üzerinde bir cezayı içeren bir sistemle ilgili olarak belirlenen bir işlem yöntemine göre, her bir ajandayı çok daha iyi bir şekilde çözmüş durumdaki bir şekilde kontrol altına almak için yerel bir alt boyuta kadar kontrol eder.The algorithm iterates between local minimization and a centerized or koordinasyon step (e.g.

Öğrenmeye Dayalı Kontrol

Dinamik veya kötü modelli ortamlarda, öğrenme tabanlı yaklaşımlar esneklik sunar.ETHFLT:0)Multi-agent takviye öğrenme (MARL)), ajanlar çevre ile en iyi politikaları öğrenmelerine ve diğerleriyle etkileşim yoluyla izin verir. Algoritmalar:2MA)DDPG).

Özerk drone batarm navigasyonu dağınık ortamlarda asal bir kullanım durumudur: ajanlar bilinmeyen uzayları keşfederken çarpışmalardan kaçınmayı ve birlikte kalmayı öğrenir. ”Ücretsiz:0) Önemli bir örnek, takviye öğrenme kullanarak 10 uçağın dağıtılmış uçuş kontrolüdur).

Consensus-Based Control

Consensus algoritmaları, ortak değişkene ulaşmak için ajanlar için gradient-free, ölçeklenebilir bir yöntem sunar (örneğin, pozisyon, pozisyon veya hız). Formasyon kontrolü, konsensasyon protokolleri yerel potansiyel alanlarıyla birlikte, sonlu mesafelerde bir araya gelir.[Dönetici-düşükümlü yaklaşım[Dönetici)[Dönetici-yapaylaşıcı-yapıcı yaklaşım[Dönetici).[Dönetici).

Oyun-Theoretic Control

Ajansların ilgi alanlarına veya sınırlı bilgilere sahip olduğu zaman, oyun teorisi, sosyal olarak optimal bir yapılandırmaya yönelik bir çerçeve sunar.Inurjit görevler için, [[0) Her ajan, başkalarına bağlı olan dinamik bir optimizasyon problemini çözer.Bu yaklaşım genellikle çok değerli bir şekilde ilerlemektedir ve ajanlar sosyal olarak en uygun şekilde optimize edici bir şekilde optimize edici bir şekilde optimize edici senaryolar ve kaynak tahsis edilir.InurFLT:3.

Cooperatif Optimal Kontrol Uygulamaları

Multi-agent optimal kontroldeki teorik gelişmeler, endüstriler çapında geniş bir gerçek dünya uygulamaları topladı. Aşağıda kooperatif kontrolün bir somut etki haline geldiği birkaç alan vurgulıyoruz.

Swarm Robotics for Exploration and Search

Arama-ve-rescue misyonları felaket bölgelerinden faydalanıyor, robotun en iyi izleme pozisyonuna sahip olduğu her robotun her robotu hızlı bir şekilde kapatabilmesi için denge araştırması (yeni zemini keşfedin) iletişim bakımı ile (köpücüklükle işbirliği içinde kalmak için) eşit bir kontrol algoritması, her robotu en iyi izleme pozisyonuna götürebilir, belirsizlik alanını miniz. ”

Özerk Araç Platoning

Ulaşımda, ağır kamyonların platolmesi aerodinamik sürüklenme, yakıt tüketimi ve emisyonlar azaltmaktadır. Lider araç hızı ayarlar ve aşağıdaki araçlar, uyumlu bir seyir kontrolü kullanılarak geliştirilmiş olan sabit bir boşluk tutar.[Dört kontrol yöntemleri, özellikle de dağıtılmış MPC,% 10-20’lik tasarruf sağlamak için kullanılır.)

Dağılım Sensör Ağları

Sabit veya mobil sensörler ağları çevresel parametreleri izlemek için işbirliği yapar (örneğin, sıcaklık, kirlilik, sismik aktivite). Sensör pozisyonlarının optimum kontrolü veya örnekleme oranları, enerji tüketiminin minimum düzeyde azaltılması sırasında bilgi kazanabilir. ”ŞUzman bazlı Kalman filtreleri).

Kooperatif Drone Formations

Ticari drone ışık şovları (örneğin, Intel'in Atışı Star droneları) engellerin ve limitli bataryaların kullanımdan kaçınılması için online yeniden planlanması gerekir.Rezersiz devreler için online yeniden planlayıcılar için, güvenli bir şekilde teslim edilmesi veya iletişim röleleri, yüklemeleri için uygun kontrolden yararlanır.Son çalışma kullanım süresi:0)

Future Yol ve Açık Sorunlar

Hızlı ilerlemeye rağmen, birçok zorluk kalır. Bir sonraki çoklu-ajanlı optimal kontrol, muhtemelen AI tabanlı politikalar için öğrenme ve kontrol etmeyi daha sıkı bir şekilde entegre edecek ve aşırı kaynak kısıtlamaları altında faaliyet gösterecek.

Yapay Zekanın Entegrasyonu

Derin takviye öğrenme, zengin sensör girişlerini (örneğin, kamera görüntüleri) analiz etmek zor. Ancak, mevcut MARL yöntemleri örnek verimlilikle mücadele eder ve resmi güvenlik garantileri ile öğrenme konusunda bilgi sahibi olmayı sağlar.[Dörtücü ağları kullanarak) dinamikleri tahmin etmek veya sıcak başlangıç optimizasyonu yapmak için kullanılır.

Scalable Algoritmalar çok büyük Swarms için

Yüzlerce veya binlerce ajandan (örneğin, mikro-drones veya robot inşaat için batarmlar), iletişim ve hesaplama son derece hafif olmalıdır. ortalama oyun teorisi, kısmi denklemleri çözmede kontrol problemini azaltır.

İnsan-Swarm Interaction

Çok-ajanlı sistemler insanlarla birlikte dağıtılırken, kontrol stratejileri insan operatörlerinin yakın mesafede yüksek seviyeli komutlar veya çalışmalarını dikkate almalıdır. sezgisel arayüzler ve paylaşılan kontrol şemaları (örneğin, "playback" veya "lead" davranışları) kritiktir.

Robustness ve Formal Verification

Özerk hava taksileri veya cerrahi robotlar gibi güvenlik-köpektif uygulamalar, güvenlik ve yakınlaşmayı uygulamak için uygun bir şekilde kontrol gerektirir. Formal doğrulama:0)Barrier işlevleri) ve [[Döneticileri:2) Kontrol Lyapunov işlevleri[DD)[Döneticileri[Döneticileri güvenlik ve yakınlaştırma için en uygun kontrole entegre edilebilir.

Sonuç olarak, multi-agent sistemlerinin optimal kontrolü, bilgisayar destekli bir alandır, kontrol teorisi, optimizasyon, makine öğrenmesi ve robotik sistemler. temel araçlar - graf teorisi ve dağıtılmış MPC'den MARL'ye kadar - gelişmeye devam edin, giderek daha sofistike kooperatif davranışlarına izin verin.