Trafik İşareti Gerçek zamanlı Olarak Üretilmesi için Dondurma Öğrenmesinin Kullanımı

Giriş: Kentsel Kongestasyon ve Adaptive Control Sözlüğü

Trafik sıkışıklığı, modern şehir yaşamının belirleyici bir meydan okuması haline geldi.ŞUygunluk süresine göre, 2023 INRIX Global Trafik Puanı kartı), ABD'deki sürücüler, programsız programlarda ortalama 51 saat kaybettiler - doğal olarak sertleşen araçların maliyetinin düşmesine yardımcı oldu.

Statik kurallara veya manuel ayarlanan parametrelere güvenmek yerine, sinyal zamanlamalarını sürekli olarak gözlemleyin ve ortalama gecikme, kuyruk uzunluğu ve yoldaki ölçümler için optimize etmek için sonuçları öğrenin.Bu makale, trafik sinyal zamanlamalarına, temel mekanizmalarına, gerçek dünya yararlarına, mevcut engelleri ve yol önünde.

Dondurucu Öğrenme Nedir? Derin Bir Dive

Onun özünde, takviye öğrenme, bir çevre ile etkileşim yoluyla optimal davranışları öğrenmek için bir çerçevedir. Ajan - bu durumda, trafik sinyal kontrolörü - her eylemden sonra, ajan sayısal bir ödül alır (pozitif veya negatif) ve birçok bölüm üzerinden, ajanlar bir politika öğrenir - bu durumdaki eylemlere haritalar.

Formal olarak, RL genellikle bir Markov Kararı Süreci (MDP), bir dizi devlet, eylem, geçiş olasılıkları ve ödüller tarafından tanımlanmaktadır. Key RL paradigmaları şunları içerir:

Derin RL'de dalgalanma - RL algoritmaları ile mikro ağ - özellikle de London'da trafik kontrolü için yüksek boyutlu devlet alanları, trafik kameralarından veya kontrase sensör verilerini yüzlerce kanaldan azaltabilecek şekilde ortaya çıkabilir. Landmark, Londra'da trafik sinyali kontrolü için incelenebilir.).

Nasıl Dondurulur Öğrenme Trafik İşareti Timing

Bir RL tabanlı trafik sinyali kontrol sistemi sürekli olarak [[0)Teptiflik → aksiyon → ödül → öğrenme) . Her bir kesişiminde, sistem mevcut [Dönemli DÜDÜDÜyeler[DÜye Olmayanlar: 2 )

Bu duruma dayanarak, ajan bir İLDİT:0) bir uyarıyı seçer;[Dönetici:) Mevcut yeşil aşamayı genişletmek, farklı bir aşamaya geçmek veya tüm kontrollü bir kesinti aralığı tanıtmak.[DÜye göre:2reward) sinyal, sistemin hedeflerini yansıtacak şekilde tasarlanmıştır.

Binlerce simdi veya gerçek yaşam bölümü, RL ajanı iç parametrelerini ayarlar (örneğin, bir nöral ağ ağırlığı) beklenen kümülatif ödülü en üst düzeye çıkarmak için. Crucially, sistem sadece sabit bir program değil, aİLMİŞT:0)kontext-bağımlı politikası: bir stadyum olayından gelen trafikte, ajan etkilenen yaklaşıma daha yeşil zaman ayıracaktır, ancak geç geceler boyunca, gereksiz durmaları için daha kısa sürede daha kısa sürede tercih eder.

Uygulamada Devlet Tasarımı

Bir RL ajanının kalitesi, devletin nasıl temsil edildiğine bağlıdır. “kökez” ve “zamanları” gibi ayrı kavramlar sayısal özelliklere kodlanmalıdır. Gelişmiş uygulamalar dahil olmak üzere [[Dönetici ağları) kesişir ve bağlantı kurmak için, bir ağdaki uzaysal ilişkiler hakkında bir şekilde neden olma izin verir. Örneğin, bir kesişen trafik bilgilerini toplayan koordineli ve alt komşulardan alabilir.

Action Spaces: Discrete vs. Sürekli

Erken RL trafik sistemleri ayrık eylemler kullandı - örneğin, dört olası faz dizilerinden birini seçerek, modern yaklaşımlar genellikle doğru şekilde kullanılabilir:0)Dönemli aksiyon alanları), her aşamada aracı doğrudan teslim eder.[Döneticileri kontrol eder ve trafik yüklerinde ince varyasyonlara adapte edebilir. Politika gradient yöntemleri özellikle de burada etkili olabilir çünkü gerçek değerli zamanlarını tespit edebilir.

Çok-Agent ve Hierarchical RL

Şehir çapındaki ağlara RL'nin her bir kesişimdeki bağımsız ajanlardan daha fazlasını gerektirir. koordineli ajanlar çatışma politikaları yaratabilir - bir ajan aşağılayıcı ajan bir şişe kare yaratır.[Döneticileri ele almak için:0) Çok-yaratıcı bir takviye öğrenme (MARL)[FLT 1: 1 ), ajanlar bilgi paylaşımını veya kooperatif politikalarını yönetebilir. Örneğin, [[)

Trafik İşaretleri için Güçlendirme Öğrenmesinin Temel Faydaları

Geleneksel sabit zaman veya eylem kontrolü üzerindeki RL avantajları çoktur ve her iki simülasyon ve saha denemesinde de doğrulanmıştır.

Adaptasyon ve Gerçek Zamanlı Yanıt

Pre-timed kontrolörlerinin aksine, RL ajanları dinamik olarak gerçek zamanlı koşullara uyum sağlarlar. Konserler, kazalar veya hava ile ilgili yavaşlar gibi özel olaylara cevap verebilirler, manuel müdahale olmadan.Bir pilot projede SURTRAC sistemini kullanarak ).

Azaltma ve Gecikmeler

RL toplam gecikme ve kuyruk uzunluğu gibi metrikleri optimize eder, sürekli olarak 30 simdili senaryoda ortalama gecikme azaltımı elde etti.In real-world deployments in Zhong Control:0)Transportasyon Araştırma Bölüm C), RL tabanlı sistemlerin 30 $ gecikmeli senaryolarda ortalama 18 artış elde ettiğini tespit etti.In real-world deployments in city deployments in the Lenovo, adaptive RL kontrolörleri kesimler% 30 oranındaki yüksek hız hız hız hız hızlarını kesti.

Çevre ve Ekonomik Faydalar

Daha az boş yakıt tüketimi ve emisyonlar anlamına gelir. ABD Enerji Bakanlığı, uyarlanabilir sinyal kontrolünin yakıt tüketimini yoğun olarak kentsel ağlarda% 15'e kadar azaltabileceğini tahmin ediyor. RL, örneğin emisyonla ilgili ödüller için aktif olarak optimize ederek bunu daha da hızlandırıyor.

Scalability and Transferability

Bir RL politikası simülasyonda eğitilmiş olduğunda, genellikle ince ayarlı ve benzer kesişimlerde minimum yeniden yapılandırma ile dağıtılabilir. Bu ölçeklenebilirlik, her yer için geniş bir kalibrasyon gerektiren manuel olarak ayarlanabilir sistemler üzerinde büyük bir avantajdır.

Meydanlar ve Sınırlar

Sözcülüğe rağmen, ölçekde trafik sinyali kontrolü için RL dağıtma önemli engellerle karşı karşıya.

Data and Sensör Gereksinimler

RL ajanlar yüksek frekanslı, güvenilir gözlemler gerektirir. Çoğu şehir kapsamlı sensör kapsamı yoksundur; döngü dektörler, hava veya aydınlatma ile karşı karşıya kalabilirler. Simated eğitim kısmen telafi edilebilir, ancak bu boşluk genellikle alan rastgeleleştirme teknikleri veya online iyileştirici boşluklar gerektirir).

Güvenlik ve Robustness

Trafik sinyalleri, yaşamsal güvenlik sonuçları vardır. Bir RL ajanı, yanlış bir eylem yapar - erkenden bir yaya yürüyüş aşamasına ya da çelişkili şeritler için kırmızıları yeniden başlatır - öğrenme ve dağıtım sırasında güvenliği sağlamak.

C ⁇ ve İletişim Overhead

Deep RL modelleri, özellikle de milyonlarca parametre ile sinir ağları kullananlar, her iki eğitim için önemli işlem kaynakları gerektirir ve dikkatsizlikte her birkaç saniye boyunca, yüzlerce kesişim gücü ile kenar cihazları talep eder. Ek olarak, çok-ajanlı koordinasyon, kontroller arasında düşük ücretli iletişime dayanır, bu da miras altyapıda kullanılabilir. Cloud tabanlı çözümler, ağ kesintilerini ve kırılganlığı ağ kesintiye uğratabilir.

Yorumlama ve Güven

Ulaşım mühendisleri ve şehir yetkilileri genellikle siyah-box AI sistemlerinin savaşını yapıyor. Bir RL ajanının neden özel bir sinyal zamanlamasının zor olduğunu anlamak, ancak ajan yeşil bir onay için gerekli olduğunu ortaya çıkarabilir.

Future Yol ve Gelişen Araştırma

Alan hızla gelişmektedir. Birçok umut verici avenues, mevcut sınırlamaların üstesinden gelmek için araştırılıyor.

Araçla entegrasyon-Her Şey (V2X) İletişim

Bağlantılı araçlar pozisyonlarını, hızlarını ve gerçek zamanlı olarak hedeflerini yayınlayabilirler. RL ajanları bu RL'yi önceden tahmin etmek için kullanabilir, bireysel trajektörler için hesapların proaktif sinyal zamanlamasını sağlar.İlk çalışma:0. Michigan'ın V2X test yatak , V2X veri kesiştiğine göre % 35 oranında indirimi %35 azaltılabilir.

Model tabanlı RL ve Hybrid Architectures

Pure model-free RL genellikle uygulama için bir model-onarımdan önce milyonlarca etkileşim gerektirir. Model tabanlı RL, bu da basitleştirilmiş bir ortam modeli ve içinde planlar, gerçek dünya eğitim verilerinin elde edilmesi için tahmin için sayısal bir model oluşturan örnek karmaşıklığı dramatik bir şekilde azaltabilir.

Edge AI ve Federated Learning

Uzak cihazlarda RL (örneğin, her trafik kabinine bağlı bir Raspberry Pi veya bir NVIDIA Jetson) bulut bağımlılığını ortadan kaldırır ve geçncy azaltır. Federated learning, çoklu kenar ajanlarının, merkezileştirilmiş ham trafik verileri olmadan ortak bir modele çalışmasını sağlar, bu yaklaşım özellikle sıkı veri yönetimi politikaları ile şehirler için caziptir.

Transfer Öğrenme ve Meta-Learning

Her bir kesişimten eğitim yerine, transfer öğrenimi, benzer geometri ve trafik modelleriyle bir başka bir bağlantıdan bir politikayı yeniden tasarlayabilir. Meta-öğrenme (öğrenme) bunu daha ileri sürer: bir ajan onlarca tür simdi kesişen kesişen kesişen kesişen kesişen kesişen kesişen kesişen kesişen kesişen bir kavim boyunca eğitilir.

İnsan-in-Loop ve Oversight Systems

Güvenlik endişelerini ele almak için, gelecekteki sistemler, gerekli olduğunda aşırı RL eylemleri yapabilen bir insan operatörü içerebilir. Gelişmiş kullanıcı arayüzleri, ajanın nedenlerini görselleştirecek (örneğin, farklı eylemler altında trafik evrimi tahmin etti) ve mühendislere yumuşak kısıtlamalar ayarlamalarına izin verebilir.

Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç

Dondurma öğrenme trafik sinyal zamanlamasında bir paradigma değişikliği temsil eder - statik programlardan ve basit reaktif kurallardan, sürekli olarak geliştirilen verilere yönelik politikalara kadar. Simülasyonlardan, pilot projelerden ve erken dağıtımlardan gelen kanıtlar zorlayıcıdır: RL gecikmeleri azaltabilir, emisyonları azaltabilir ve kentsel ulaşım ağlarının genel verimliliğini artırabilir. Ancak, yaygın olarak kabul edilen yol, verilerin kalitesi, güvenlik, hesaplama talepleri ve yorumlanabilirliği çevreleyen zorluklarla tamamlanmıştır.

Araştırma ilerledikçe -özellikle çok-ajanlı koordinasyon, model tabanlı öğrenme ve bağlantılı araçlarla entegrasyon - engeller sürekli olarak daha düşük oluyor. Bugün gerekli sensör altyapısına yatırım yapan şehirler, kenar bilişim yetenekleri ve RL uzmanlığı gerçekten akıllı trafik kontrolü ödülleri elde etmek için iyi bir şekilde tahsis edilecek.