Использование обучения с подкреплением для оптимизации времени сигнала трафика в режиме реального времени
Введение: городские заторы и обещание адаптивного контроля
Заторы на дорогах стали определяющей проблемой современной городской жизни. Согласно Глобальной карте показателей движения INRIX (2023), водители в Соединенных Штатах теряли в среднем 51 час в год из-за заторов, что стоило экономике более 81 миллиарда долларов. Помимо потраченного времени, автомобили на холостом ходу производят непропорциональное количество вредных выбросов, ухудшают качество воздуха и способствуют шумовому загрязнению. Традиционные контроллеры дорожных сигналов с фиксированным временем - те, которые работают по заранее запрограммированным графикам - по своей сути жесткие, неспособные реагировать на колебания спроса в режиме реального времени. По мере роста городов и развития моделей путешествий потребность в интеллектуальном, адаптивном управлении дорожными сигналами никогда не была более насущной.
Усиление обучения (RL), подполе машинного обучения, которое учит агентов принимать последовательные решения методом проб и ошибок, предлагает убедительное решение. Вместо того, чтобы полагаться на статические правила или настроенные вручную параметры, системы на основе RL постоянно наблюдают за условиями движения, выбирают время сигнала и учатся на результатах для оптимизации таких показателей, как средняя задержка, длина очереди и пропускная способность. В этой статье рассматривается, как RL развертывается для революционизации времени сигнала трафика, лежащих в основе механизмов, реальных преимуществ, текущих препятствий и пути вперед.
Что такое обучение с подкреплением?
По своей сути, обучение подкреплению является основой для обучения оптимальному поведению посредством взаимодействия с окружающей средой. Агент — в данном случае контроллер сигнала трафика — предпринимает действия, которые изменяют состояние окружающей среды. После каждого действия агент получает численное вознаграждение (позитивное или отрицательное) и переходит в новое состояние. Во многих эпизодах агент изучает политику — отображение из состояний в действия — которая максимизирует совокупное вознаграждение.
Формально RL часто моделируется как процесс принятия решений Марковым (MDP), определяемый набором состояний, действий, вероятностей перехода и вознаграждений.
- Безмодельный RL (например, Q-обучение, Deep Q-Networks): Агент непосредственно изучает функцию или политику ценности без явного моделирования динамики окружающей среды.
- Модельный RL: Агент сначала изучает модель окружающей среды (например, как изменяются потоки трафика в ответ на изменения сигнала), а затем использует эту модель для планирования действий.
- Методы градиента политики (например, PPO, A2C): Они непосредственно оптимизируют политику, регулируя вероятности действия на основе опытных вознаграждений. Они естественным образом обрабатывают непрерывные пространства действия и часто используются в сложных настройках с несколькими агентами.
Всплеск глубокого RL — объединение нейронных сетей с алгоритмами RL — был особенно преобразующим. Глубокие нейронные сети могут аппроксимировать высокоразмерные пространства состояний, такие как необработанные видеопотоки от камер трафика или агрегированные данные датчиков от сотен детекторов. Landmark работает как Исследование DeepMind по RL для управления сигналом трафика в Лондоне продемонстрировало, что глубокие RL-агенты могут превзойти обычные адаптивные системы, уменьшая средние задержки до 15% в часы пик.
Как обучение с подкреплением оптимизирует время сигнала трафика
Система управления сигналом трафика на основе RL работает в непрерывном цикле наблюдения , который включает в себя: действие → вознаграждение → обучение . На каждом перекрестке система контролирует текущее состояние , которое может включать:
- Количество автомобилей, ожидающих в каждой полосе (длина очереди)
- Время, прошедшее с момента последнего изменения фазы
- Скорость и заполняемость приближающихся транспортных средств
- Запросы на пешеходные переходы
- Время суток и исторические закономерности
На основании этого состояния агент выбирает действие : он может выбрать продление текущей зеленой фазы, переключаться на другую фазу или ввести интервал полного красного зазора. Сигнал вознаграждения предназначен для отражения целей системы. Типичные функции вознаграждения наказывают время ожидания, количество остановок и длину очереди, одновременно вознаграждая пропускную способность и прогрессию транспортного средства. Например, общее вознаграждение — отрицательная сумма длины очереди во всех подходах, поощряя агента уменьшать заторы.
Более тысячи смоделированных или реальных эпизодов агент RL корректирует свои внутренние параметры (например, вес нейронной сети) для максимизации ожидаемого совокупного вознаграждения. Важно отметить, что система изучает не только фиксированный график, но и контекстно-зависимую политику: во время внезапного всплеска трафика от события на стадионе агент спонтанно выделяет больше зеленого времени на затронутый подход, тогда как в поздние ночные часы он может способствовать более коротким циклам, чтобы минимизировать ненужные остановки.
Государственный дизайн на практике
Качество RL-агента сильно зависит от того, как представлено состояние. Дискретные понятия, такие как «очереди» и «время ожидания», должны быть закодированы в численные функции. Расширенные реализации включают графовые нейронные сети , чтобы моделировать топологию пересечений и коридорного подключения, позволяя агенту рассуждать о пространственных отношениях по сети. Например, состояние на пересечении может включать агрегированную информацию о трафике от соседей вверх и вниз по течению, позволяя координировать действия, предотвращающие затор.
Пространства действия: дискретные vs. непрерывные
Ранние RL-системы трафика использовали дискретные действия — например, выбор одной из четырех возможных фазовых последовательностей. Однако современные подходы часто используют непрерывные пространства действия, где агент непосредственно выводит продолжительность для каждой фазы. Это обеспечивает более тонкое управление и может адаптироваться к тонким изменениям нагрузки трафика. Методы градиента политики особенно эффективны здесь, потому что они могут выводить реальные значения длительности. Исследование 2022 года из IEEE Транзакций на интеллектуальных транспортных системах показало, что RL непрерывного действия сократил среднее время в пути на 22% по сравнению с исходными линиями дискретного действия в моделируемой сети 16-пересечения.
Многоагентный и иерархический RL
Масштабирование RL до сетей общегородского масштаба требует больше, чем независимые агенты на каждом перекрестке. Некоординированные агенты могут создавать конфликтующие политики - один агент расширяет зеленую фазу, в то время как агент нисходящего потока создает узкое место. Для решения этой проблемы исследователи разработали структуры многоагентного обучения усилению (MARL) , где агенты обмениваются информацией или изучают кооперативные политики. Например, в алгоритме CoLight агенты на соседних перекрестках обмениваются представлениями скрытого состояния, позволяя глобальную координацию. Иерархический RL далее разлагает проблему: агент высокого уровня решает общую длину цикла, в то время как агенты низкого уровня управляют решениями фазового нажатия в этом цикле.
Ключевые преимущества обучения усилению для дорожных сигналов
Преимущества RL перед традиционным управлением с фиксированным временем или приводом в действие многочисленны и были подтверждены как в имитационных, так и в полевых испытаниях.
Адаптивный и реальный ответ
В отличие от контроллеров с предварительным временем, агенты RL динамически адаптируются к условиям реального времени. Они могут реагировать на специальные события, такие как концерты, аварии или замедления, связанные с погодой, без ручного вмешательства. В пилотном проекте в Питтсбурге с использованием системы SURTRAC адаптивное управление на основе RL сократило время в пути на 25% и время ожидания на 40% по сравнению с исходным уровнем фиксированного времени.
Снижение заторов и задержек
Поскольку RL оптимизирует такие показатели, как общая задержка и длина очередей, он последовательно превосходит логику, основанную на правилах. Всесторонний обзор, опубликованный в Transportation Research Part C, показал, что системы на основе RL достигли медианного улучшения на 18% в среднем сокращении задержки в 30 смоделированных сценариях. В реальных развертываниях в таких городах, как Ханчжоу, Китай, адаптивные контроллеры RL сокращают длину очередей пиковых часов на 30%.
Экологический и экономический выигрыш
Меньше холостого хода означает более низкий расход топлива и выбросы. По оценкам Министерства энергетики США, адаптивный контроль сигнала может снизить потребление топлива до 15% в плотных городских сетях. RL делает это дальше, активно оптимизируя вознаграждения, связанные с выбросами. Например, RL-агент может быть обучен минимизации совокупных выбросов CO2 и NOx, отдавая предпочтение сигнальным таймингам, которые уменьшают остановку и движение. Эти преимущества напрямую приводят к экономии затрат для городов и улучшению общественного здравоохранения.
Масштабируемость и переносимость
После того, как политика RL обучена моделированию, она часто может быть настроена и развернута на аналогичных перекрестках с минимальной реконфигурацией. Эта масштабируемость является основным преимуществом перед настроенными вручную адаптивными системами, которые требуют обширной калибровки для каждого местоположения. Кроме того, модели RL могут включать дополнительные источники данных, такие как траектории подключенных транспортных средств или GPS мобильного телефона, для дальнейшего повышения производительности без аппаратных капитальных ремонтов.
Проблемы и ограничения
Несмотря на свои обещания, развертывание RL для управления сигналами трафика в масштабе сталкивается со значительными препятствиями.
Требования к данным и датчикам
RL-агенты требуют высокочастотных, надежных наблюдений. Большинство городов не имеют полного охвата датчиками; детекторы петли могут быть редкими или устаревшими, а камеры могут быть затронуты погодой или освещением. Имитируемое обучение может частично компенсировать, но симулированный разрыв между изображениями и реальными изображениями остается проблемой. Агент, обученный идеальному моделированию, может потерпеть неудачу, столкнувшись с реалистичным шумом датчика, окклюзией или редкими крайними случаями, такими как аварийные транспортные средства. Для преодоления этого разрыва часто требуются методы рандомизации домена или онлайн-тренировки с человеческим надзором.
Безопасность и надежность
Сигналы движения имеют последствия для безопасности жизни. Ошибочное действие агента РЛ, например преждевременное прекращение пешеходной прогулки или чередующиеся красные для противоречивых полос движения, может привести к несчастным случаям. Обеспечение безопасности во время обучения и развертывания имеет первостепенное значение. Подходы включают:
- Безопасный RL: Включение ограничений в процесс оптимизации (например, с помощью методов Лагранжа) для гарантии того, что определенные пороги (например, максимальное красное время) никогда не нарушаются.
- Развертывание в теневом режиме : где рекомендации агента RL сначала сравниваются с безопасным резервным копированием на основе правил перед выполнением.
- Формальная проверка: использование математических инструментов для доказательства того, что изученная политика не приведет к возникновению небезопасных состояний в рамках данной модели окружающей среды.
Вычислительные и коммуникационные накладные расходы
Модели Deep RL, особенно использующие нейронные сети с миллионами параметров, требуют значительных вычислительных ресурсов как для обучения, так и для вывода. Запуск вывода каждые несколько секунд на сотнях пересечений требует периферийных устройств с достаточной вычислительной мощностью. Кроме того, координация с несколькими агентами опирается на связь с низким временем ожидания между контроллерами, которая может быть недоступна в устаревшей инфраструктуре. Облачные решения вводят задержку и уязвимость к отключениям сети.
Интерпретируемость и доверие
Инженеры транспорта и городские чиновники часто настороженно относятся к системам искусственного интеллекта с черным ящиком. Понимание того, почему агент RL выбрал определенное время сигнала, сложно, но доверие необходимо для одобрения. Недавние исследования в объяснении RL направлены на создание карт заметности или контрфактических объяснений, которые подчеркивают, какие особенности движения повлияли на решение. Например, объяснение может показать, что агент расширил зеленую фазу, потому что он предсказал высокую вероятность прибытия взвода транспортных средств, приближающихся с боковой улицы.
Будущие направления и новые исследования
В настоящее время ведется работа по изучению нескольких перспективных направлений для преодоления существующих ограничений.
Интеграция с системой связи Vehicle-to-Everything (V2X)
Подключенные транспортные средства могут транслировать свое положение, скорость и назначение в режиме реального времени. Агенты RL могут использовать эти гранулированные данные для прогнозирования моделей движения на секунды вперед, что позволяет использовать упреждающее время сигнала, которое учитывает индивидуальные траектории. Ранняя работа из Университета Мичигана V2X на испытательном стенде показала, что RL с данными V2X уменьшил задержку пересечения на 35% по сравнению с входами только для зрения.
Модельные RL и гибридные архитектуры
Чистая модель без RL часто требует миллионов взаимодействий, прежде чем слиться. Модель на основе RL, которая изучает упрощенную модель среды и планы внутри нее, может значительно снизить сложность выборки. Гибридные архитектуры, которые сочетают изученную модель для прогнозирования с политикой без модели для выполнения, показывают самые современные результаты в таких тестах, как CARLA ] тренажер трафика. Эти методы могут сделать RL возможным для развертывания, где реальные данные обучения ограничены или дороги для приобретения.
Edge AI и федеративное обучение
Запуск RL-вывода на периферийных устройствах (например, Raspberry Pi или NVIDIA Jetson, прикрепленный к каждому блоку трафика) устраняет облачные зависимости и уменьшает задержку. Федеративное обучение позволяет нескольким периферийным агентам совместно обучать общую модель без централизации исходных данных трафика, сохраняя конфиденциальность. Этот подход особенно привлекателен для городов со строгими политиками управления данными.
Трансфертное обучение и мета-обучение
Вместо того, чтобы обучать каждый перекресток с нуля, обучение передаче может перепрофилировать политику с одного перекрестка на другой с аналогичной геометрией и шаблонами трафика. Мета-обучение (обучение для изучения) требует этого: агент обучается на десятках смоделированных перекрестков, чтобы он мог адаптироваться к новому перекрестку с помощью всего нескольких минут живых данных. Это резко сокращает время калибровки, необходимое для новых развертываний.
Системы человек-в-петле и надзора
Для решения проблем безопасности будущие системы могут включать в себя оператора-человека, который может переопределять действия RL, когда это необходимо. Расширенные пользовательские интерфейсы будут визуализировать рассуждения агента (например, прогнозируемую эволюцию трафика при различных действиях) и позволят инженерам устанавливать мягкие ограничения. Со временем, поскольку система доказывает свою надежность, уровень ручного надзора может быть снижен.
Заключение
Обучение с подкреплением представляет собой сдвиг парадигмы в сроках сигнала трафика - от статических графиков и простых реактивных правил до адаптивных, основанных на данных политик, которые постоянно совершенствуются. Доказательства моделирования, пилотных проектов и ранних развертываний убедительны: RL может сократить задержки, сократить выбросы и повысить общую эффективность городских транспортных сетей. Тем не менее, путь к широкому внедрению проложен с проблемами, связанными с качеством данных, безопасностью, вычислительными требованиями и интерпретацией.
По мере развития исследований, особенно в области координации с несколькими агентами, обучения на основе моделей и интеграции с подключенными транспортными средствами, эти барьеры неуклонно снижаются. Города, которые сегодня инвестируют в необходимую сенсорную инфраструктуру, возможности граничных вычислений и опыт RL, будут хорошо расположены, чтобы пожинать плоды действительно интеллектуального управления движением. Видение города, где движение течет плавно, несмотря на колеблющийся спрос, не является отдаленной утопией; это все более достижимая цель, одна зеленая волна за раз.