Проблемы масштабирования оптимальных решений управления в крупных инженерных системах
Понимание оптимального управления в крупных инженерных системах
Оптимальная теория управления обеспечивает строгую основу для разработки политики управления, которая минимизирует или максимизирует заданную функцию затрат с течением времени. В инженерных приложениях эта функция затрат часто представляет потребление энергии, ошибку траектории, тепловое напряжение или системные колебания. Математическая основа основана на динамическом программировании и минимальном принципе Понтрягина, где переменные состояния и управления связаны через дифференциальные уравнения. Например, космический корабль, стремящийся к передаче между орбитами с минимальным использованием топлива, должен решить ограниченную проблему оптимального управления, которая учитывает гравитационные возмущения, ограничения по тяге и временные окна. Аналогично, современная электрическая сеть должна планировать отправку генератора и сброс нагрузки, сохраняя частоту в строгих пределах.
Эти проблемы вычислительно тяготеют в малых масштабах, но становятся неразрешимыми, когда размер системы достигает сотен или тысяч состояний и входов. По мере того, как инженеры продвигаются к более крупным и более взаимосвязанным системам, практические препятствия умножаются. В этой статье рассматриваются наиболее значительные проблемы, с которыми сталкиваются при масштабировании оптимальных решений управления и обзоры стратегий, которые исследователи и практики используют
Ключевые проблемы в масштабировании оптимального контроля
Вычислительная сложность высокоразмерных задач
Проклятие размерности — самый фундаментальный барьер. Классическое динамическое программирование требует хранения функции значения по всему пространству состояний, которое растет экспоненциально с количеством состояний. Роботизированный манипулятор с десятью суставами имеет пространство состояния 20 (положения и скорости). Дискретизация каждого измерения всего в 100 интервалов дает 10020 дискретных состояний, число далеко за пределами любой существующей емкости хранения. Также страдают методы прямой транскрипции, которые дискретизируют как состояния, так и траектории управления: возникающая в результате нелинейная проблема программирования включает в себя десятки тысяч переменных и ограничений для систем умеренного размера.
Даже с современными решателями (например, IPOPT, SNOPT), конвергенция может быть непомерно медленной для приложений реального времени. Для больших аэрокосмических систем, таких как многоступенчатая ракета-носитель, вычислительная нагрузка может превышать несколько часов на кластере, делая онлайн-перепланирование невозможным.
Модельирование Fidelity Versus Tractability
Закон управления, полученный из упрощенной линейной модели, может плохо работать при применении к реальной нелинейной системе. И наоборот, включение каждой физической детали - трения, гистерезиса, температурной зависимости, динамики жидкости - приводит к модели с сотнями состояний и жесткими дифференциальными уравнениями. Решение оптимальной задачи управления для такой модели часто не сходится в приемлемых временных рамках. Общий инженерный ответ заключается в использовании методов сокращения модели, но они вводят ошибки приближения, которые ухудшают эффективность управления. В управлении химическим процессом, например, подробная модель реактора может включать в себя десятки концентраций видов и тепловых балансов.
Сведение его к нескольким слитым состояниям может пропустить важную динамику, такую как горячие точки или медленные дрейфы в активности катализатора. Инженер должен постоянно отменять точность для вычислительной осуществимости, напряжение, которое усиливается по мере роста размера системы.
Вычисления и коммуникации в реальном времени задерживаются
Многие крупные инженерные системы требуют вычисления и применения управляющих действий со скоростью от миллисекунд до секунд. Ветропарк с сотнями турбин должен регулировать шаг лопасти и рыскание в ответ на изменение ветровых паттернов; формирование автономных дронов должно перепланировать траектории по мере появления препятствий. Когда контроллер должен решать большую задачу оптимизации на каждом шаге, время вычислений часто превышает доступный интервал выборки. Это приводит к устаревшим командам управления, которые могут дестабилизировать систему, особенно если динамика быстрая. Кроме того, в распределенных системах связь между локальными контроллерами вносит дополнительные задержки и потери пакетов.
Например, в управлении энергосистемой широкого радиуса действия фазорные единицы измерения отправляют данные центральному контроллеру с различной задержкой. Любая оптимальная стратегия управления, предполагающая мгновенную обратную связь, будет производить команды, которые больше не подходят к моменту их выполнения.
Неопределенность и надежность в масштабе
Оптимальные решения управления обычно получают с использованием детерминированной модели. Реальные крупномасштабные системы подвержены нарушениям - шум датчиков, износ привода, неожиданные неисправности, изменения окружающей среды. Контроллер, оптимальный для номинальной модели, может быть хрупким, когда эти неопределенности присутствуют. Проектирование надежных оптимальных контроллеров (например, с использованием min-max или стохастических формулировок) увеличивает вычислительную нагрузку. В контексте парка роботов доставки, работающих в городской среде, неопределенности в пешеходном движении, деградация батареи и точность GPS должны быть рассмотрены.
Надежный контроль может добавить консерватизм, который снижает производительность, в то время как стохастическая оптимизация может потребовать моделирования Монте-Карло, которое слишком медленно для использования в режиме реального времени.
Стратегии преодоления масштабных барьеров
Модель сокращения и суррогатная модель
Методы редукции модели заменяют модель высокой точности на более низкоразмерное приближение, сохраняющее доминирующую динамику. Правильное ортогональное разложение (POD) широко используется в управлении потоком жидкости: оно извлекает наиболее энергичные режимы из набора снимков и проецирует уравнения Навье-Стокса на подпространство низкого порядка. Сбалансированное усечение сохраняет поведение ввода-вывода и предпочтительнее для линейных систем. Совсем недавно нейронные сети были обучены как суррогатные модели, которые быстро приближают динамику системы. Например, глубокий автокодер может научиться компактному латентному представлению конфигурации роботизированной руки, позволяя решать оптимальную задачу управления в латентном пространстве.
Эти методы могут уменьшить вычисления на порядки величины, но качество уменьшенной модели должно быть тщательно проверено, чтобы избежать ошибок управления в невалидированных областях государственного пространства.
Распределенный и децентрализованный контроль
Вместо решения одной огромной оптимизации система разбивается на более мелкие подсистемы, каждая со своим локальным контроллером. Механизмы координации обеспечивают приблизительное выполнение общих задач. Модель предиктивного управления (MPC) с распределенной оптимизацией успешно применяется для построения климат-контроля, сетей движения и электросетей. В кооперативной распределенной схеме MPC каждая подсистема решает свою локальную проблему и затем передает небольшой набор переменных связи своим соседям. Алгоритм итерируется до конвергенции.
Этот подход изящно масштабируется, поскольку локальные проблемы малы и могут решаться параллельно. Основной задачей является проектирование топологии связи и обеспечение стабильности и конвергенции при наличии задержек и потерь пакетов. Для больших автопарков автономных транспортных средств распределенный метод аукциона может назначать задачи при соблюдении индивидуальной динамики транспортного средства.
Приблизительное динамическое программирование и обучение с подкреплением
Приблизительное динамическое программирование (ADP) использует функциональные аппроксиматоры (нейронные сети, базовые функции) для представления функции ценности или политики, избегая необходимости явного динамического программирования на основе сетки. Расширенные алгоритмы, критикующие действия, могут обучать политику офлайн на смоделированных данных, а затем настраивать онлайн. Глубокое обучение усилению (DRL) показало обещание для управления 100-турбинной ветровой электростанцией для максимизации общей выходной мощности при минимизации усталостных нагрузок. Централизованный агент DRL может обрабатывать агрегированные данные датчиков и точки выхода для каждой турбины. Однако DRL часто требует миллионов взаимодействий и тщательного формирования вознаграждения; его устойчивость к сценариям распределения остается проблемой.
Комбинирование ADP с модельным планированием (например, использование изученной модели динамики для онлайн MPC) является активным направлением исследований, которое может обеспечить как эффективность, так и безопасность.
Параллельные вычисления и специализированное оборудование
Современные высокопроизводительные вычисления (HPC) позволяют решать масштабные задачи оптимального управления путем параллелизации алгоритма оптимизации. Например, решение задачи прямой транскрипции можно ускорить путем распределения оценки якобианцев и гессенцев по нескольким графическим процессорам. Итерации в реальном времени (RTI) для нелинейных MPC используют один последовательный квадратичный шаг программирования на интервал выборки; при тщательной параллелизации можно достичь скорости сотен герц для систем с несколькими десятками состояний. Полевые программируемые затворные массивы (FPGA) обеспечивают еще более низкую задержку, реализуя всю оптимизацию в аппаратном обеспечении. В продвинутых системах помощи водителю FPGA решают квадратичные программы для удержания полосы движения и предотвращения столкновений в микросекундах.
Растущая доступность облачных вычислений также позволяет выгружать тяжелые вычисления из контролируемой системы, хотя задержка и надежность должны управляться.
Иерархический и многомасштабный контроль
Большие системы часто демонстрируют динамику на нескольких временных масштабах. Иерархическая архитектура управления присваивает быстрые локальные петли для обработки высокочастотных возмущений, в то время как более медленный верхний слой выполняет оптимальное планирование. Это разделение снижает размерность оптимизации каждого слоя. Например, в микросети локальные контроллеры сбрасывания стабилизируют напряжение и частоту в суб-второй шкале, в то время как надзорный MPC запланирует зарядку батареи и отправку генератора каждые несколько минут. Верхний слой может использовать упрощенную модель динамики замкнутого цикла нижнего уровня.
Иерархический контроль широко используется в управлении промышленными процессами (например, операции на нефтеперерабатывающем заводе) и был расширен до сетевых многоагентных систем (например, парк роботов, где планировщик присваивает точки пути и бортовой контроллер каждого робота отслеживает их).
Тематические исследования и приложения
Аэрокосмическая траектория оптимизации
Космические агентства давно борются с масштабированием оптимального управления для ракет-носителей и планетарных посадочных аппаратов. Посадка на Луну включает в себя нелинейную модель с дроссельной заслоной, подвеской и ограничениями местности. Традиционные прямые методы многократной съемки требуют решения большой нелинейной программы. Используя сокращение модели (например, пренебрегая гибкими режимами тела во время трансляционной фазы) и распределенные вычисления, проблема может быть решена менее чем за секунду с современными бортовыми компьютерами. Такие компании, как SpaceX, используют руководство в реальном времени, которое повторяется на модели с уменьшенным порядком, обновляя траекторию по мере поступления данных датчиков.
Внешний ресурс: Обследование оптимального управления в реальном времени для аэрокосмических транспортных средств .
Smart Grid частотный контроль
По мере роста проникновения возобновляемых источников энергии инерция энергосистемы снижается, что делает регулирование частоты более сложным. Оптимальное управление многими распределенными энергетическими ресурсами (батареями, солнечными инверторами, откликом спроса) является масштабной проблемой. В пилотных проектах были протестированы методы распределенных MPC: контроллер каждого домохозяйства управляет собственной батареей при обмене прогнозируемым чистым потоком энергии с соседними домами. Центральный агрегатор координирует через консенсусный алгоритм. Продемонстрирован подход к снижению отклонений частоты на 30% по сравнению с обычным контролем сбрасывания, при соблюдении ограничений пропускной способности связи.
Далее см.: IEEE Transactions on Power Systems статьи по распределенному управлению.
Автономные автопарки
Координация парка автономных автомобилей, перемещающихся по городу, требует решения тысяч связанных с этим оптимальных задач управления (каждое транспортное средство решает ускорение и рулевое управление, чтобы минимизировать время в пути, избегая столкновений). Централизованное решение неразрешимо; вместо этого реализовано распределенное MPC с ограничениями на предотвращение столкновений. Каждое транспортное средство сообщает свой предполагаемый путь за короткий горизонт (например, 2 секунды) и контроллеры итерируют, чтобы найти бесконфликтные траектории. Для снижения вычислительной нагрузки транспортные средства используют упрощенные кинематические модели и полагаются на контроллер обратной связи низкого уровня для отслеживания запланированного пути. Экспериментальные результаты от DARPA Urban Challenge показали, что этот подход может обрабатывать десятки транспортных средств в режиме реального времени.
Однако масштабирование до сотен транспортных средств в условиях интенсивного движения остается открытой областью исследований, что побуждает исследования иерархического планирования, которое объединяет потоки, а не отдельные транспортные средства.
Новые тенденции и будущие направления
Машинное обучение – расширенный оптимальный контроль
Методы, основанные на данных, все чаще используются для изучения системной динамики, моделей неопределенности и даже законов оптимального управления непосредственно из данных. Гауссовские модели процесса (GP) обеспечивают вероятностные прогнозы, которые могут быть встроены в MPC для учета неопределенности модели. В робототехнике изученные остаточные модели, правильные для немоделированных трений или аэродинамических эффектов, позволяющие одному и тому же оптимальному контроллеру работать в различных условиях. Нейронные обычные дифференциальные уравнения (нейронные ОДЭ) предлагают гибкий способ изучения динамики непрерывного времени, которые могут быть интегрированы в оптимальную структуру управления. Задача заключается в обеспечении стабильности, когда эти изученные компоненты не могут обобщить.
Для решения этой проблемы разрабатываются формальные инструменты проверки, такие как анализ Ляпунова для контроллеров нейронных сетей.
Облачные и граничные вычисления для управления в реальном времени
Конвергенция облачных вычислений и связи 5G позволяет выполнять некоторые оптимальные вычисления управления удаленно, в то время как периферийные устройства выполняют задачи с низкой задержкой. Для крупной ветряной электростанции облако может выполнять оптимизацию в масштабах фермы каждые несколько минут, в то время как локальный контроллер каждой турбины выполняет команды с частотой лопасти на 10 Гц на основе последней точки набора. Это подразделение снижает затраты на оборудование на месте и позволяет использовать более сложные алгоритмы оптимизации. Однако зависимость от связи вводит уязвимости для кибератак и сбоев в сети. Легкая аутентификация и резервное копирование локальных контроллеров имеют важное значение.
Формальные методы и гарантии безопасности
Масштабирование оптимального управления также означает масштабирование проверки того, что контроллер ведет себя безопасно при всех правдоподобных условиях. Анализ достижимости, контрольные барьерные функции и программирование с суммой квадратов обеспечивают инструментальные цепочки для подтверждения того, что политика управления позволит избежать небезопасных состояний. Для крупных систем эти методы становятся дорогостоящими, но недавний прогресс в композиционном рассуждении - разбивка доказательства безопасности на доказательства меньшего уровня компонентов - показывает перспективу. Сочетание оптимального управления (для производительности) и барьерных функций (для безопасности) является активной областью, с приложениями в автоматизированном вождении и взаимодействии человека и робота.
Заключение
Масштабирование оптимальных решений управления для крупных инженерных систем остается серьезной проблемой, обусловленной вычислительной сложностью, компромиссами в моделировании точности, ограничениями в реальном времени и неопределенностью. Тем не менее, область быстро продвигается благодаря сочетанию сокращения моделей, распределенных архитектур, приближенного динамического программирования, параллельных вычислений и иерархического управления. Успехи в аэрокосмической отрасли, энергетических системах и робототехнике показывают, что эти стратегии могут производить контроллеры, которые являются эффективными и надежными. По мере того, как машинное обучение и граничные вычисления созревают, границы того, что может быть решено в Интернете, будут продолжать расширяться. Инженеры и исследователи должны тщательно выбирать и комбинировать методы, основанные на конкретной динамике системы, задачах производительности и доступных вычислительных ресурсах.
Погоня за масштабируемым оптимальным управлением является не просто академическим упражнением - это необходимо для использования полного потенциала сложных, взаимосвязанных инженерных систем в ближайшие десятилетия.