Применение нейронных сетей в нелинейных задачах управления
Введение в нейронные сети в нелинейном контроле
Нелинейные проблемы управления пронизывают современную инженерию в робототехнике, аэрокосмической, автомобильной, перерабатывающей промышленности и автономных системах. В отличие от линейных систем, выход нелинейной системы не пропорционален ее входу и не имеет суперпозиции. Эта присущая сложность делает традиционные методы линейного управления, такие как PID или контроллеры обратной связи состояния, неадекватными или даже нестабильными, когда они применяются за пределами узкой области работы. За последние два десятилетия искусственные нейронные сети (ANN) появились в качестве преобразующего инструмента для решения этих проблем, используя их универсальное приближение функций и возможности обучения непосредственно из данных.
Нейронные сети особенно привлекательны, потому что они могут моделировать произвольно сложные нелинейные отображения, не требуя явных математических моделей системы. Это важно, когда базовая физика плохо понята, сильно неопределенна или изменяется во времени. Изучая динамику системы в Интернете или в автономном режиме, контроллеры на основе нейронных сетей могут адаптировать, обобщать и поддерживать производительность там, где обычные методы терпят неудачу. Эта статья обеспечивает углубленное изучение того, как нейронные сети применяются к нелинейным проблемам управления, охватывающим архитектуры, стратегии, методы обучения, реальные приложения и открытые проблемы, которые стимулируют текущие исследования.
Основы нелинейного управления и почему нейронные сети?
Сложность нелинейных систем
Нелинейные системы демонстрируют поведение, такое как несколько точек равновесия, предельных циклов, бифуркации и хаос.Цели управления, такие как стабилизация, отслеживание и отклонение возмущений, становятся намного сложнее, потому что реакция системы изменяется с условиями работы. Классический линейный контроль опирается на линеаризацию вокруг фиксированной рабочей точки, но это локальное приближение разрушается по мере того, как система удаляется от этой точки. Для систем с широкими рабочими диапазонами или сильными нелинейностями - такими как гибкие роботизированные руки, химические реакторы с экзотермическими реакциями или динамика транспортного средства во время агрессивных маневров - линейный контроллер просто не может обеспечить удовлетворительную производительность.
Более того, многие растения реального мира имеют неизвестную или частично известную динамику. Даже когда существует модель с первыми принципами, неопределенности параметров, немоделированные эффекты и нарушения окружающей среды требуют адаптивного или основанного на обучении подхода. Нейронные сети предлагают управляемый данными путь для приближения этой неизвестной динамики и синтезируют контроллеры, которые автоматически настраиваются.
Почему нейронные сети?
Нейронные сети обладают рядом свойств, которые делают их исключительно пригодными для нелинейного управления:
- Универсальное приближение: Кормовая передняя нейронная сеть с по меньшей мере одним скрытым слоем и достаточным количеством нейронов может аппроксимировать любую непрерывную функцию над компактным доменом с любой желаемой точностью, как установлено теоремой универсального приближения.
- Адаптация и обучение:] Благодаря контролируемому, неконтролируемому или усиленному обучению нейронные сети могут обновлять свои внутренние параметры (весы и смещения) для отражения изменений в динамике системы. Это позволяет онлайн-адаптацию без необходимости полной повторной идентификации системы.
- Параллельная обработка: Распределенная природа нейронных вычислений позволяет проводить быстрые оценки в режиме «поток-перед», что имеет решающее значение для контроля в реальном времени, где интервалы выборки могут быть такими же короткими, как миллисекунды.
- Растучесть до шума: При правильном обучении нейронные сети могут отфильтровать шум измерения и обобщить частичные или поврежденные данные, что является жизненно важной особенностью для практических циклов от датчика до привода.
Эти атрибуты мотивировали обширные исследования в области управления нейронной сетью (NNC) , формируя богатую область на пересечении теории машинного обучения и управления.
Основные архитектуры нейронных сетей для управления
Нейронные сети Feedforward (FNN)
Простейшей и наиболее широко используемой архитектурой управления является многослойный перцептрон (MLP) с одним или двумя скрытыми слоями. FNN обычно используются для приближения статических функций, таких как изучение обратной динамики робота-манипулятора. При прямом обратном управлении сеть обучена отображать желаемые выходы (например, углы соединения) на требуемые управляющие входы (крутящие моменты). Однако FNN не имеют памяти, поэтому они лучше всего подходят для систем, которые являются статическими или где текущий выход зависит только от текущего входа, а не от прошлых значений.
Рекуррентные нейронные сети (RNN) и долговременная кратковременная память (LSTM)
Для систем с динамикой — где состояние развивается с течением времени и зависит от предыдущих входов и состояний — рекуррентные сети являются естественным выбором. RNN имеют внутренние соединения обратной связи, которые дают им память о прошлых сигналах. Это делает их эффективными для идентификации системы (обучение функции перехода растения) и для прогностического управления моделью, где будущие выходы должны быть предсказаны за горизонт. Вариант LSTM с его механизмом замера может изучать долгосрочные зависимости и смягчать исчезающую проблему градиента, что делает его популярным для сложных динамических систем, таких как химические процессы или автономное прогнозирование траектории движения.
Свёрточные нейронные сети (CNN) и гибридные модели
В то время как CNN в основном используются для обработки изображений, они нашли приложения для управления, когда задействована визуальная обратная связь. Например, CNN может обрабатывать изображения камеры для оценки состояния (например, положение конечного эффекта манипулятора), а затем вторая сеть или стандартный контроллер генерирует управляющий сигнал. Гибридные архитектуры, которые объединяют CNN для извлечения функций с RNN для временного моделирования, также распространены в сквозном обучении для автономных транспортных средств.
Reservoir Computing / Echo State Networks (ESN) (недоступная ссылка)
Для чрезвычайно быстрого обучения и управления в реальном времени эхо-состояния сети (тип резервуарных вычислений) набрали тягу. Идея состоит в том, чтобы использовать фиксированный случайный рекуррентный резервуар, который отображает входные сигналы в высокоразмерное пространство и только тренирует простой линейный выходной слой. Обучение чрезвычайно эффективно (решение линейной регрессии), что делает ESN пригодными для онлайн-адаптивного управления в таких приложениях, как подавление тремора в вспомогательной робототехнике или вибрационный контроль в реальном времени.
Каждая архитектура приносит компромиссы между мощностью представления, сложностью обучения и вычислительными затратами. Выбор зависит от конкретной проблемы управления и доступных вычислительных ресурсов.
Стратегии управления на основе нейронных сетей
Исследователи управления разработали несколько парадигм, которые интегрируют нейронные сети в цикл управления. Три наиболее заметные являются прямое управление , нейронная модель предиктивного управления (NMPC) и адаптивное управление .
Прямой нейронный контроль
При прямом управлении нейронная сеть берет на себя роль самого контроллера. Сеть принимает текущие состояния системы (или набор соответствующих измерений) и непосредственно выводит управляющий сигнал. Обучение может выполняться в автономном режиме с использованием набора данных желаемых отображений состояния-контроля (например, от эксперта-человека или оптимального контроллера) или в режиме онлайн с использованием обучения с подкреплением (RL).
Одним из классических примеров является нейро-контроль для отслеживания траектории роботизированной руки. Сеть на корме обучается для изучения обратной динамики руки: при желаемом ускорении сеть выводит совместные крутящие моменты. После обучения сеть может вычислять команды управления за долю миллисекунды, что позволяет контролировать высокую пропускную способность. Основная проблема заключается в том, что обратное отображение может быть неуникальным или плохо обусловленным, требующим специальных алгоритмов обучения (например, дополненные якобианские методы).
В обучении с подкреплением нейронная сеть действует как аппроксиматор политики. Агент взаимодействует с окружающей средой, собирает вознаграждения (или затраты) и обновляет свои веса, чтобы максимизировать кумулятивное вознаграждение. Прямое нейронное управление на основе RL успешно продемонстрировано в стабилизации квадротора, манипулировании роботом и игре (например, AlphaGo). Однако гарантии стабильности остаются активной областью исследований.
Нейронная модель прогнозирования (NMPC)
Модель предиктивного управления (MPC) решает задачу онлайн-оптимизации на каждом этапе: учитывая модель установки, она вычисляет последовательность будущих управляющих действий, которые минимизируют функцию затрат на горизонте прогнозирования, с учетом ограничений. Качество MPC сильно зависит от точности модели. Нейронные сети используются для изучения этой модели из данных, заменяя традиционную модель на основе физики. Полученный подход известен как нейронная модель предиктивного управления (NMPC).
Преимущества значительны: модель нейронной сети может захватывать сложную, нелинейную динамику, которую трудно получить аналитически. Например, в управлении химическими процессами модель нейронной сети реактора может прогнозировать будущие концентрации и температуры, позволяя MPC вычислять оптимальные положения клапанов при соблюдении ограничений безопасности. Недостатком является вычислительная стоимость - решение оптимизации на каждом образце может быть требовательным, особенно с глубокими сетями. Недавние достижения в эффективных решателях и ускоренном выводе GPU сделали NMPC в реальном времени осуществимым даже для быстрых процессов, таких как автономное вождение.
Популярным вариантом является нелинейная авторегрессивная с экзогенными входами (NARX) сеть, которая моделирует выход системы как функцию прошлых выходов и прошлых входов. Эта модель затем встраивается в оптимизацию MPC. Чтобы гарантировать осуществимость, ограничения часто смягчаются, и сеть должна быть обучена на данных, которые покрывают ожидаемую операционную область.
Нейронный адаптивный контроль
Адаптивное управление имеет давнюю традицию в теории управления, где параметры контроллера (прибыли) настраиваются онлайн, чтобы справиться с вариациями параметров. Нейронные сети модернизируют эту идею, позволяя регулировать нелинейные параметры. Есть два основных подхода:
- Прямой адаптивный нейронный контроль:] Контроллер представляет собой нейронную сеть, вес которой настроен онлайн, чтобы минимизировать некоторые меры отслеживания или стабильности. Например, законы адаптации на основе Ляпунова получены для обеспечения того, чтобы система замкнутого цикла оставалась стабильной, пока сеть учится. Это распространено в таких приложениях, как роботизированные экзоскелеты, где динамика взаимодействия человека и робота резко меняется.
- Непрямое адаптивное нейронное управление: Используются две сети: одна выступает в качестве идентификатора (модель установки), а другая в качестве контроллера. Идентификатор обновляется онлайн на основе данных ввода-вывода, а контроллер пересчитывается (или обновляется) на основе идентифицированной модели. Такой подход может обеспечить лучшую производительность, поскольку контроллер может быть переработан по мере развития модели.
Адаптивное нейронное управление оказалось эффективным для систем с изменяющимися во времени параметрами, таких как управление полетом самолета, где аэродинамические коэффициенты изменяются с высотой и числом Маха, или для управления шагом ветряной турбины при различных скоростях ветра.Главная задача заключается в том, чтобы адаптация не приводила к нестабильности или чрезмерному усилию управления — требуется тщательный анализ стабильности, часто с использованием теории Ляпунова или аргументов пассивности.
Обучение нейронных сетей для контроля
Оффлайн-обучение с машинным обучением
Когда достаточно репрезентативный набор данных доступен, модели нейронных сетей могут быть обучены офлайн с использованием стандартного контролируемого обучения. Для идентификации системы данные ввода-вывода собираются с завода, и сеть обучена прогнозировать будущие выходы. Такие методы, как отсев, ранняя остановка и увеличение данных, помогают предотвратить переобучение. После обучения сеть может быть развернута и использована в качестве модели установки (например, в NMPC) или в качестве контроллера непосредственно.
Онлайн-обучение и адаптация в реальном времени
Офлайн-обучение часто недостаточно, потому что система может работать в регионах, не охваченных во время обучения, или ее параметры могут дрейфовать. Онлайн-обучение позволяет сети непрерывно адаптироваться. Это может быть сделано с использованием методов на основе градиента (например, стохастический градиентный спуск с импульсом) или рекурсивных наименьших квадратов, но должно быть тщательно реализовано, чтобы избежать катетеризации растения. Алгоритмические гарантии, такие как мертвые зоны, проекция и постоянное возбуждение, являются общими.
В обучении с подкреплением обучение по своей сути является онлайновым (или пакетным онлайн, как в Deep Q-Networks). Агент исследует окружающую среду, используя некоторую стратегию исследования (например, epsilon-greedy) при обновлении сети политики. Важным соображением является эффективность выборки: многие алгоритмы RL требуют миллионов взаимодействий для сложных систем, что непрактично для реального оборудования. Sim-to-real transfer, где сеть обучается симуляции, а затем настраивается на реальной системе, является общим практическим подходом.
Применение нейронных сетей в нелинейном контроле
робототехника
Робототехника, возможно, является самой большой областью применения. Контроллеры нейронной сети используются для управления крутящим моментом на уровне суставов, манипулирования всем телом и передвижения. Например, обучение глубокому усилению было использовано для обучения четвероногих ходить и бегать по сложной местности. Нейронная сеть принимает показания датчиков (совместные углы, данные IMU) и выводит совместные крутящие моменты, все время обучения на основе проб и ошибок в симуляции. Полученные политики удивительно надежны для толчков и неравномерной земли.
Автономные автомобили
Сквозное вождение, когда нейронная сеть напрямую отображает изображения камеры в команды рулевого управления и дросселя, является прямым приложением для нейронного управления. В конце 1980-х годов современные версии используют глубокие CNN (например, PilotNet NVIDIA) и были продемонстрированы в реальном трафике. Однако проблемы безопасности и необходимость интерпретируемости привели к переходу к модульным подходам, когда нейронные сети обрабатывают восприятие и планирование, в то время как PID или MPC более низкого уровня выполняет команды.
Процессный контроль и химическая инженерия
Нелинейная динамика присуща химическим реакторам, дистилляционным колоннам и теплообменникам. Нейронные модели МПК показали отличную производительность в отслеживании заданных точек и отбрасывании возмущений, часто превосходя традиционные линейные МПК. Например, нейронная сеть может моделировать сложную кинетику пакетного реактора, позволяя оптимально контролировать температуру для максимизации выходной мощности при избегании небезопасных условий.
Аэрокосмические и морские системы
Самолеты и беспилотники работают под воздействием высоконелинейных аэродинамических сил и моментов. Нейронные адаптивные контроллеры были проверены на летную устойчивость для управления, например, для компенсации застрявшей поверхности управления путем повторного изучения оставшейся эффективности управления. В морских транспортных средствах нейронные сети используются для динамического позиционирования судов в различных морских состояниях.
Проблемы и открытые проблемы
Несмотря на впечатляющие успехи, необходимо преодолеть несколько препятствий, прежде чем контроллеры нейронных сетей станут стандартом в системах, требующих безопасности.
- Гарантии стабильности и надежности: Доказать, что контроллер нейронной сети не будет управлять системой нестабильно при всех возможных условиях, крайне сложно из-за нелинейности самой сети.В то время как для некоторых архитектур существуют подходы на основе Ляпунова, они часто накладывают ограничительные предположения.Интеграция с надежной теорией управления является активной областью.
- Вычислительная сложность: Глубокие сети требуют значительных вычислений для передних и задних проходов. В встраиваемых контроллерах реального времени с жесткими ограничениями задержки предпочтительны более простые сети (например, двухскрытый слой). Модель сжатия и обрезка сети являются потенциальными решениями.
- Требования к данным: Нейронные модели высокой точности требуют больших и разнообразных наборов данных. Для систем, которые дорого работают или невозможно возбуждать в полном рабочем диапазоне (например, ядерные реакторы), дефицит данных является основным барьером. Обучение передаче и физические нейронные сети (PINN) направлены на снижение потребностей в данных путем внедрения предыдущих физических знаний.
- Интерпретируемость: Нейронные сети часто рассматриваются как чёрные ящики. Для одобрения регулирующих органов и диагностики неисправностей инженерам необходимо понять, почему контроллер принял определённое решение. Объясняемые методы ИИ адаптируются для контроля, но многое остаётся.
- Безопасное исследование: В онлайн-обучении (особенно RL) контроллер может исследовать действия, которые приводят к опасным или разрушительным состояниям.Безопасные алгоритмы RL, которые усиливают ограничения безопасности во время обучения, являются важным рубежом исследований.
Будущие направления
Заглядывая вперед, можно увидеть несколько тенденций, которые будут формировать следующее поколение нейронных сетей:
- Физика-информированные нейронные сети (PINN): Включая частичные дифференциальные уравнения в функцию потерь, PINN могут моделировать системы с разреженными данными при соблюдении физических законов. Это перспективно для управления распределенными параметрическими системами, такими как гибкие структуры или поток жидкости.
- Мета-обучение и малозаметная адаптация:] Сети, которые могут адаптироваться к новой динамике с помощью лишь нескольких наблюдений, значительно уменьшат потребность в обширном автономном обучении.
- Интеграция с формальными методами: Комбинирование нейронных контроллеров с инструментами проверки (например, анализ достижимости, барьерные сертификаты) может обеспечить гарантии в худшем случае, переходя к сертификации систем управления на основе обучения.
- Ускорители аппаратного обеспечения: Выделенные процессоры нейронных сетей (NPU) и реализации FPGA сделают вывод в реальном времени о глубоких сетях возможным в встраиваемых системах с низким энергопотреблением, расширяя приложения в микродронах и носимой робототехнике.
По мере развития этих технологий нейронные сети станут все более стандартным компонентом в наборе инструментов инженера-контроллера, дополняя классические методы, а не полностью заменяя их. Синергия между теорией управления и машинным обучением будет продолжать раздвигать границы того, что могут достичь автономные системы.
Заключение
Нейронные сети изменили ландшафт нелинейного управления, позволив решать проблемы, которые ранее были трудноразрешимы с помощью линейных методов. Их способность аппроксимировать сложную динамику, адаптироваться в Интернете и учиться на данных делает их незаменимыми для современной робототехники, автономных транспортных средств и расширенного управления процессом. В то время как проблемы, связанные с гарантиями стабильности, вычислительными затратами и интерпретацией, остаются, быстрый прогресс в алгоритмах, аппаратном обеспечении и теории обещает преодолеть эти барьеры. Практики и исследователи получат выгоду от глубокого понимания принципов и компромиссов, представленных здесь, поскольку управление на основе нейронных сетей становится краеугольным камнем интеллектуальных инженерных систем.
Для дальнейшего чтения см. основополагающую работу по идентификации нейронных сетей для управления Нарендра и Партхасарати (1990) , всеобъемлющее исследование по глубокому обучению усилению для контроля Мних и др. (2015) и практическое руководство по нейронному MPC L. Грондман и др. (2019) . Последние достижения в области нейронных сетей, основанных на физике, обсуждаются в Раисси, Пердикарис и Карниадакис (2019) , в то время как безопасные методы обучения усилению изучаются Гарсия и Фернандес (2015) .