Реализация стратегий управления обратной связью без моделей для неизвестной системной динамики

Введение в систему контроля обратной связи без модели

Современная технология управления часто сталкивается с системами, чья динамика плохо понятна, высоко нелинейна или подвержена непредсказуемым нарушениям. Традиционные методы управления на основе моделей, такие как настройка PID, проектирование пространства состояний или оптимальное управление, требуют точных математических представлений установки. Когда эти модели недоступны, дороги для получения или быстро меняются, инженерам нужны альтернативные подходы. Стратегии управления без модели устраняют этот пробел путем непосредственного изучения или адаптации действий управления из измеренных данных, не требуя явной модели системы. Эта статья обеспечивает всестороннее исследование управления без модели, охватывая основополагающие концепции, ведущие методы, передовые методы реализации, приложения реального мира и новые направления исследований.

Управление без моделей — это не единый алгоритм, а семейство методов, которые разделяют общую философию: использовать измерения ввода-вывода в реальном времени для приведения системы к желаемому поведению. Эти методы особенно ценны в таких областях, как робототехника, автономные транспортные средства, промышленная автоматизация и биомедицинские системы, где точные модели либо непрактичны, либо их невозможно получить. Устраняя узкие места моделирования, стратегии без моделей обеспечивают более быстрое развертывание, большую адаптивность и надежную производительность в неопределенных условиях.

Понимание контроля обратной связи без модели

В своей основе бесмодельный контроль обратной связи рассматривает растение как черный ящик. Контроллер наблюдает ошибку между желаемой заданной точкой и фактическим выходом, затем корректирует управляющий сигнал, основываясь исключительно на этой ошибке и недавней истории. В отличие от контроллеров на основе моделей, нет явного знания функций передачи, уравнений состояния или значений параметров. Вместо этого контроллер учится или адаптирует свое поведение посредством взаимодействия.

Ключевое понимание заключается в том, что вся необходимая информация о реакции системы содержится в потоке данных ввода-вывода. Обрабатывая эти данные в режиме реального времени, контроллер без модели может вывести эффект своих действий и соответствующим образом изменить свою политику. Этот подход по своей сути обрабатывает изменяющуюся во времени динамику, нелинейности и немоделированные возмущения, потому что контроллер постоянно обновляется на основе свежих наблюдений.

Существует три основные категории контроля обратной связи без модели: адаптивный контроль, обучение с подкреплением (RL) и управление скольжением (SMC). Каждый из них предлагает различные преимущества и компромиссы, и выбор зависит от требований приложения, вычислительных ограничений и соображений безопасности.

Адаптивный контроль

Адаптивные методы управления корректируют параметры контроллера онлайн для поддержания желаемой производительности, даже когда меняется динамика установки. В адаптивном управлении без модели (MFAC) контроллер не требует параметрической модели, а вместо этого использует динамический подход линеаризации - часто через псевдочастичные производные - для оценки взаимосвязи между входами инкрементного управления и изменениями выхода. Популярные методы включают модельную адаптивную структуру управления, предложенную Хоу и Джином, которая работает путем рекурсивной оценки изменяющегося во времени псевдоградиента и соответственно обновления закона управления.

Другой широко используемый адаптивный метод - итеративное управление обучением (ILC), которое использует повторяющийся характер многих задач (например, роботизированное сканирование на основе подбора и размещения пластин) для уточнения управляющего сигнала от одной итерации к следующей. ILC считается свободным от модели, когда закон обучения не зависит от явной модели растения, хотя он часто косвенно предполагает линейную систему инварианта времени на горизонте итерации. Для нелинейных систем адаптивные контроллеры на основе нейронной сети могут приблизиться к неизвестной динамике и регулировать веса в Интернете.

Усиление обучения (RL)

Усиление обучения стало мощной безмодельной стратегией для сложных задач управления. В RL агент (контроллер) изучает оптимальную политику посредством пробно-ошибочных взаимодействий с окружающей средой. Агент наблюдает состояние, выбирает действие, получает вознаграждение и обновляет свою функцию принятия решений, чтобы максимизировать совокупное вознаграждение с течением времени. Deep RL (DRL) расширяет это до высокоразмерных состояний и пространств действия с использованием нейронных сетей в качестве приближенных функций.

Ключевые алгоритмы RL, используемые в управлении обратной связью, включают Deep Q-Networks (DQN) для дискретных действий, Deep Deterministic Policy Gradient (DDPG) и Soft Actor-Critic (SAC) для непрерывных действий и Proximal Policy Optimization (PPO) для стабильного обучения. Критическим преимуществом RL является его способность обнаруживать неинтуитивные стратегии управления, которые превосходят модели на основе проектов. Однако RL в управлении в реальном времени требует тщательной обработки безопасности, эффективности выборки и компромиссов разведки-эксплуатации. Недавние достижения в автономном RL и модели на основе RL также размывают линию предварительной подготовкой по историческим данным до развертывания .

Sliding Mode Control (SMC)

Управление скольжением - это надежная техника управления, которая намеренно вводит прерывистые действия управления, чтобы заставить траекторию состояния системы на заранее заданную скользящую поверхность.Оказавшись на поверхности, система проявляет желаемую динамику (например, экспоненциальную конвергенцию). SMC свободна от модели в том смысле, что она требует только знания верхних границ неопределенностей и возмущений, а не их точной структуры. Закон управления обычно состоит из эквивалентного контрольного термина плюс прерывистого переключающего термина, который компенсирует неопределенности.

Основная проблема с обычным SMC - болтовня - высокочастотные колебания в управляющем сигнале, вызванном переключающим термином. Шаттеринг может возбуждать немоделированную динамику и приводы повреждений. Варианты без модели, такие как режимы скольжения более высокого порядка и алгоритмы супер-вихряния, смягчают болтовню, применяя действие переключения к более высоким производным переменной скольжения. Непрерывное управление режимом скольжения с использованием адаптивных выигрышей еще больше уменьшает болтовню при сохранении надежности .

Преимущества безмодельных стратегий

Бесмодельный контроль обратной связи предлагает несколько неоспоримых преимуществ по сравнению с традиционными подходами, основанными на моделях:

Рассмотрение осуществления

Хотя система управления без моделей устраняет этап моделирования, она создает новые проблемы, которые инженеры должны решать для надежного развертывания. Ниже приведены критические соображения по реализации, организованные компонентом системы управления.

Приобретение и обработка данных

Данные в реальном времени являются источником жизненной силы любого контроллера без модели. Необходимы высокочастотные измерения выходов установок с низкой задержкой (например, положение, скорость, температура, давление). Датчики должны быть калиброваны и отфильтрованы для снижения шума. Для адаптивных и RL-контроллеров скорость отбора проб должна быть достаточно быстрой, чтобы захватывать динамику системы без псевдонимов. На практике рекомендуется скорость отбора проб, по крайней мере, в 10 раз превышающая максимальную ожидаемую полосу пропускания замкнутого цикла. Предварительная обработка данных включает в себя отказ от выбросов, кондиционирование сигналов и, возможно, сбор проб в соответствии с вычислительной мощностью контроллера.

Стабильность и конвергенция

Обеспечение стабильности является более сложной задачей без модели. Адаптивные контроллеры могут стать нестабильными, если адаптационный выигрыш установлен слишком высоко или если есть немоделированная задержка во времени. Методы на основе Ляпунова и сохранение условий возбуждения могут гарантировать стабильность для определенных классов адаптивного управления. Для RL стабильность часто проверяется с помощью безопасных методов исследования (например, контрольные барьерные функции, вознаграждения на основе Ляпунова) и агрессивно ограничивающими действиями управления. Управление в режиме скольжения обеспечивает присущую надежность, но требует тщательного выбора скользящей поверхности и переключения усиления для предотвращения нестабильности, вызванной болтовней. Обширное моделирование и тестирование аппаратного обеспечения в цикле необходимы перед развертыванием в реальном мире.

Вычислительные ограничения

Контуры управления в реальном времени устанавливают строгие сроки - типичные периоды отбора проб варьируются от микросекунд (электроника питания) до миллисекунд (роботизированные руки). Нейронные сетевые контроллеры RL могут быть слишком медленными для быстрых систем, если они не ускоряются с помощью GPU, FPGA или специализированного аппаратного обеспечения вывода. Адаптивные алгоритмы управления с рекурсивной оценкой наименьших квадратов или обновлениями нейронного веса также требуют тщательного профилирования. Практический подход заключается в использовании более простого метода без модели (например, MFAC или SMC) для внутреннего цикла и метода обучения для более медленных внешних циклов или генерации заданных точек.

Безопасность и надежность

Бесмодельные контроллеры могут исследовать небезопасные действия во время обучения, в частности агенты RL. Ограничения безопасности могут быть реализованы путем добавления надзорного уровня (например, фильтр безопасности, который перекрывает контроллер обучения, когда сигналы превышают пороги), или с помощью безопасных алгоритмов RL, которые включают ограничения в оптимизацию. Для адаптивного управления, проекции параметров и модификации утечки предотвращают дрейф параметров контроллера к нереалистичным значениям. Излишние датчики и таймеры сторожевых собак являются стандартными в критически важных приложениях, таких как автономные транспортные средства и медицинские устройства.

Применение системы Model-Free Control

В нижеследующих подразделах рассматриваются репрезентативные варианты использования и конкретные применяемые методы контроля обратной связи без использования моделей.

Робототехника и автономные транспортные средства

Роботизированные манипуляторы с неизвестными полезными нагрузками или совместным трением извлекают выгоду из адаптивного управления для поддержания точности отслеживания траектории. Безмодельный RL позволил квадрокоптерам выполнять маневры (переворачивания, погружения) и роботам-ногим, чтобы научиться ходить пешком, устойчивым к неровной местности. Примечательным примером является использование глубокого RL для обучения точечного робота ходить по скользким поверхностям . Для автономных автомобилей отслеживание пути на основе MPC часто предполагает известную модель транспортного средства, но безмодельные адаптивные контроллеры могут обрабатывать изменения трения по шинам и отказы датчиков без перекалибровки.

Контроль промышленных процессов

Химические реакторы, дистилляционные колонны и бумажные фабрики часто демонстрируют нелинейное, изменяющееся во времени поведение. Для поддержания качества продукции применяется безмодельный адаптивный контроль при отказе от нарушений от изменения состава кормов. Для пакетных процессов итеративный контроль обучения улучшает показатели отслеживания от одной партии к другой, сокращая отходы и потребление энергии. Стальная промышленность использует режим скольжения для регулирования натяжения полос в прокатных мельницах, обеспечивая постоянную толщину без детальной модели динамики мельницы.

Возобновляемые энергетические системы

Управление шагом ветровой турбины, отслеживание максимальной точки мощности солнечной панели (MPPT) и системы управления батареями имеют дело с неопределенной, изменяющейся во времени динамикой. Методы MPPT без моделей (например, возмущение и наблюдение, инкрементная проводимость) широко используются, но более продвинутые методы MPPT на основе RL могут улучшить сбор энергии при частичном затенении. Управление режимом скольжения обеспечивает надежное регулирование напряжения для инверторов, подключенных к сети, даже когда импеданс сети неизвестен. Адаптивное управление использовалось для смягчения субсинхронного резонанса в ветровых электростанциях, подключенных к слабым сетям.

Биомедицинские устройства

Доставка анестезии, инсулиновые помпы и кардиостимуляторы должны работать надежно, несмотря на вариабельность от пациента к пациенту. В клинических испытаниях был продемонстрирован адаптивный контроль глубины анестезии без модели, автоматически корректирующий скорость инфузии лекарств на основе ЭЭГ или жизненно важных признаков. Глубокий RL был исследован для контроля глюкозы замкнутого цикла при диабете 1 типа, используя непрерывные показания глюкозомонитора для командования инсулиновыми помпами. Последние результаты показывают, что контроллеры на основе RL превосходят традиционные PID в поддержании уровня глюкозы в пределах целевого диапазона .

Проблемы и ограничения

Несмотря на свои обещания, стратегии без моделей не являются панацеей.

Будущие направления

Исследования в области управления обратной связью без моделей ускоряются, что обусловлено достижениями в области машинного обучения и вычислительного оборудования.

Заключение

Стратегии управления обратной связью без модели обеспечивают мощный инструментарий для управления системами с неизвестной или неопределенной динамикой. От настройки онлайн-параметров адаптивного управления до оптимизации политики обучения и надежного переключения управления скольжением режимов инженеры теперь имеют несколько жизнеспособных альтернатив традиционным методам на основе моделей. Каждая техника имеет свои сильные стороны и ограничения, и лучший выбор зависит от временных шкал системы, требований безопасности и доступных вычислений. По мере созревания области гибридные подходы и улучшенные гарантии безопасности будут еще больше расширять применимость управления без модели. Возможность разработки высокопроизводительных контроллеров без явной модели больше не является теоретическим любопытством - это практическая инженерная реальность, которая меняет то, как мы автоматизируем мир вокруг нас.