Значение постоянного возбуждения в адаптивном контроле для конвергенции параметров
Почему конвергенция параметров имеет значение для адаптивного контроля
Адаптивные системы управления являются краеугольным камнем современной инженерии, позволяя системам поддерживать высокую производительность, несмотря на неопределенные или изменяющиеся во времени параметры. От роботизированных манипуляторов до контроллеров полета самолета адаптивное управление позволяет системе корректировать свое поведение в реальном времени на основе наблюдаемых данных. Однако успех любого адаптивного контроллера зависит от качества оценок параметров. Если эти оценки отходят от своих истинных значений, контроллер может стать нестабильным или не достичь целей производительности. Именно здесь концепция постоянного возбуждения становится критической.
Упорное возбуждение гарантирует, что входные сигналы в систему несут достаточно информации для адаптивного алгоритма, чтобы однозначно идентифицировать все неизвестные параметры. Без него оценки параметров могут сходиться к неправильным значениям или, что еще хуже, вовсе не сходятся. В этой статье дается всестороннее исследование постоянного возбуждения: что это такое, почему это важно, как его достичь и компромиссы, связанные с реальными приложениями.
Что такое постоянное возбуждение?
Устойчивое возбуждение (ПЭ) — это условие внешних входных сигналов, применяемых к динамической системе. Проще говоря, сигнал считается постоянно возбуждающим, если он содержит достаточное разнообразие частот и сохраняется в течение достаточно длительного временного интервала, чтобы выявить все режимы системы. Когда вход постоянно возбуждает, адаптивный алгоритм может разделить эффекты различных параметров, что приводит к правильной идентификации.
С математической точки зрения рассмотрим линейную систему, смоделированную как , где является неизвестным вектором параметров и является вектором регрессора, построенным из прошлых входов и выходов. Адаптивный алгоритм обновляет оценку , приводимую в действие ошибкой предсказания. Для конвергенции регрессор должен быть постоянно возбуждающим: матрица в течение конечного интервала должна быть положительно определенной. Это условие гарантирует, что уравнение обновления не может остановиться преждевременно — всегда есть направление, в котором ошибка параметров может быть уменьшена.
На практике это означает, что входной сигнал должен иметь по меньшей мере столько же различных частотных компонентов, сколько и количество неизвестных параметров. Шаг или один синусоид, например, может возбуждать только один режим; для определения двух параметров вам нужно по меньшей мере две разные частоты ( «богатый» вход).
Почему постоянное возбуждение необходимо для адаптивного контроля
Без постоянного возбуждения адаптивный контроллер может проявлять «параметрический дрейф» — предполагаемые параметры медленно удаляются от своих истинных значений из-за шума или немоделированной динамики. Даже если вход кажется «стабильным состоянием» (например, постоянной заданной точкой), адаптивный закон в конечном итоге перестанет обновляться, но оценки параметров могут сблизиться с любой точкой в подпространстве возможных значений. Фактическая ошибка отслеживания может оставаться небольшой, но оценки неверны. Это может быть опасно в критически важных для безопасности системах.
Упорное возбуждение гарантирует, что погрешность параметра сходится к нулю экспоненциально быстро. Это формализуется известной настойчивостью возбуждения Лемма. При сочетании с правильно разработанным адаптивным законом ПЭ обеспечивает:
- Конвергенция истинных параметров — оценки приближаются к фактическим физическим параметрам, позволяя точно прогнозировать и контролировать.
- Сильность к возмущениям — достаточно возбужденная система может отклонять шум, не вызывая дрейфа параметров.
- Превняя переходная и устойчивая производительность — контроллер может быстро адаптироваться к изменениям и поддерживать стабильность.
- Надежность модели (FLT:0) — идентифицированная модель может использоваться для вторичных задач, таких как обнаружение или оптимизация ошибок.
В адаптивных учебниках по управлению доказательство глобальной конвергенции часто предполагает PE. Например, стандартные алгоритмы на основе градиента и наименьших квадратов полагаются на некоторую форму PE, чтобы свести ошибку параметров к нулю. Без нее лучшее, что можно гарантировать, это ограниченность сигналов, а не фактическая идентификация.
Математические условия для постоянного возбуждения
Хотя интуитивная идея ясна, инженерам нужны точные условия для проектирования сигналов ПЭ. Формальное определение:
Векторный сигнал φ(t) является постоянно возбуждающим, если существуют положительные константы α, β и T, такие, что для всех t ≥ 0, α Itt+Tφ(τ)φT(τ) dτ ≤β I
.
Это неравенство означает, что интеграл внешнего продукта регрессора является однородно положительным. Проще говоря, регрессор должен «протянуть» пространство параметров над каждым раздвижным окном длины T. Для системы с одним входом-одно выходом (SISO) с параметрами n достаточное условие заключается в том, что вход имеет по меньшей мере n различные частотные компоненты (сумма синусоидов). Для систем с несколькими входами-много выходами (MIMO) условие становится более сложным, часто требуя, чтобы каждый вход вносил свой вклад в захватывающие все направления.
Практические руководящие принципы включают:
- Богатство частоты: Входной сигнал, который содержит по меньшей мере n различные частоты (включая DC) будет PE для большинства линейных временных инвариантных систем с n параметрами.
- Со временем устойчивость: Возбуждение должно сохраняться бесконечно. Короткий всплеск насыщенного сигнала может дать хорошую первоначальную оценку, но без продолжения возбуждения оценки могут дрейфовать позже.
- Наблюдаемость: Система должна быть наблюдаемой в период возбуждения.Если состояние ненаблюдаемо, никакое количество входных данных не будет идентифицировать параметры, связанные с этим режимом.
Также важно отметить, что ПЭ зависит от конкретной структуры адаптивного алгоритма и системы. Для нелинейных систем условия ПЭ становятся более жесткими и могут включать в себя саму траекторию состояния.
Практическое применение стойкого возбуждения
Роботизированные манипуляторы
В управлении роботом такие параметры, как масса связи, инерция, коэффициенты трения и двигательные константы, часто неопределенны или изменяются с полезной нагрузкой. Адаптивный контроллер может оценивать эти параметры в режиме онлайн. Однако, если робот движется только по фиксированной траектории (например, повторяя одно и то же движение по выбору и месту), векторы регрессора могут стать линейно зависимыми, предотвращая конвергенцию полных параметров. Путем введения небольших поисковых движений - техника, известная как «дифир» или «постоянно захватывающие команды» - контроллер может гарантировать, что все параметры идентифицируются. Это приводит к точной компенсации силы тяжести, Кориолиса и сил трения, что приводит к плавному, точному движению даже с различными нагрузками.
аэрокосмические системы
Адаптивные системы управления полетом должны обрабатывать изменяющиеся аэродинамические коэффициенты из-за высоты, числа Маха или повреждения. Устойчивое возбуждение имеет решающее значение для самолета, чтобы правильно идентифицировать эти коэффициенты. В боевых самолетах внезапные маневры или преднамеренное возбуждение (например, вызванные пилотом колебания) могут обеспечить необходимую частоту насыщения. Однако слишком большое возбуждение может привести к дискомфорту пассажиров или структурной усталости. Инженеры проектируют сигналы «командной дитер», которые оказывают минимальное влияние на качество полета, все еще обеспечивая ПЭ. Хорошо известным примером является использование частотных стрельб или «охлаждающих» сигналов во время летных испытаний для идентификации модели, за которыми следуют стабильные адаптивные контроллеры, которые предполагают, что ПЭ поддерживается нормальной турбулентностью и маневрированием.
Управление автомобильным двигателем
Современные двигатели используют адаптивные алгоритмы для оценки износа топливного инжектора, дрейфа датчиков и характеристик сгорания. Устойчивое возбуждение достигается изменением положения дросселя, нагрузки двигателя и соотношения топливо-воздух контролируемым образом. Например, во время испытаний инженеры вводят небольшие периодические возмущения в момент искры и ширину импульса инжектора. Это позволяет адаптивному контроллеру сходиться в точные модели динамики двигателя, улучшая экономию топлива, выбросы и управляемость. Если автомобиль приводится в движение при постоянном круизе в течение длительных периодов, состояние ПЭ может ухудшаться, поэтому адаптивные алгоритмы часто сочетаются с механизмами мониторинга дрейфа и сброса.
Процессный контроль и химическая инженерия
В химических реакторах, теплообменниках и дистилляционных колонках такие параметры, как коэффициенты теплопередачи, скорости реакции и временные константы, изменяются с течением времени из-за загрязнения или деактивации катализатора. Адаптивные контроллеры используются для поддержания заданных точек, но процесс может работать вблизи устойчивого состояния в течение длительных периодов. Инженеры намеренно стимулируют процесс, внося небольшие запланированные заданные изменения (например, псевдослучайная двоичная последовательность) для поддержания ПЭ. Стоимость этих возмущений взвешивается с выгодой точного отслеживания параметров. Анализ частотной области часто помогает проектировать входы, которые достаточно богаты, не нарушая качество производства.
Проблемы в достижении постоянного возбуждения
Несмотря на теоретическую важность, постоянное возбуждение представляет собой несколько практических задач:
- Нестабильность от чрезмерного возбуждения: Высокочастотные или высокоамплитудные входы могут подтолкнуть систему в нелинейные области или возбуждать немоделированную динамику, вызывая нестабильность.Это особенно проблематично в системах с гибкостью, обратной реакцией или насыщением привода.
- Конфликт с целями производительности: Во многих приложениях основная цель состоит в том, чтобы сохранить выход системы на желаемой ссылке. Добавление сигналов возбуждения может временно ухудшить производительность отслеживания. Этот компромисс известен как дилемма «производительность против идентификации».
- Чувствительность к шуму: В шумных средах постоянное возбуждение может усиливать высокочастотный шум, приводя к дрожанию параметров. Фильтрация может потребоваться, но фильтрация также может удалить высокочастотные компоненты, необходимые для возбуждения.
- Изменяющиеся во времени параметры: Если истинные параметры изменяются медленнее возбуждения, конвергенция всё же может быть достижима. Однако, если параметры быстро меняются, возбуждение должно быть достаточно быстрым, чтобы «держаться». Это приводит к понятию «сильное» против «слабого» возбуждения.
- MIMO системы: Для систем с множеством параметров и множеством входов обеспечение равномерности положительной определённости матрицы регрессора во всех направлениях нетривиально.Входные сигналы должны быть спроектированы так, чтобы независимо возбуждать каждое направление параметра.
Стратегии смягчения и альтернативные подходы
Инженеры используют несколько методов для решения этих проблем:
- Впрыск сигнала дифирамбы: Добавление низкоамплитудного высокочастотного сигнала дитеризации (например, сумма синусоидов) к управляющему входу. Амплитуда держится достаточно малой, чтобы не нарушить работу системы, но достаточно большой, чтобы поддерживать возбуждение. Содержание частоты выбрано для покрытия полосы пропускания системы.
- Переключение и контрольный контроль: Вместо того, чтобы постоянно требовать возбуждения, контроллер может время от времени переключаться в «режим идентификации», где на короткий период применяется богатый вход. После конвергенции система возвращается к номинальной работе. Надзорная логика контролирует ковариантность или детерминант матрицы регрессора, чтобы решить, когда требуется повторное возбуждение.
- Сильные адаптивные законы: Алгоритмы, такие как проекция или модификация мертвой зоны, предотвращают дрейф параметров даже без ПЭ. Эти методы держат оценки ограниченными, но не гарантируют конвергенцию с истинными значениями. В сочетании с случайными ПЭ они обеспечивают практический компромисс.
- Модифицированный наименьший квадрат с забыванием: Рекурсивный алгоритм наименьших квадратов с экспоненциальным забыванием может поддерживать отслеживание параметров, если вход медленно меняется. Однако, если вход становится постоянным, матрица ковариации может расти произвольно (конверт ковариации), что приводит к большим скачкам параметров. Помогает так называемое «селективное забывание» или «перезагрузка ковариации».
- Использование естественных возмущений: В некоторых системах турбулентность, дорожный шум или изменения нагрузки обеспечивают достаточное естественное возбуждение. Инженеры разрабатывают адаптивный контроллер для использования этих сигналов, а не для впрыскивания искусственных.
Оригинальное название: Beyond Basic Persistent Excitation
Связь с идентификацией
Устойчивое возбуждение тесно связано со структурной идентификацией системы. Система идентифицируется, если данные ввода-вывода однозначно определяют параметры - даже без шума. Для линейных систем условия идентифицируемости часто эквивалентны существованию постоянно возбуждающего ввода. Для нелинейных систем идентифицируемость может зависеть от самой траектории (например, параметры маятника идентифицируются только в том случае, если качели включают как малые, так и большие углы).
Интерпретация частотных доменов
Перспектива частотной области полезна: спектральная плотность входа должна быть ненулевой по набору частот, которые охватывают знаменатель и числитель функции передачи системы. Вот почему сумма синусоидов на правильных частотах является общей практической конструкцией. Инженеры часто используют «номер состояния» матрицы частотного ответа для количественной оценки того, насколько хорошо вход возбуждает пространство параметров.
Постоянное возбуждение в адаптивной обратной связи
Когда измерим только выход (автоответное адаптивное управление), регрессор может зависеть от отфильтрованных версий ввода и вывода. Условие PE затем включает в себя отфильтрованные сигналы. Например, в модели эталонного адаптивного управления (MRAC) система дополненной ошибки требует, чтобы эталонный вход был постоянно возбуждающим достаточно высокого порядка. Это приводит к понятию «частота возбуждения», которая должна превышать в два раза количество неизвестных параметров во многих конструкциях MRAC.
Связь с обучением с подкреплением
В адаптивном оптимальном контроле (иногда называемом обучением подкреплению для систем непрерывного времени) концепция исследования напрямую отражает постоянное возбуждение. Агент должен «исследовать» пространство действия состояния, чтобы однозначно идентифицировать оптимальную политику. Это исследование по существу является формой ПЭ - без него функция усвоенной ценности может быть неправильной. Условие ПЭ появляется в формулировке адаптивного динамического программирования (ADP) и сближение алгоритмов итерации политики.
Заключение
Упорное возбуждение остается одним из самых важных, но тонких понятий в теории и практике адаптивного управления. Он обеспечивает математическую гарантию того, что оценки параметров будут сходиться с их истинными значениями, позволяя создавать надежные и высокопроизводительные адаптивные контроллеры. В то время как достижение ПЭ в реальных системах требует тщательного проектирования ввода и компромиссов с операционными целями, это фундаментальный инструмент в арсенале инженера. От роботов и самолетов до двигателей и химических заводов понимание и применение постоянного возбуждения имеет важное значение для создания адаптивных систем, которые действительно учатся и адаптируются.
Для дальнейшего чтения классические учебники Åström и Wittenmark (Adaptive Control, 2nd ed.) и Ioannou и Sun (Robust Adaptive Control) (Robust Adaptive Control) обеспечивают комплексные математические методы лечения. Для более практической перспективы см. обзор «Постоянное возбуждение в адаптивных системах», опубликованный в Международном журнале адаптивного контроля и обработки сигналов.