Применение вариативных методов при решении задач оптимального контроля
Роль вариационных методов в теории оптимального управления
Оптимальная теория управления обеспечивает математическую основу для проектирования динамических систем, которые достигают желаемого поведения при минимизации или максимизации показателя эффективности. Инженеры, экономисты и прикладные математики полагаются на эту дисциплину для решения задач, начиная от оптимизации траектории ракеты до распределения ресурсов в финансах. Среди наиболее мощных инструментов, разработанных для этой цели, являются вариационные методы, которые переосмысливают проблемы управления через линзу исчисления вариаций. Рассматривая управляющие входы как определяемые функции, вариационные подходы превращают ограниченную динамическую оптимизацию в проблему оптимизации функционала. Эта статья расширяет оригинальную экспозицию, предлагая строгую, но доступную обработку того, как вариационные методы решают оптимальные задачи управления, включая вывод необходимых условий оптимальности, практических алгоритмов и современных расширений.
Основы исчисления вариаций
Прежде чем решать проблемы управления напрямую, важно понять исчисление вариаций, которое имеет дело с поиском функций, которые экстремизируют функционал. Функционал J отображает функцию y(x)]] на реальное число, обычно выраженное как интеграл: J = ⁇ Ly, что делает J неподвижным (обычно минимальным).Это приводит к уравнению Эйлера-Лагранжа:Ly — d/dxL/∂y' = 0.Для задач, где фиксированы конечные точки
В оптимальном управлении функционал представляет собой показатель эффективности (например, расход топлива, время или ошибку в квадрате), а найденная функция является законом управления u(t). Динамика системы выступает в качестве дифференциального ограничения равенства, связывающего состояние x(t) и управления u(t). Формируя дополненный функционал, который включает в себя динамику через множители Лагранжа (костят), задача становится исчислением задачи вариаций с одной независимой переменной (время) и двумя зависимыми переменными (состояние и стоимость). Уравнение Эйлера-Лагранжа затем дает необходимые условия для оптимальности, часто выраженные в виде гамильтоновых и смежных уравнений.
Для читателей, заинтересованных в более глубоком погружении в исчисление вариаций, MIT OpenCourseWare предлагает отличную серию лекций.
Формальная структура проблемы оптимального управления
Оптимальная задача управления определяется следующими элементами:
- Уравнения состояния: Система обыкновенных дифференциальных уравнений ⁇ =f ∈ Rn — вектор состояния, а u ∈ Rm — управляющий вектор.
- Индекс производительности : скалярный функционал J = φ(x(t]f, tf] + ⁇ t0ff L(x, u, t) dt, где φ — конечная стоимость, а L — эксплуатационные расходы.
- Ограничения : Они могут включать начальные и терминальные условия на состояниях, ограничения на контроль или ограничения пути неравенства (например, препятствия в робототехнике).
Цель состоит в том, чтобы найти допустимую траекторию управления u*(t) и соответствующую траекторию состояния x*(t), которая минимизирует (или максимизирует) J, удовлетворяя уравнениям состояния и ограничениям.
Вариационная реформация: Гамильтон и Лагранжиан
Лагранжевый подход
Для применения вариационных методов ограниченная динамическая оптимизация преобразуется в неограниченную задачу с помощью множителей Лагранжа.Определить функционал Лагранжа:
L = φ(x(t]f), tfft0tf[L(x, u, t) + λT(t)(f(x, u, t) — ⁇ ) dt
Здесь λ(t) ∈ Rn является вектором множителей Лагранжа, часто называемым стоимостной или примыкающей переменной.Принимая первую вариацию L относительно x, u и λ и установив ее на ноль, дает необходимые условия для оптимальности.Интеграция по частям относительно термина ⁇ производит примыкающее уравнение и граничные условия на стоимостях.
Гамильтоновская формула
Обычно определяют гамильтониан H = L + λT f. Тогда уравнения Эйлера-Лагранжа становятся набором канонических уравнений:
- Уравнение состояния: ⁇ = ∂H/∂λ
- Уравнение состояния: λλ = -∂H/∂x
- Условие оптимальности: ∂H/∂u = 0 (для внутренних минимумов, не предполагающих ограничений управления)
- Границы : либо фиксированные состояния, либо условия поперечности, включающие ∂φ/∂x и λ в терминальное время.
Эти необходимые условия первого порядка являются основой большинства решений для оптимального управления на основе вариаций. Когда присутствуют ограничения управления (например, u ∈ U, замкнутый набор), условие ∂ H /∂u = 0 заменяется Максимум Принципом Понтрягина (PMP), который гласит, что оптимальное управление минимизирует гамильтонову точку: u* = argminu∈UH(x*, λ*, u, t).
Максимум понтрягина: основной результат
Принцип максимума Понтрягина является центральным результатом в теории оптимального управления, которая обобщает исчисление вариаций для обработки ограничений управления. Он обеспечивает как необходимые, так и, при выпуклых предположениях, достаточные условия для оптимальности. Принцип гласит, что для задачи оптимального управления, описанной выше, существует дорогостоящее λ(t), такое, что:
- Гамильтониан минимизируется оптимальным контролем: H(x*, λ*, u*, t) ≤ H(x*, λ*, u, t) для всех допустимых u.
- Стоимость развивается в соответствии с λλ = -∂H/∂x, с соответствующими условиями поперечности в терминальное время.
- Уравнение состояния ⁇ = ∂H/∂λ удерживает с заданными начальными условиями.
PMP может быть получен с помощью вариационных методов, рассматривая игольчатые возмущения управления и анализируя результирующее изменение функциональной стоимости. Этот принцип особенно эффективен для задач управления взрывом (где оптимальные переключатели управления между крайними значениями) и сингулярными дугами (где гамильтониан линейный в управлении). Школаредия предоставляет подробный обзор принципа максимума Понтрягина .
Решение оптимальных задач управления с помощью вариативных методов
Косвенные методы
Вариационные методы составляют основу непрямых решателей, которые пытаются решить проблему двухточечной граничной величины (TPBVP), возникающую из необходимых условий.Уравнения состояния и стоимостного числа вместе с граничными условиями составляют дифференциально-алгебраическую систему.Общие численные методы включают:
- Методы стрельбы: Угадайте неизвестные начальные стоимости и интегрируйте вперед; корректируйте догадки, используя метод Ньютона, чтобы удовлетворить терминальные условия.
- Многократная съемка: Разделите временной горизонт на сегменты, наложите условия непрерывности и решите более крупную нелинейную систему.
- Методы коллокации: Дискретизируйте состояние и стоимостные траектории в точках коллокации и применяйте дифференциальные уравнения в качестве алгебраических ограничений.
Прямые методы
Хотя прямые методы не являются чисто вариационными, они также прослеживают свои корни в исчислении вариаций. Они дискретизируют управляющие и иногда государственные переменные, преобразуя проблему оптимального управления в проблему нелинейного программирования (NLP). NLP затем решается с использованием стандартных алгоритмов оптимизации (например, последовательное квадратичное программирование). Прямые методы легче инициализировать и обрабатывать ограничения более надежно, чем косвенные методы, но они не предоставляют дорогостоящую информацию напрямую (которая может быть восстановлена с помощью двойных переменных).
Пример: линейный квадратичный регулятор (LQR)
Классическим применением вариационных методов является задача линейного квадратичного регулятора (LQR). Рассмотрим линейную систему ⁇ = Ax + Bu и квадратичную стоимость J = ⁇ (xTQx + uTRu) dt, с Q ≥ 0 и R > 0. Гамильтониан = xTQx + uTRu + λT(Ax + Bu.] = xTQx + uTRu + λTH/∂u = 2Ru + BTλ = 0 даёт u = -1⁄2 R−1 BT λ. Предполагая линейное отношение λ = -2Qx - ATλ. возникает уравнение Риккати: - ⁇ = P A + ATP - P B R−1 BT P + Q. Решение этой матрицы даёт оптимальное управление обратной связью u = -R−1 BT P x. Решение LQR является краеугольным камнем современной теории управления, и его вывод
Для всеобъемлющего учебника по LQR и его связи с вариационным исчислением примечания Стэнфорда EE363 обеспечивают углубленное лечение .
Устранение ограничений при вариационном оптимальном контроле
Неравенство ограничивает контроль
Когда контроль ограничен, условие ∂H/∂u = 0 может не дать осуществимого решения. Вместо этого, согласно PMP, оптимальное управление минимизирует гамильтониан над допустимым множеством. Это приводит к возможным структурам: bang-bang (где u прыгает между границами) или сингулярные дуги (где ∂H/∂u = 0 и гамильтониан линейный в u). Для проверки оптимальности на сингулярных дугах требуются условия более высокого порядка (обобщенное условие Legendre-Clebsch).
Ограничения государственного неравенства
Ограничения на состояние, такие как x(t) ≤ x max, являются более сложными. Вариационные методы рассматривают их путем увеличения лагранжиана дополнительными множителями (или с использованием подхода функции штрафа). Решение может включать контактные дуги, где ограничение является активным, и у затратного может быть условия скачка во время входа/выхода. Эти проблемы часто требуют использования косвенной съемки, которая включает обнаружение события.
Свободное терминальное время и условия перехода
Если конечное время tf является свободным, применяется дополнительное условие: гамильтониан в терминальное время должен удовлетворять Hf = -∂φ/∂tf (или аналогичное отношение).Это условие возникает естественным образом из первой вариации, когда время допускается изменять.
Преимущества и ограничения вариационных методов
Преимущества
- Условия оптимальности ригоризонтных значений: Вариационные методы дают необходимые условия, которые можно проверить аналитически или численно. Они обеспечивают понимание структуры оптимального решения (например, время переключения, сингулярные дуги).
- Применимость к нелинейным задачам: В отличие от инструментов линейного управления, вариационные методы могут обрабатывать нелинейную динамику и неквадратичные затраты, если можно получить и решить необходимые условия.
- Состоятельная информация: Примыкающие переменные λ(t) имеют экономические интерпретации (теневые цены) в задачах распределения ресурсов и анализ чувствительности в технике.
- Единая структура: Те же самые вариационные принципы лежат в основе многих областей: механика (лагранжевая/гамильтоновская динамика), экономика (оптимальный рост) и физика (принцип минимального действия).
Ограничения
- Проблема двухточечной граничности Сложность: Решение TPBVP, как известно, чувствительно к начальным догадкам. Для высоконелинейных систем численная интеграция может не сходится.
- Вычислительные расходы: Косвенные методы требуют решения дифференциальных уравнений с неизвестными граничными условиями, часто приводя к итеративному нелинейному корневому поиску, который плохо масштабируется с размерностью.
- Ограничения с ограничениями пути: Обработка ограничений состояния и смешанных ограничений может вводить сингулярные дуги и сложные переключающие структуры, которые трудно угадать априори.
- Отсутствие стойкости: Необходимые условия локальны; при невыпуклых проблемах существует множество стационарных решений, и метод может сходиться к субоптимальной экстремуме.
Несмотря на эти ограничения, вариационные методы остаются важными для теоретического анализа и бенчмаркинга. Они обеспечивают математическую основу как для прямого, так и для динамического подхода к программированию. Статья Википедии об оптимальном управлении предлагает широкий взгляд на различные методы решения .
Современные расширения и приложения
Надежный и стохастический оптимальный контроль
Вариационные методы были расширены до проблем с неопределенностью. В стохастическом оптимальном управлении функция затрат является ожиданием, а система приводится в действие броуновским движением. Уравнение Гамильтона-Якоби-Беллмана (HJB) возникает из динамического программирования, но вариационные формулировки (принцип стохастического максимума) обеспечивают альтернативный маршрут. Для надежного управления в формулах min-max используются вариационные неравенства для обработки наихудших случаев возмущений.
Оптимальный контроль дифференциальных уравнений (PDE)
Когда состояние регулируется PDE (например, уравнение тепла, Navier-Stokes), вариационные методы становятся необходимыми. Функционал затрат включает в себя интегралы в пространстве и времени, а необходимые условия приводят к смежным PDE, которые должны быть решены назад во времени. Эта структура широко используется в управлении потоком жидкости, структурной оптимизации и обработке изображений.
Усиление обучения и машинного обучения
Современные алгоритмы обучения усилению (RL) для непрерывного управления, такие как акторно-критические методы, неявно используют градиентные подходы, которые могут быть связаны с вариационным оптимальным управлением. Теорема политического градиента аналогична анализу чувствительности, полученному из уравнений затрат. Вариационные автокодировщики и оптимальный транспорт также имеют математические корни с исчислением вариаций.
Применение в аэрокосмической и робототехнике
Наведение ракеты, оптимизация траектории полета самолета и роботизированное планирование движения в значительной степени зависят от вариационных методов. Например, проблема ракеты Годдарда (максимизация высоты при использовании топлива) является классическим примером испытаний для косвенных методов. Аналогично, роботизированные манипуляторы часто решают ограниченное оптимальное управление, чтобы минимизировать энергию, избегая препятствий, используя прямое коллокация или множественную стрельбу, полученную из вариационных принципов.
Для читателей, интересующихся практическими реализациями, это хранилище GitHub курирует учебные пособия и примеры кода для решения оптимальных задач управления прямыми и косвенными методами.
Практические соображения по использованию вариационных методов
При применении вариационных методов к реальной проблеме оптимального управления, практикующие должны рассмотреть следующие шаги:
- Формулирование модели : Четко определить переменные состояния, управляющие входы, динамику и функциональную стоимость. Убедитесь, что динамика достаточно плавная для дифференциации (или используйте негладкий анализ, если это необходимо).
- Проверка ограничений: Определите, связана ли проблема с ограничениями управления, ограничениями состояния или терминальными ограничениями. Это определяет, является ли условие оптимальности ∂H/∂u = 0 или состоянием min- H .
- Деривные необходимые условия: Напишите гамильтониан, вычислите ∂H/∂x и ∂H/∂u, и получите систему ОДЭ состояния-состояния. Определите граничные и поперечные условия.
- Выбрать метод решения: Для низкоразмерных задач может быть эффективным метод косвенной съёмки с хорошей начальной догадкой. Для более высоких измерений или сложных ограничений прямое колокейшн (например, с использованием программного обеспечения, такого как CasADi или ACADO) часто более надежен.
- Оптимальность проверки: После получения решения-кандидата проверьте, что гамильтониан минимизирован по точечной схеме (если применяется ПМП) и проверьте условия второго порядка (выпуклость гамильтона) для подтверждения локальной оптимальности.
Выбор между косвенными и прямыми методами зависит от характеристик проблемы и знакомства пользователя с дифференциальными уравнениями.Многие современные библиотеки, такие как , на странице программного обеспечения Ассоциации вычислительного оптимального управления, предоставляют сравнительные ссылки.
Заключение
Вариационные методы обеспечивают строгую и элегантную математическую основу для решения задач оптимального управления. Преобразуя динамическую оптимизацию в задачу расчета вариаций, они дают необходимые условия — уравнения Эйлера-Лагранжа, гамильтоновскую формулировку и Максимум Принцип Понтрягина — которые направляют поиск оптимальных законов управления. Несмотря на вычислительные задачи, связанные с решением задач с двуточечными краевыми значениями, эти методы остаются незаменимыми для теоретического анализа, бенчмаркинга и понимания структуры оптимальных решений. Они были расширены для обработки ограничений, неопределенностей и распределенных систем параметров, и они лежат в основе многих современных алгоритмов в робототехнике, аэрокосмической промышленности и машинном обучении. По мере продолжения исследований, вариационные методы, вероятно, останутся краеугольным камнем теории оптимального управления, развиваясь для удовлетворения потребностей все более сложных и управляемых данными приложений.