Глубокое погружение в решение проблемы граничных значений в оптимальном контроле

Какие существуют проблемы с пограничной стоимостью при оптимальном контроле?

Оптимальная теория управления обеспечивает математическую основу для определения политики управления, которая минимизирует или максимизирует показатель эффективности с течением времени, при условии динамических ограничений. В основе многих формулировок оптимального управления лежит необходимость решения проблемы граничных значений (BVP). Проблема граничных значений представляет собой систему обычных или частичных дифференциальных уравнений, сопровождаемых условиями, которые должны удовлетворяться в двух или более различных точках независимой переменной— типично начальное и конечное время. Это резко контрастирует с проблемами начальных значений, где все условия указаны в одной исходной точке. При оптимальном контроле BVP возникают естественным образом из уравнения Понтрягина Максимум Принцип (PMP) или уравнения Эйлера-Лагранжа из исчисления вариаций, что приводит к проблеме двухточечных краевых значений (TPBVP), решение которой дает оптимальное состояние и траектории управления.

Понимание BVP имеет важное значение, поскольку они управляют оптимальным поведением широкого спектра систем: от оптимизации траектории космического корабля и планирования движения робота до управления химическими процессами и моделирования экономического роста.Сложность BVP обусловлена их нелокальной природой— решение в любой точке зависит от условий на обеих границах, что делает их более трудными для решения аналитически, чем проблемы с начальной стоимостью.

Формулирование BVP в оптимальном управлении

Формулировка BVP в оптимальном управлении обычно начинается с динамической системы, описанной уравнениями состояния .

\[\dot{\mathbf{x}}(t) = \mathbf{f}(\mathbf{x}(t), \mathbf{u}(t), t), \quad \mathbf{x}(t 0) = \mathbf{x} 0\)

где \(\mathbf{x}(t) \in \mathbb{R}^n\) - вектор состояния, \(\mathbf{u}(t) \in \mathbb{R}^m\) - вектор управления, а \(t 0\) - начальное время.

\[J = \phi(\mathbf{x}(t f), t f) + \int {t 0}^{t f} L(\mathbf{x}(t), \mathbf{u}(t), t) \, dt\]

с учетом терминальных ограничений \(\psi(\mathbf{x}(t f), t f) = 0\).

Применяя ПМП, мы определяем гамильтониан: \(H = L + \boldsymbol{\lambda}^T \mathbf{f}\), где \(\boldsymbol{\lambda}(t) \in \mathbb{R}^n\) являются стоимостными переменными (также называемыми смежными переменными).Необходимыми условиями оптимальности являются:

Условие стационарности может быть использовано для устранения управления в терминах состояния и стоимости, что дает сопряженную систему из 2n обыкновенных дифференциальных уравнений первого порядка (ODE) с граничными условиями, разделенными между начальным и конечным временем.

Гамильтоновская система

Гамильтоновская система состоит из уравнений состояния и стоимости. Для типичной задачи оптимального управления без ограничений пути эти уравнения образуют гамильтоновскую систему, которая сохраняет гамильтоновское значение по оптимальной траектории, если система автономна и конечная стоимость не имеет явной зависимости времени. Уравнения состояния распространяются вперед, в то время как уравнения состояния распространяются назад во времени. Эта смешанная природа движения вперед-обратно делает BVP сложной: начальные условия известны только частично (состояние при \(t 0\)) и частично неизвестны (состояние при \(t 0\)), в то время как остальные условия указаны в конечное время. Решение должно пересекать обе границы одновременно.

Граничные условия и трансверсальность

Границы в оптимальных управляющих ВВП – это больше, чем просто фиксированные начальные и конечные состояния.

Правильная формулировка этих граничных условий имеет решающее значение. Неточно определенные условия могут привести к численной нестабильности или конвергенции к неоптимальным решениям. Для тщательного лечения условий поперечности см. классический текст Брайсона и Хо.

Методы решения проблем граничных значений

Поскольку аналитические решения для BVP в оптимальном управлении редко возможны, за исключением очень простых систем (например, линейного квадратичного регулятора с фиксированным конечным временем), численные методы необходимы. Основные категории включают методы съемки, методы конечных различий и методы коллокации. Каждый имеет сильные и слабые стороны в зависимости от структуры проблемы и размерности.

Методы стрельбы

Методы съемки превращают BVP в проблему начального значения (IVP) путем угадывания отсутствующих начальных условий (обычно начальной стоимости) и затем интеграции гамильтоновой системы вперед к терминальному времени. Затем используется терминальное несоответствие (разница между вычисленными конечными условиями и желаемыми терминальными условиями) для обновления догадки. Этот итерационный процесс по существу решает нелинейную проблему поиска корней. Простая съемка использует только одну переднюю интеграцию на итерацию; множественная съемка разделяет временной интервал на сегменты, интегрируя каждый сегмент отдельно и навязывая условия непрерывности на границах сегмента. Множественная съемка улучшает стабильность для высоко нелинейных или жестких систем и широко реализована в программном обеспечении, таком как BNDSCO и DIRCOL.

Методы съемки интуитивно понятны и используют зрелые интеграторы ОДЭ, однако они могут быть чувствительны к плохим первоначальным догадкам и могут не сработать при проблемах с длинными временными горизонтами или высокой чувствительностью к начальным условиям.

Методы конечных различий

Методы конечной разницы дискретизируют состояние и стоимостную динамику непосредственно на сетке точек времени. Дифференциальные уравнения заменяются конечными приближениями разности (например, форвардными схемами Эйлера, трапециевидными или схемами Рунге-Кутты). Граничные условия становятся ограничениями равенства в первой и последней точках сетки. Результатом является большая система алгебраических уравнений, которые должны решаться одновременно— как правило, с использованием методов Ньютона. Этот подход позволяет избежать явной прямолинейной интеграции и может обрабатывать многоточечные BVP естественным образом. Ярким примером является метод линий для параболических PDE, но для ODE BVPs он прост в реализации.

Методы с конечным различием обеспечивают надежную альтернативу, особенно для проблем с известной структурой решения. Они требуют решения больших разреженных линейных систем при каждой итерации Ньютона, что может быть вычислительно дорогостоящим для пространств с высоким размером состояний, но выигрывает от методов параллелизации и разреженной матрицы.

Методы коллокации

Методы коллокации представляют собой траектории состояния и управления как поштучные полиномы (обычно сплины) и обеспечивают выполнение дифференциальных уравнений точно в наборе точек коллокации в пределах каждого интервала времени. Граничные условия и условия непрерывности между интервалами налагаются в качестве дополнительных ограничений. Получившаяся в результате нелинейная задача программирования (NLP) может быть решена с помощью готовых оптимизаторов, таких как IPOPT или SNOPT. Методы коллокации являются основой современных подходов прямой транскрипции к оптимальному управлению, таких как псевдоспектральный метод Legendre-Gauss-Lobatto, который используется в популярном программном обеспечении GPOPS-II. Эти методы обеспечивают высокую точность (экспоненциальная конвергенция для плавных задач) и особенно подходят для проблем с ограничениями пути.

Подробное сравнение численных методов BVP см. в работе Ascher, Mattheij, and Russell's "Numerical Solution of Boundary Value Problems for Ordinary Differential Equations" .

Выбираем правильный метод

Выбор метода зависит от нескольких факторов:

  • Размер проблемы: Для маломерного состояния (n ≤ 10) методы съемки часто адекватны. Для высокоразмерных или крупномасштабных задач колокация или конечная разница могут масштабироваться лучше.
  • Твердость динамики: Жесткие системы требуют неявной интеграции, с которой колокейшн и конечная разность обрабатываются естественным образом.Способы стрельбы могут требовать специально разработанных жёстких интеграторов.
  • Наличие хорошей начальной догадки: Методы стрельбы сильно зависят от исходного качества догадки.Если доступно грубое приближение оптимальной траектории (например, от эвристической или упрощенной модели), стрельба может быстро сходиться.
  • Ограничения пути: Когда существуют ограничения неравенства на состояния или элементы управления, методы прямой транскрипции (коллокации) обычно более гибкие.

Проблемы и соображения

Решение задач BVP в области оптимального управления не является рутинной задачей, необходимо решить несколько задач.

Чувствительность и конвергенция

Небольшие изменения неизвестных граничных условий могут вызвать большие отклонения в конечном состоянии из-за экспоненциального роста ошибок в нестабильных направлениях. Особенно остро это проявляется в простой съёмке, которая может проявлять плохую кондиционацию. Многократные съёмки и стратегии сетки смягчают это, обеспечивая более условную проблему. Дополнительно ньютоновские методы для шага корневого поиска требуют точных якобианцев, которые могут быть получены посредством конечных различий или автоматической дифференциации.

Масштабирование и нормализация

Переменные (состояния, стоимость, время) часто охватывают разные порядки величины. Плохое масштабирование приводит к плохо обусловленным якобианам и медленной конвергенции. Нормализация времени до фиксированного интервала (например, [0,1]) и масштабирование состояний до диапазона единиц являются стандартными этапами предварительной обработки. Для проблем со свободным конечным временем временной горизонт часто рассматривается как дополнительная неизвестная переменная, а динамика преобразуется в нормализованную временную координату.

Сингулярные дуги и негладкие решения

В некоторых оптимальных задачах управления гамильтониан может быть линейным в управлении, что приводит к сингулярным дугам, где условие стационарности не может определить управление. Эти дуги требуют специальной обработки, например, использования того факта, что временные производные функции переключения исчезают. Сингулярные BVP более сложны и часто требуют условий более высокого порядка (например, условие Келли). Аналогично, ограничения управления могут вызывать профили управления взрыв-вспышка с прерывистыми траекториями управления, которые бросают вызов численным методам, которые предполагают дифференцируемость. Настраиваемые методы поиска корней или гомотопии могут решать эти проблемы.

Расчетные затраты

Высокоразмерные системы (n > 50) распространены в аэрокосмической и робототехнике. Методы конечной разницы и коллокации приводят к большим НЛП с тысячами переменных и ограничений. Эффективные разреженные линейные алгебры и методы разложения (например, последовательное квадратичное программирование) имеют важное значение. Методы съемки могут быть более эффективными для умеренных измерений, если динамика дешева для интеграции. В последние годы машинное обучение и суррогаты нейронных сетей были изучены для ускорения решения BVP, хотя они остаются темами активных исследований.

Реальные приложения и тематические исследования

Решение задач с пограничной стоимостью в оптимальном управлении не является академическим упражнением, оно ежедневно используется в инженерном проектировании и операциях.

Aerospace: Launch Vehicle Ascent (недоступная ссылка)

Одним из классических применений является оптимальное восхождение ракеты-носителя с Земли на орбиту. Динамика транспортного средства включает в себя трехмерное движение, различную массу из-за сжигания топлива и атмосферного сопротивления. Цель состоит в том, чтобы минимизировать расход топлива (или максимизировать полезную нагрузку). Полученная TPBVP включает терминальные ограничения на высоту, скорость и угол траектории полета. Методы стрельбы в сочетании с гомотопией из известного более простого решения (например, вакуумный полет) используются в обычном режиме. Программа OTIS НАСА и программное обеспечение ASTOS Европейского космического агентства полагаются на передовые решатели BVP.

Робототехника: оптимальный по времени путь

Для роботизированных манипуляторов, которым поручено следовать по предписанному геометрическому пути, задача оптимального управления сводится к минимизации времени прохождения при соблюдении пределов крутящего момента. Динамика приводит к набору дифференциальных уравнений с граничными условиями положения и скорости в начале и конце пути. Методы коллокации здесь превосходят, потому что путь может быть параметризирован одной скалярной переменной, в результате чего в реальном времени может быть решена небольшая BVP для планирования реактивного движения.

Экономика: оптимальные модели роста

В макроэкономике модель роста Рэмси стремится найти путь потребления, который максимизирует социальное благосостояние за бесконечный горизонт. Это приводит к BVP с уравнениями состояния (капитала) и стоимости (теневой цены), с условиями поперечности в бесконечности (часто аппроксимируемыми в большое конечное время). Обычно применяются численные методы съемки с асимптотическими граничными условиями. Работа Кеннета Джадда и других исследовала использование методов проекции для этих BVP.

Пример: простая одномерная проблема

Рассмотрим задачу минимизации \(\int 0^1 (x^2 + u^2) dt\) с динамикой \(\dot{x} = u\), фиксированным начальным состоянием \(x(0)=1\), и свободным конечным состоянием.Гамильтониан — \(H = x^2 + u^2 + \lambda u\), \(\partial H/\partial u = 2u + \lambda = 0\) так \(u = —\lambda/2\), \(\dot{x} = —\lambda/2\), \(\dot{\lambda} = —2x\). Система линейна с граничными условиями \(x(0)=1\) и \(\lambda(1)=0\) (поскольку конечная стоимость равна нулю).У этого TPBVP есть аналитическое решение: \(x(t) = \frac{e^{t} + e^{2}}\),

Заключение

Проблемы граничных значений образуют основу оптимального анализа и проектирования управления. От теоретической формулировки через Максимум Принцип Понтрягина до практического численного решения с использованием методов съемки, конечной разницы или коллокации понимание BVP незаменимо для любого, кто работает с динамической оптимизацией. Врожденные проблемы чувствительности, масштабирования и негладки требуют тщательного выбора алгоритма и предварительной обработки проблемы. Тем не менее, выигрыш существенен: способность вычислять действительно оптимальные траектории для широкого спектра реальных систем. По мере того, как современные приложения управления расширяют границы сложности, продолжающиеся достижения в BVP-решителях & #8212; включая адаптивную уточнение сетки, параллельные вычисления и интеграцию с машинным обучением & #8212; останется важным. Для дальнейшего чтения всеобъемлющее «Оптимальное управление» Ленхарт и Рабочий обеспечивает доступное введение, в то время как классический «Прикладное оптимальное управление» Бра