Разработка оптимальных законов управления для недостаточно отработанных механических систем
Введение в недостаточно отработанные механические системы
Недоработанные механические системы являются фундаментальным классом систем, в которых количество независимых входов управления строго меньше, чем количество степеней свободы. Это неотъемлемое ограничение делает их управление гораздо более сложным, чем у полностью приводимых в действие систем, но они появляются повсеместно в современной технике. Примеры включают роботизированные манипуляторы с пассивными соединениями, воздушные транспортные средства, такие как квадрокоптеры и самолеты с неподвижным крылом, поверхностные и подводные суда, гибкие структуры и ходовые или ходовые роботы. Изучение оптимальных законов управления для этих систем является не просто академическим упражнением - это необходимо для достижения высокой производительности, безопасности и эффективности в реальных приложениях, начиная от автономных транспортных средств до промышленной автоматизации.
Недостаточная регулировка может возникнуть из-за выбора конструкции (например, снижения веса или стоимости привода), физических ограничений (например, корабль не может применять прямую боковую силу) или взаимодействия с окружающей средой (например, контакт ног ходячего робота с землей). Во всех случаях контроллер должен использовать динамику системы, включая гравитацию, инерцию и связь, для эффективного маневрирования. Разработка оптимального закона управления, который минимизирует критерий производительности, в то время как соблюдение ограничений является богатой и активной областью исследований.
Понимание недостаточно отлаженных механических систем
Основные характеристики
Недостаточная система определяется её конфигурационным пространством и пространством управления: если вектор конфигурации имеет размерность n и вектор управления имеет размерность m, подвывод означает m <n. Это несоответствие подразумевает, что система не может напрямую командовать всеми направлениями ускорения. Вместо этого контроллер должен полагаться на динамическую связь между приводимым в действие и невыключенным степенями свободы. Например, классический перевернутый маятник на тележке недостаточно затухает: тележка обеспечивает силу (один управляющий вход), но система имеет две степени свободы (положение тележки и угол маятника). На движение маятника влияет только ускорение тележки.
Выдающиеся примеры
- Карт-поле: Подвижная тележка со свободно качающимся маятником. Широко используется в обучении теории управления и в качестве эталона для нелинейного управления.
- Пеневматический маятник (Furuta Pendulum): Маятник, прикрепленный к вращающейся руке; двигатель управляет только вращением руки, но угол маятника не регулирован.
- Квадроторный БПЛА:] Четыре пропеллера обеспечивают тягу и крутящий момент, но квадротор имеет шесть степеней свободы (положение и ориентация). Он недостаточно активирован, потому что не может самостоятельно управлять всеми поступательными и вращательными движениями — он должен наклоняться для генерации горизонтального ускорения.
- Ходячие роботы (например, двуногие, четвероногие): На этапе стойки контакт стопы с землей накладывает ограничения; количество приводов намного меньше, чем общее количество суставов, что требует тщательного баланса и планирования походки.
- Автономные подводные транспортные средства (AUV): часто имеют меньше двигателей, чем степени свободы, что делает их неисправными, особенно при наведении в навигацию или маневрировании на низкой скорости.
- Гибкие структуры: Большие космические структуры или роботизированные руки с гибкими звеньями имеют бесконечно много режимов вибрации, но только несколько приводов, требующих расширенного управления для демпфирования и точности.
Почему неполноценность имеет значение
Недоработанные системы предлагают преимущества в весе, стоимости и энергоэффективности. Они также имитируют биологическую локомоцию - животные и люди по своей природе недостаточно приспособлены, используя пассивную динамику и координацию для элегантного движения. Однако их контроль в основном нелинейный и не голономический во многих случаях, что означает, что достижимые движения зависят от истории пути. Это свойство делает оптимальную конструкцию управления как критической, так и требовательной.
Цели оптимального дизайна управления
Стабильность
Основная цель любой системы управления состоит в том, чтобы гарантировать, что система замкнутого цикла остается стабильной. Для недостаточно настроенных систем стабильность часто включает регулирование системы до точки равновесия (например, балансирование маятника или зависание квадротора) или по желаемой траектории. Методы на основе Ляпунова обычно используются для обеспечения асимптотической или экспоненциальной стабильности в смысле Ляпунова. Поскольку недостаточно настроенная динамика нелинейна, линеаризация действительна только локально; глобальная стабилизация может потребовать управления на основе энергии или пассивности.
Выступление
Производительность, как правило, количественно определяется целевой или стоимостной функцией, которая фиксирует потребление энергии, время достижения цели, ошибку отслеживания, усилие управления или их комбинацию. Оптимальное управление стремится минимизировать (или максимизировать) эту стоимость при условии динамики системы и ограничений. Для недостаточно регулированных систем компромиссы неизбежны: быстрое вращение маятника потребляет больше энергии и может вызвать большой перерасход, тогда как медленное вращение может быть плавным, но неэффективным. Дизайнер должен выбрать соответствующий вес в функции затрат, чтобы соответствовать требованиям миссии.
хладнокровие
Системы реального мира подвержены параметрическим неопределенности (например, масса, инерция, трение), внешним возмущениям (ветер, волны, вариация полезной нагрузки) и немоделированной динамике (например, шум датчика, насыщение привода). Оптимальный закон управления должен работать надежно в этих условиях. Такие подходы, как теория надежного управления, модель предиктивного управления (MPC) с ограничениями или адаптивный контроль могут повысить надежность. Функция затрат также может включать показатели надежности, такие как нормы H-бесконечности, чтобы явно торговать производительностью для маржи стабильности.
Дополнительные цели
- Удовлетворение от ограничений: Многие недостаточно нагруженные системы работают в физических пределах — насыщение привода, ограничения соединения, избегание препятствий или контактные силы.Оптимальный контроль должен обеспечивать соблюдение ограничений, часто с помощью барьерных функций или ограниченной оптимизации.
- Траекторное планирование: Во многих приложениях (например, роботизированные манипуляции, полет дрона) контроллер должен генерировать практически оптимальные траектории, которые удовлетворяют дифференциальным ограничениям (неголономная динамика).
- Энергоэффективность: Особенно важна для аккумуляторных или беспилотных систем. Оптимальное управление может снизить потребление энергии за счет использования естественной динамики (например, подкачки маятника с помощью перекачки движения).
Методы разработки оптимальных законов контроля
Оптимальная теория контроля
Основой оптимального управления для недостаточно приспособленных систем являются вариационные принципы.Два краеугольных камня — это Минимальный принцип (PMP) Понтрягина (FLT: 1) и Динамическое программирование (FLT: 3) (что приводит к уравнению Гамильтона-Якоби-Беллмана (HJB).
- Минимальный принцип Понтрягина: PMP обеспечивает необходимые условия для оптимальности. Он вводит гамильтоновские, смежные переменные (костят) и граничные условия. Для недостаточно регулированных систем PMP может использоваться для получения дуг взрыва или сингулярных управляющих дуг, часто появляющихся в задачах минимального времени или минимальной энергии. Решение возникающей в результате двухточечной краевой задачи (BVP) численно дает оптимальное управление с открытым контуром. В то время как мощный PMP обычно не справляется с ограничениями состояния легко и может потребовать гомотопных методов.
- Динамическое программирование: Уравнение HJB предлагает достаточное условие для глобальной оптимальности через функцию значений. Однако для высокоразмерных недостаточно нагруженных систем решение HJB PDE является вычислительно неразрешимым (проклятие размерности). Приблизительное динамическое программирование (ADP) и нейродинамическое программирование были изучены для масштабирования этих методов, часто используя нейронные сети для представления функции значений.
Ляпуновский дизайн управления
Прямой метод Ляпунова является мощным инструментом для синтеза стабилизирующих законов управления обратной связью, даже для недостаточно нагруженных систем. Идея состоит в том, чтобы построить положительно определенную функцию кандидата Ляпунова V(x) , а затем вывести управление u , чтобы его производная по траекториям V?(x) была отрицательно определенной (или полуопределенной). Для недостаточно настроенных систем управление может не появляться непосредственно в V? для всех состояний, требующих формирования энергии или разделения и демпфирования на основе пассивности управления (IDA-PBC). В IDA-PBC целевая динамика выбрана как порт-гамильтоновая система с желаемой энергетической функцией, и закон управления вычисляется для соответствия структуре системы. Этот метод успешно применяется к механическим системам, таким как маятник Фуруты и подводные аппараты.
Линейная обратная связь
Линейизация обратной связи стремится превратить нелинейную систему в полностью или частично линейную с использованием диффеоморфизма и обратной связи нелинейного состояния. Для недостаточно настраиваемых систем система может быть , но не полностью линеаризируемой (то есть, внутренняя динамика остается). Оставшаяся динамика, известная как нулевая динамика, должна быть стабильной для работы контроллера. Управляя выходом (например, углом маятника относительно вертикали для тележки-поля), внутренняя динамика (движение тележки) должна быть ограничена. Общий подход сочетает линеаризацию обратной связи для вывода с линейным контроллером (например, LQR) на линеаризованной подсистеме, анализируя нулевую динамику отдельно. Около равновесия этот метод может достичь отличной производительности, но он может потерпеть неудачу глобально, если нулевая динамика станет нестабильной.
Модель предиктивного контроля (MPC)
Модели предиктивного управления решает конечную задачу оптимального управления в режиме онлайн, неоднократно, используя модель системы. Для нелинейных систем, нелинейная MPC (NMPC) особенно привлекательна, потому что она может обрабатывать ограничения, нелинейную динамику и несколько целей одновременно. Контроллер прогнозирует будущие состояния на горизонте N и оптимизирует управляющие входы при соблюдении состояния и входных ограничений. В каждый момент выборки применяется только первый контрольный ход, и оптимизация решается снова с помощью обновленных измерений. Достижения в вычислительной мощности и эффективных решателей (например, последовательное квадратичное программирование, схемы итерации в реальном времени) сделали NMPC возможным для систем, таких как квадроторы, ходовые роботы и автономные транспортные средства. Функция затрат в MPC может кодировать ошибку отслеживания, потребление энергии и комфорт. Однако потребность в точных динамических моделях и вычислительная нагрузка остаются проблемами, особенно для быстрой динамики.
Энергосберегающий контроль
Многие недостаточно активированные механические системы, особенно те, которые имеют пассивные степени свободы, могут управляться путем формирования их общей энергии. Классическим примером является подкачка энергии в систему (изменение точки поворота или прикладывание крутящего момента) на правильной фазе, маятник получает достаточно кинетической энергии, чтобы достичь перевернутого положения. Контроллеры на основе энергии часто полагаются на пассивность, используя тот факт, что естественная динамика системы является энергодиссипативной. Функция Ляпунова может быть построена из разницы между фактической и желаемой энергией плюс демпфирующий термин. Такие контроллеры обычно надежны и не требуют полного планирования траектории состояния - они просто приводят энергию к эталонному значению.
Управление скольжением (SMC) и переменная структура
SMC — это надежный нелинейный метод, который заставляет систему скользить по спроектированной поверхности в пространстве состояний. Он эффективен для несрабатывающих систем с соответствующими неопределенностями, поскольку он может обрабатывать нелинейности и нарушения. Однако болтовня из-за прерывистого переключения может ухудшить производительность. Модификации, такие как SMC более высокого порядка или сглаживание пограничного слоя, смягчают это. SMC можно комбинировать с оптимальными принципами управления, проектируя скользящую поверхность для минимизации интегральной стоимости (например, скользящий режим с LQR-оптимальной скользящей поверхностью). Это особенно полезно для таких систем, как роботизированные манипуляторы с пассивными соединениями.
Усиление обучения (RL) для оптимального контроля
В последние годы обучение с подкреплением (особенно глубокое RL) стало дополнительным подходом к традиционному оптимальному управлению для недостаточно нагруженных систем. Алгоритмы, такие как DDPG (глубоко детерминированный градиент политики), PPO и SAC изучают политику (законы управления) непосредственно из взаимодействия с окружающей средой или из моделирования. RL может обрабатывать сложные нелинейные динамики и неизвестные модели, что делает его привлекательным для сложных ненастроенных задач, таких как акробатические маневры, двуногие ходьбы или гонки на дронах. Однако эффективность выборки, гарантии безопасности и доказательства стабильности остаются открытыми проблемами. Многие исследователи объединяют RL с оптимальным управлением на основе модели (например, поиск политики на основе MPC), чтобы извлечь выгоду из сильных сторон как на основе данных, так и на основе моделей.
Математическая формула задачи оптимального управления
Типичная задача оптимального управления недостаточной механической системой формулируется следующим образом.Динамика системы задается дифференциальным уравнением второго порядка:
M(q) që + C(q, q?) q? + G(q) = B(q) u
где q ∈ Rn являются обобщенными координатами, M(q) является матрицей инерции, C(q, q?) содержит кориолис и центробежные термины, G(q) представляет гравитационные силы, u ∈ Rm является управляющим входом, а B(q) является матрицей отображения входа.Подключение подразумевает, что ранк(B) = m < n. Оптимальное управление стремится минимизировать:
J = φ(q(T), q?(T)) + ⁇ 0T L(q(t), q?(t), u(t)) dt
с учетом ограничений состояния (например, пределов соединения, скоростных границ) и входных ограничений (например, насыщения привода). Конечная стоимость φ и эксплуатационные расходы L выбираются разработчиком. Решение этой проблемы непосредственно, как правило, неразрешимо аналитически для нелинейных недостаточно отлаженных систем, следовательно, зависимость от численных методов или приблизительных решений с помощью методов, описанных выше.
Проблемы в разработке оптимальных законов управления для недостаточно отработанных систем
Нелинейность и неголономия
Недоработанные системы по своей сути нелинейны. Их динамика часто проявляет сложные поведения, такие как бифуркации, хаотические движения и сингулярности. Многие из них также не голономичны, что означает, что достижимые скорости системы в любой конфигурации ограничены подпространством, но ограничения не интегрируемы (например, катящееся колесо или робот-змея). Это усложняет планирование траектории: управление не может просто позиционировать систему напрямую; оно должно использовать пути и дифференциальные ограничения. Оптимальное управление должно явно учитывать эти нелинейные ограничения, часто требующие многократной стрельбы или методов прямого коллокации.
Ввод и государственные ограничения
Физические ограничения, такие как пределы крутящего момента двигателя, пределы угла стыка и предотвращение препятствий, налагают неравенства как на состояния, так и на входы. Приведение их в оптимальную структуру управления увеличивает сложность задачи. Например, квадротор не может превышать максимальную тягу; шагающий робот должен поддерживать контактную силу ноги в колбочках трения. Необходимо гарантировать осуществимость оптимального решения, которое может потребовать смягчения ограничений или барьерных функций.
Модель неопределенности и беспорядков
Точные модели недостаточно приспособленных систем часто трудно получить. Трение, гибкость, динамика привода и взаимодействия с окружающей средой (например, сопротивление воздуха, наземные контакты) вводят неопределенности. Оптимальные законы управления, предназначенные для идеализированной модели, могут работать плохо в реальности. Надежный оптимальный контроль или адаптивный оптимальный контроль (например, использование идентификации системы в паре с MPC) поэтому является активной областью исследований. компромисс между надежностью и оптимальностью особенно очевиден.
Вычислительная сложность
Оптимальное управление в режиме реального времени для недостаточно оснащенных систем требует быстрых решателей. Нелинейный MPC требует решения проблемы ограниченной оптимизации в каждый момент выборки; для высокоразмерных систем (например, гуманоидных роботов с десятками суставов) это может быть вычислительно запретительным. Снижение модели, явная MPC и офлайн-оптимизация (например, примитивы движения) являются общими обходными путями. Появление ускорения GPU и специализированного оборудования (например, решатели на основе FPGA) раздвигает границы, но сложность остается основным препятствием.
Глобальный оптимизм против локальной оптимы
Стоимость ландшафта для недостаточно отработанных систем часто невыпуклый, пронизанный локальными минимумами. Алгоритмы оптимизации на основе градиента (например, прямое коллокация, одиночная съемка) могут сходиться к субоптимальным решениям, если первоначальные догадки не являются отличными. Глобальные методы оптимизации (например, рой частиц, смоделированный отжиг) существуют, но слишком медленные для реального времени. Гибридные подходы, которые сочетают планирование на основе выборки (RRT, PRM) с локальной оптимизацией (например, CHOMP, TrajOpt) популярны в планировании движения для недостаточно отремонтированных роботов.
Тематические исследования и приложения
Квадротор Траектория Отслеживание
Квадроторы являются классическим испытательным стендом для недостаточного оптимального управления. Типичный оптимальный контроллер минимизирует рывок или щелчок (четвертая производная положения) для генерации гладких, энергоэффективных траекторий при соблюдении пределов тяги. Широко используется нелинейный MPC: состояние квадротора (позиция, скорость, ориентация, угловая скорость) прогнозируется на коротком горизонте (0,5-2 секунды) при оптимизации для отслеживания ошибок и входных усилий. Недостаточная тяга преодолевается путем обеспечения наклона вектора тяги, введения связи между переводом и вращением. Последние работы включают предотвращение препятствий и отторжение помех ветра (например, с использованием надежного MPC на основе трубки).
Бипедальная ходьба
Ходячие роботы, такие как двуногие Cassie или Asimo, сильно неактивны в течение одной фазы поддержки (только одна нога в контакте, крутящий момент лодыжки ограничен). Оптимальное управление используется для планирования и стабилизации циклов походки. Проблема часто формулируется как гибридная система (непрерывная динамика + дискретные воздействия на стопу). Методы включают прямую транскрипцию оптимальной проблемы управления (например, использование FROST или OCS2) в сочетании с модельным прогностическим контролем для онлайн-адаптации. Энергооптимальные походки, которые минимизируют стоимость транспорта (COT), являются основной целью, достигаемой за счет использования пассивной динамики через модели весенней массы и оптимизации сил реакции на земле.
Автономные подводные транспортные средства (AUV)
Многие АУВ используют только несколько двигателей (например, два задних и два вертикальных) для навигации по шести степеням свободы. Оптимальные законы управления для отслеживания траектории или парения должны учитывать гидродинамическое сопротивление, токи и связь между осями (например, шаг влияет на скорость вперед). Применялись методы на основе Ляпунова и МПК. Проблема недостаточной регулировки является острой на низких скоростях (где плавники теряют эффективность), требуя тщательной конструкции колебательного движения или использования устойчивых углов.
Будущие направления и тенденции исследований
Быстро развивается область оптимального управления недостаточно отработанными механическими системами.
- Обучение на основе управления: Обучение с глубоким подкреплением и обучение имитационному обучению интегрируются с оптимальным управлением на основе модели. Гибридные подходы (например, остаточная динамика обучения или функции затрат) обещают объединить эффективность данных MPC с адаптивностью RL. Усилия по обеспечению стабильности и безопасности через функции Ляпунова в цикле обучения (например, нейронный контроль Ляпунова) набирают обороты.
- Безопасно-критический контроль: Реальное развертывание требует формальных гарантий. Функции барьера управления (CBF) и функции управления Ляпунова (CLF) обеспечивают доказуемую безопасность и стабильность, соответственно. Комбинирование квадратичных программ на основе CBF-CLF (QP) с оптимальным управлением дает основу, которая обменивается производительностью для безопасности вычислительно эффективным образом.
- Кооперативные и многоагентные системы: Недоработанные системы часто работают в роях (например, дрон-формации, команды роботов). Распределённое оптимальное управление, при котором каждый агент решает локальную задачу оптимизации при общении с соседями, является активной областью. Недозагрузка добавляет сложность, поскольку каждый агент должен координировать свои ограничения движения.
- Методы сокращения модели (например, правильное ортогональное разложение, динамическое разложение режима) и изученные модели (например, нейронные обычные дифференциальные уравнения) позволяют в реальном времени оптимально управлять высокоразмерными недостаточно приспособленными системами, сжимая динамику в низкоразмерное скрытое пространство.
- Различимое моделирование:] Такие инструменты, как MuJoCo, дифференцируемые физические двигатели на основе PyTorch и CasADi, позволяют сквозную оптимизацию законов управления с использованием градиентов через динамику. Это облегчает одновременную оптимизацию как траектории, так и параметров высокого уровня (например, морфологии или весов затрат).
Заключение
Разработка оптимальных законов управления для недостаточно приспособленных механических систем является сложной, но чрезвычайно полезной задачей. Фундаментальная асимметрия между входами управления и степенями свободы заставляет инженеров глубоко понимать динамику, использовать пассивные явления и использовать сложные математические инструменты. От классических методов, таких как принцип Понтрягина и дизайн Ляпунова, до современных подходов, таких как нелинейный MPC и обучение подкреплению, инструментарий продолжает расширяться. В то время как огромные проблемы остаются - особенно в отношении вычислительной реализации в реальном времени и надежности - быстрые достижения в алгоритмах, аппаратных средствах и междисциплинарных исследованиях раздвигают границы того, что возможно. Эти методы не только позволяют создавать необычные новые возможности в робототехнике, аэрокосмической и морской технике, но также обогащают наше фундаментальное понимание систем управления и динамических систем.
Для читателей, заинтересованных в более глубоком погружении, отличные ресурсы включают классический учебник Недоразвитая робототехника Расса Тедрака (MIT OpenCourseWare) и Нелинейные системы Х. К. Халила. Для теории оптимального управления EE363 (Стэнфорд) предоставляет лекционные заметки о линейной и нелинейной оптимизации. Для практиков библиотека Python Недоразвитая робототехника предлагает практические реализации многих законов управления, обсуждаемых здесь.