Новые тенденции в алгоритмах управления реакционными колесами с использованием машинного обучения

Реакционные колеса являются критическими приводами в управлении отношением космических аппаратов, обеспечивая точные изменения ориентации без расхода топлива. Традиционные подходы к управлению основаны на линеаризованных моделях и компенсаторах пропорционально-интегрально-производных (PID), но растущая сложность современных миссий - от гибкого наблюдения Земли до интерферометрии в глубоком космосе - требует алгоритмов, которые могут обрабатывать нелинейную динамику, неопределенные возмущения и деградировавшее оборудование. Машинное обучение (ML) предлагает новую парадигму: управление на основе данных, которое может учиться из телеметрии, адаптироваться к изменяющимся условиям и оптимизировать производительность в реальном времени. В этой статье рассматриваются наиболее перспективные методы ML для управления реакционным колесом, оценивается их преимущества и ограничения и описывается путь к практическому развертыванию в системах, отвечающих требованиям полета.

Основы управления реакционным колесом

Реакционное колесо — это устройство обмена импульсами: по мере ускорения колесо оказывает на корпус космического корабля крутящий момент, вращая его вокруг оси колеса. Система регулируется сохранением углового момента, а приложенный к космическому кораблю сетевой крутящий момент равен инерции колеса, умноженной на его угловое ускорение. Большинство реакционных колесных сборок используют три ортогональных колеса (или четыре в избыточной конфигурации пирамиды) для обеспечения трехосевого управления.

Классические архитектуры управления обычно используют каскад из двух петель: внешняя петля для определения отношения (с использованием звездных трекеров, датчиков Солнца или гироскопов) и внутренняя петля для регулирования скорости колеса. Внутренняя петля часто использует PID-контроллер, который командует напряжением двигателя на основе ошибки между желаемой и фактической скоростью колеса. В то время как PID-контроль прост и хорошо понятен, он имеет значительные недостатки:

Эти ограничения мотивируют поиск более интеллектуальных законов управления. Машинное обучение, с его способностью моделировать сложные отображения и генерировать оптимальные политики из данных, является естественным кандидатом.

Парадигмы машинного обучения в управлении колесом реакции

Усиление обучения (RL), нейронные сети (NN) и глубокое обучение (DL) являются тремя категориями ML, наиболее активно исследуемыми для контроля отношения. Дополнительные методы, такие как гауссовые процессы и машины опорных векторов, также появляются в литературе, но имеют меньшее наследие полета.

Усиление обучения для оптимального поиска политики

В RL контроллер представляет собой агент, который взаимодействует с окружающей средой космического корабля — изменение скорости колеса и получение обратной связи в виде сигнала вознаграждения (например, ошибка отрицательного отношения, квадрат минус термин для усилия управления). Агент узнает политику, которая отображает состояния (отношение, угловая скорость, скорости колес) на действия (команды напряжения) для максимизации совокупного вознаграждения. Известные работы, такие как Schaub et al. (2022) , продемонстрировали, что глубокие Q-сети могут достичь превосходной точности указания по сравнению с PID во время симулированных маневров сужения с неизвестной инерцией.

Нейронные сети для моделирования динамики и обратного контроля

Нейронные сети превосходят по приближению нелинейные функции. При управлении реакционным колесом они используются двумя основными способами:

Исследование 2023 года в журнале «Руководство, управление и динамика» link показало, что нейронная сеть, обученная на данных моделирования высокой точности, уменьшила изменение скорости колеса на 30% по сравнению с настроенным PID-контроллером во время типичного сценария наблюдения Земли.

Глубокое обучение для обнаружения аномалий и контроля, допускающего ошибки

Архитектуры глубокого обучения, особенно автокодеры, сети долговременной кратковременной памяти (LSTM) и трансформаторы, развертываются для обнаружения возникающих неисправностей в реакционных колесах. Изучая нормальные модели тока колеса, скорости и температуры, глубокие модели могут отмечать отклонения, которые указывают на ухудшение несущих или надвигающийся сбой. Выход может вызвать переход к более консервативной стратегии управления или бесшовную реконфигурацию к избыточному колесу.

Например, исследователи из Европейского космического агентства (FLT:0) продемонстрировали, что система обнаружения неисправностей на основе LSTM может идентифицировать аномалии дисбаланса колес до трех орбит, прежде чем они станут критическими, что позволяет проводить активные корректировки отношения, которые предотвращают прерывание миссии.

Преимущества ML-Driven Reaction Wheel Control

Переход от алгоритмов с фиксированной структурой к изученным политикам предлагает несколько измеримых преимуществ, которые являются привлекательными как для недорогих CubeSats, так и для флагманских миссий.

Улучшенная адаптация к немоделированной динамике

Космические аппараты редко ведут себя точно так, как прогнозировалось на земле. Топливный слош, изгиб солнечной батареи, тепловое искривление и магнитный гистерезис вносят возмущения, которые бросают вызов простым параметрическим моделям. Алгоритмы ML могут автоматически регулировать свое поведение на основе наблюдений в реальном времени. Например, обучающие агенты по усилению могут непрерывно совершенствовать свою политику во время миссии, эффективно выполняя онлайн-адаптацию без человека в цикле. Это делает их устойчивыми к деградации, такой как повышенное трение в подшипниках реакционных колес старения.

Повышение энергоэффективности и снижение ношения

Управление реакционным колесом является основным потребителем бортовой электроэнергии. Традиционные ПИД-контроллеры имеют тенденцию к перегрузке колес, вызывая быстрое ускорение и замедление, которые тратят энергию и ускоряют износ подшипников. Контроллеры на основе ML, обученные с функцией вознаграждения, которая наказывает чрезмерное угловое ускорение, изучают более плавные профили крутящего момента. Сравнительный тест, проведенный на установке аппаратного обеспечения в цикле в Техасском университете в Остине, показал, что контроллер глубокого обучения с подкреплением потреблял на 40% меньше энергии, чем стандартный ПИД, сохраняя точность указания в пределах 0,01 °.

Надежность к шуму датчика и временно отсутствующая обратная связь

Глубокие нейронные сети могут быть обучены на шумных данных датчиков и могут даже выполнять оценку состояния неявно. Архитектуры, такие как LSTM, используют временные корреляции для фильтрации шума измерения. Более того, политика RL, обученная моделированию в различных сценариях отсева датчиков, может научиться преодолевать прошлые наблюдения, сохраняя стабильность отношения в течение нескольких секунд без обновлений. Это имеет решающее значение для периодов высокого возмущения, когда звездные трекеры ослеплены Солнцем или во время стрельб подруливающего устройства.

Проблемы и трудности в осуществлении

Несмотря на обещание, интеграция МО в системы управления, отвечающие требованиям полета, сталкивается со значительными инженерными и нормативными барьерами. Эти проблемы должны быть решены до того, как управление реакционным колесом на основе МО станет стандартной практикой.

Дефицит данных и разрыв между симом и реальным

Сбор больших наборов данных с метки от реальных операций колеса реакции затруднен, потому что телеметрия космического корабля скудна и дорогостояща для получения. Большинство моделей ML, следовательно, обучены высокоточным симуляциям, но разрыв между симуляцией и реальностью (проблема «от симуляции до реальности») может привести к плохой производительности, когда модель сталкивается с неожиданными условиями. Рандомизация домена - обучение по широкому спектру параметров, таких как инерция, трение и шум - помогает, но не гарантирует покрытие всех сбоев.

В ходе последних работ было изучено обучение передаче: подготовка к симуляции, а затем тонкая настройка небольшого количества реальных данных о полетах. Однако летные компьютеры часто не имеют вычислительного зала для точной настройки во время миссии, поэтому модель должна быть заморожена до запуска. Альтернативой является использование модели на основе RL с онлайн-идентификацией системы, но это добавляет сложности.

Вычислительные ограничения бортовых процессоров

Процессоры космического класса, такие как RAD750 или новый GR740, предлагают гораздо меньшую вычислительную мощность, чем наземные процессоры или графические процессоры. Глубокие нейронные сети с миллионами параметров недоступны. Задача состоит в том, чтобы разработать легкие архитектуры ML, которые могут работать в режиме реального времени (< 10 мс петля управления) без превышения пределов процессора. Такие методы, как квантование, обрезка и перегонка знаний, могут уменьшить размер модели на порядок с минимальной потерей точности. Ускорители на основе FPGA также исследуются для бортового вывода.

Проверка, проверка и сертификация

Космическая индустрия требует доказуемых гарантий безопасности для критических функций управления. Алгоритмы ML по существу являются черными ящиками: их поведение изучено, а не аналитически выведено. Демонстрация того, что контроллер нейронной сети никогда не вызовет насыщение реакционного колеса или загонит космический корабль в невосстановимый режим кувыркания, чрезвычайно сложна. Формальные инструменты проверки для нейронных сетей существуют (например, Reluplex, Marabou), но практичны только для небольших сетей (<100 нейронов).

Регулирующие органы, такие как НАСА и ЕКА, еще не выпустили формальные стандарты для управления на основе ML в пилотируемых или дорогостоящих миссиях. Повышенное принятие, вероятно, произойдет сначала во вторичных полезных нагрузках или недорогих CubeSats, где допуск к риску выше. Для пилотируемых космических аппаратов гибридный подход, при котором классический резервный контроллер перекрывает выход ML, если он превышает пределы безопасности, является наиболее жизнеспособным путем.

Объяснение и диагностика

Когда контроллер на основе ML производит неожиданную команду, инженерам необходимо понять, почему. Объясняемые методы ИИ (SHAP, LIME, интегрированные градиенты) могут приписывать решения функциям ввода, но они добавляют вычислительные накладные расходы и еще не являются надежными в критически важных для безопасности контекстах. Пока анализ первопричины не может быть выполнен с уверенностью, многие планировщики миссий будут скептически относиться к полной автономии ML.

Будущие направления и исследовательские рубежи

В следующем десятилетии, вероятно, будет наблюдаться постепенное, но устойчивое вливание ML в управление колесом реакции, что обусловлено достижениями как в алгоритмах, так и в аппаратном обеспечении.

Гибридные архитектуры управления

Наиболее прагматичный подход заключается в встраивании ML в традиционную структуру управления. Например, PID-контроллер может получать адаптивные преимущества, вычисляемые небольшой нейронной сетью, которая обучена минимизировать показатель производительности. Альтернативно, модель предиктивного контроллера может использовать изученную модель динамики для своих прогнозов, сохраняя при этом безопасный решатель оптимизации через жесткие ограничения. Такие гибридные системы сохраняют проверяемость (базовый PID хорошо понятен) при использовании ML для улучшенной адаптации.

На борту непрерывное обучение

Будущие космические процессоры могут включать в себя специализированные ускорители ML, которые позволяют алгоритму управления запускать и обновлять себя во время миссии. Алгоритмы непрерывного обучения, основанные на консолидации эластичного веса или прогрессивных нейронных сетях, могут позволить контроллеру адаптироваться к новым нарушениям, не забывая ранее изученное поведение. Это активная область исследований, первая демонстрация на орбите ожидается в миссии CubeSat в течение следующих пяти лет.

Обучение на основе моделирования и цифровые близнецы

Высокоточные цифровые двойники реакционных колесных сборок — включающие тепловые эффекты, микровибрацию и механический износ — разрабатываются для обеспечения практически неограниченного количества обучающих данных. Обучение может быть выполнено полностью в моделировании, затем политика компилируется в легкую нейронную сеть для развертывания. «Управление космических транспортных средств» Исследовательской лаборатории ВВС США продемонстрировало этот конвейер для проблемы управления реакционным колесом, достигая нулевого перевода с моделирования на лабораторную испытательную стенду.

Интеграция с модельным прогнозным контролем

Модель предиктивного управления (MPC) уже используется на нескольких космических аппаратах для маневров с позиции, которые требуют явной обработки ограничений (например, ограничения на укачивание для защиты чувствительных инструментов). Объединение MPC с дифференцируемой модели изученной динамики позволяет более точно оптимизировать и повторно использовать вычисления на временных этапах. Вычислительная стоимость MPC является основным барьером, но в настоящее время тестируются решатели в реальном времени, работающие на летных компьютерах на основе NVIDIA Jetson.

Заключение

Машинное обучение не является панацеей для управления реакционными колесами, но оно предлагает ощутимые улучшения в адаптивности, эффективности и отказоустойчивости, которые все больше необходимы для космических аппаратов следующего поколения. По мере роста возможностей бортовых вычислений и созревания методологий проверки мы можем ожидать, что в течение следующих пяти-десяти лет мы увидим управление с помощью ML на эксплуатационных спутниках. Ключ к успеху заключается в постепенном принятии: развертывании легких моделей в качестве дополнения к классическим контроллерам, доказательстве их надежности в миссиях с низким риском и создании формальных инструментов проверки, необходимых для сертификации. Путь от лабораторного любопытства к проверенной полетом технологии идет полным ходом, и управление реакционными колесами будет одной из первых областей, которые выиграют от этой трансформации.