Системи управління та автоматика
Реалізація безмоделейного оптичного керування в високодинамічних системах
Table of Contents
Розуміння моделі-Free Optimal Control
Оптимальний контроль моделі – це парадигмовий зсув у контрольній техніці, зокрема для високодинамічних систем, де традиційні моделі на основі підходів падають короткими. У системах, таких як автономні безпілотники, робототехнічні маніпулятори в неструктурованих середовищах, або гнучких виробничих клітинах, отримання точної математичної моделі динаміки рослин часто непрактично або неможливе. Модельні методи вирішують це шляхом вивчення оптимальних правил контролю безпосередньо від даних взаємодії або зворотного зв'язку в режимі реального часу, не вимагає явної моделі системи. Це робить їх привабливими для додатків, де системні параметри швидко зміняться, де нелінійності, або де вартість системи ідентифікації є забороне.
Основна перевага моделі безпроводового керування полягає в його здатності адаптуватися до невідомої динаміки. Замість перекриття на заздалегідь зібраній моделі контролер досліджує стан-діяльність простору і використовує спостереження для підвищення продуктивності. Цей підхід до даних добре вирівнюється з сучасними сенсуючими і обчислювальними можливостями, що дозволяє оптимізувати час в налаштуваннях, які раніше вважалися занадто складним для традиційної теорії управління.
Основні методи в моделі вільного контролю
Кілька різних методологій потрапляють під парасольку моделі без оптимального контролю. Кожен пропонує унікальні міцності і торгово-офф, а вибір техніки часто залежить від характеру системи, наявних обчислювальних ресурсів і вимог до виконання.
Зміцнення
Зміцнення (RL) має стати домінуючою рамкою для безможливого контролю моделі. У RL агент вивчає оптимальну політику, багаторазово взаємодіючи з навколишнім середовищем, отримувати винагороди або штрафні санкції за свої дії. Ключова ідея полягає в тому, щоб максимізувати кулативну винагороду протягом часу без необхідності переходу моделі. Алгоритми, такі як Q-learning, Deep Q-Networks (DQN), і методи підвищення політики, такі як PPO (оптимізація проекцій) успішно застосовуються до завдань безперервного контролю. Для високодинамічних систем, актор-критичні архітектури є особливо ефективним: актор, що адаптує метод моделювання, під час оцінювання, більш оптимальніший контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контрольний контроль, а також кошторис, що визначає параметри.
Адаптивна динамічна програма
Адаптивний динамічний програмування (ADP) - це клас методів, які ітеративно приблизно оптимальну функцію та політику управління цін. Методи ADP часто використовують нейромережі або інші функції приблизники для представлення функції значення та контролера. Ітераційний процес передбачає оцінку політики (оновлення функції значення на основі поточної політики) та вдосконалення політики (оновлення політики на основі нової функції значення). ADP може бути реалізований онлайн або автономно і використовується в системах живлення, аерокосмічної та робототехніки. Нездатний варіант - це цілісний динамічний підхід (HDP), який використовує єдиний критик мережі та мережевий актор, щоб досягти ближнього початкової системи без явної ідентифікації.
Еволюційні алгоритми
Еволюційні алгоритми (EAs) пропонують підхід до безмоделювання населення. Методики, такі як генетичні алгоритми, диференціальна еволюція та стратегія адаптації матриці (CMA-ES) еволюція набору політик контролю кандидатів над поколіннями. На кожному генерації, політики оцінюваються на реальній системі або тренажері, а кращі виконавці вибираються і мутуються для створення наступного покоління. EAs є прямим для реалізації і не вимагають градієнтів, що робить їх придатними для систем з неперервною динамікою або непрозорими функціями вартості. Хоча зазвичай повільніше, ніж RL для об'ємних проблем, вони виділяють сценарії, де важливі пошуки
Впровадження викликів та стратегій міграції
Розгортання моделі безпроводового контролю в високодинамічних системах дає можливість забезпечити безпечну, стабільну та ефективну роботу. Наступні підрозділи детально описані найбільш актуальні питання та стратегії, дослідники та інженери, які використовують для подолання їх.
Проблеми сталого розвитку
Безможні алгоритми часто не вистачає формальних гарантій стійкості, особливо в стадії навчання. У динамічних системах нестабільний контролер може викликати катастрофічні збої. Для цього практикують такі методи, як надійна оптимізація (наприклад, додавання концентрацій стійкості до мети навчання), використовуючи методи на основі Ляпунов для забезпечення стабільності, або навчання в імітації з випадковими даними перед розгортанням на реальній системі. Ще один підхід полягає в тому, щоб використовувати безпечні стратегії розвідки, які перешкоджають руху до відомих безпечних регіонів, поступово розширюється як накопичені знання.
Зразок ефективності та розширення
Високодинамічні системи часто працюють в швидкому масштабі, обмежуючи кількість взаємодій, доступних для навчання. Безмодельні методи неординарно проявляються-грибкові. Для підвищення ефективності зразків використовуються такі методи, як реплея досвіду (складання минулих переходів і їх реулінгів), модельне тепло-старіння (з наближеною моделлю для створення початкових політик), а також позаполісичне навчання (загальна від даних, що створюються різними політиками). Розвідка також може бути надана за допомогою внутрішньоінформованих сигналів мотивації або шляхом вивчення ансамблю моделей, щоб керувати невизначеність і розвідка дисків, де це найбільш необхідно.
Концентрати розрахунків реального часу
Розрахункові вимоги безмоделейних алгоритмів моделі — зокрема, з використанням глибоких нейромереж — можуть бути важкими. У вбудованих системах або високочастотних контурах управління, в тому числі повинні бути завершені в межах мікросекунд. Рішення включають в себе мережу обрізання, квантизація та прискорення обладнання (наприклад, використання GPU або ФПГ). Для деяких додатків, легкий архітектурний простір, як радіальні мережі або лінійні функції приблизники досить досягти хорошої продуктивності при зустрічі в режимі реального часу. Оффлайн обчислення (тренування) проти онлайн-пристосування є ще одним торгово-офом: деякі системи можуть попередньо протипоказати політики в імітації, а потім відмінно відтіняють мінімальним онлайн-налаштування.
Додаткові гібридні підходи
Для комбайнів міцностей моделей на основі моделі та безмоделейних методів, дослідники розробили гібридні архітектури. Наприклад, модельний компонент може генерувати попередні дії контролю або забезпечити короткостроковий горизонт прогнозування, тоді як безмодний компонент моделлю навчається виправити для показників моделі або ручки непередбачених порушень. Ще одним популярним гібридом є «модель-безкоштовна» використання вченої моделі для планування (наприклад, оптимізація політики моделі), де модель дізнається з даних, але оптимізація контролера виконується безпроблемною. Ці підходи часто отримують більш швидке навчання і краще кінцеву продуктивність, ніж без чистомодних методів, особливо коли система динаміка частково відома.
Застосування моделі-Free Optimal Control
Універсальність моделей безплатних підходів призвело до їх прийняття в різних галузях промисловості. Нижче наведено приклади застосування реальних додатків світу.
Автономні транспортні засоби та безпілотники
Автономні транспортні засоби, що працюють в непередбачуваних трафіках, зміні погоди або на грубій місцевості, значно вигідно від моделі безконтрольного контролю. алгоритми РЛ використовуються для підготовки кінцевих правил водіння від введення камери, що дозволяє транспортним засобом обробляти ситуації, не чітко зустрічаються під час тренувань. Квадротори з використанням безмодельного контролю показали неспроможність в динамічних середовищах, таких як літаючі ліси або адаптація до змін навантаження без зміни моделі, що перераховують моделі. Дослідники також використовували АПО для оптимізації споживання енергії в електромобілах шляхом вивчення ефективного прискорення та гальмування.
Робототехніка в неструктурованих середовищах
Робототехнічні маніпулятори, які виконували з грасуванням невідомих об'єктів, складання в змінних умовах або саморозмовності на нерівній поверхні, використовують моделі безшумні методи адаптуватися в режимі реального часу. Еволюційні алгоритми знайшли успіх у залученні щільних візерунків для легованих роботів, а RL дозволяє спритним маніпуляціям з високою об'ємною сенсорною обробкою. У промислових налаштуваннях, безмоделяційний контроль дозволяє роботів підтримувати точність, незважаючи на те, що інструмент зноситься або зміни геометрії частини.
Системи енергоресурсів та енергетичних систем
У смарт-мережах і мікрогрідів динамічна природа відновлювального покоління і попит навантаження робить модель безкоштовним оптимальним управлінням привабливим. Алгоритми, як ADP, застосовуються для управління акумуляторами, оптимізації потоку живлення та стабілізації частоти в режимі реального часу. Системи вітротурбінного кроку та побудови HVAC також пропонуються від адаптивних моделей безплатних стратегій, які підвищують ефективність енергії без необхідності детальних теплових або аеродинамічних моделей.
Контроль процесів та хімічна інженерія
Хімічні процеси часто експонуються нелінійними, своєчасно-професійними поведінками, які важко моделювати з перших принципів. Модельний контроль використовується для контролю температури реактора, оптимізації дистиляції колони та контролю якості полімерів. Ці програми важають можливість безмодних методів вивчення даних процесу та адаптуються до деактивації каталізаторів або варіацій порід.
Майбутні напрямки
Поле моделі безкоштовного оптимального керування є швидкою. До складу промісних проспектів відносяться інтеграція невизначеності кількісного визначення, щоб зробити рішення, які відповідають моделлю безпроксимуляцій, поєднуючи автономне та онлайн-вчання для адаптації до життя, а також розробки теоретичних гарантій безпеки та зближення в безперервних станах. Ще одним передовим є використання моделі безшумного контролю в багатоагентних системах, де багато контролерів взаємодіють і повинні вчитися узгоджені поведінки без зв'язку явних моделей. Оскільки обчислювальна потужність продовжує рости і алгоритми стають більш ефективними, модельний вільний контроль, ймовірно, стане стандартним інструментом в інструментальній коробці управління.
Для подальшого читання див. Огляд моделі безмодельного контролю , ]]дослідної статті про арматурне навчання для контролю дронів, а ]. Огляд адаптивних динамічних методів програмування.