Comprendre le contrôle optimal sans modèle

Dans les systèmes tels que les drones autonomes, les manipulateurs robotiques dans des environnements non structurés ou les cellules de fabrication flexibles, obtenir un modèle mathématique précis de la dynamique des plantes est souvent impossible ou peu pratique. Les méthodes sans modèle s'attaquent à cela en apprenant des politiques de contrôle optimales directement à partir de données d'interaction ou de rétroaction en temps réel, sans exiger un modèle de système explicite. Cela les rend très attrayants pour les applications où les paramètres du système changent rapidement, où les non-linéarités dominent, ou où le coût de l'identification du système est prohibitif.

Au lieu de s'appuyer sur un modèle précompté, le contrôleur explore l'espace état-action et utilise les observations pour améliorer progressivement les performances. Cette approche axée sur les données s'harmonise bien avec les capacités modernes de détection et de calcul, permettant une optimisation en temps réel dans des paramètres qui étaient auparavant considérés comme trop complexes pour la théorie traditionnelle du contrôle.

Techniques de base dans le contrôle sans modèle

Plusieurs méthodologies distinctes s'inscrivent dans le cadre d'un contrôle optimal sans modèle. Chacune offre des forces et des compromis uniques, et le choix de la technique dépend souvent de la nature du système, des ressources informatiques disponibles et des exigences de performance.

Renforcement de l'apprentissage

Dans RL, un agent apprend une politique optimale en interagissant à plusieurs reprises avec l'environnement, en recevant des récompenses ou des pénalités pour ses actions. L'idée clé est de maximiser la récompense cumulative au fil du temps sans exiger de modèle de transition. Des algorithmes tels que Q-learning, Deep Q-Networks (DQN) et des méthodes de gradient de politique comme PPO (Proximal Policy Optimization) ont été appliqués avec succès aux tâches de contrôle continu. Pour les systèmes très dynamiques, les architectures critiques des acteurs sont particulièrement efficaces : l'acteur adapte la loi de contrôle, tandis que le critique estime la fonction de valeur, guide l'acteur vers des comportements plus optimaux.

Programmation dynamique adaptative

La programmation dynamique adaptative (ADP) est une classe de méthodes qui, par itérative, rapprochent la fonction de valeur optimale et la politique de contrôle. Les techniques ADP utilisent souvent des réseaux neuronaux ou d'autres fonctions encombrantes pour représenter la fonction de valeur et le contrôleur. Le processus itératif implique l'évaluation des politiques (mise à jour de la fonction de valeur en fonction de la politique actuelle) et l'amélioration des politiques (mise à jour de la politique en fonction de la nouvelle fonction de valeur).

Algorithmes évolutionnaires

Les algorithmes évolutifs (EA) offrent une approche de l'optimisation sans modèle fondée sur la population. Les techniques telles que les algorithmes génétiques, l'évolution différentielle et la stratégie d'adaptation à la matrice de covariance (CMA-ES) évoluent un ensemble de politiques de contrôle des candidats sur des générations. À chaque génération, les politiques sont évaluées sur le système réel ou un simulateur, et les meilleurs interprètes sont sélectionnés et mutés pour créer la prochaine génération. Les EA sont simples à mettre en œuvre et ne nécessitent pas de gradients, ce qui les rend adaptés aux systèmes à dynamique discontinue ou aux fonctions de coûts non lisses.

Défis de mise en œuvre et stratégies d'atténuation

Le déploiement d'un contrôle sans modèle dans des systèmes très dynamiques présente un ensemble de défis qui doivent être relevés pour assurer un fonctionnement sûr, stable et efficace. Les sous-sections suivantes décrivent en détail les questions les plus pressantes et les stratégies utilisées par les chercheurs et les ingénieurs pour les surmonter.

Questions de stabilité et de convergence

Dans les systèmes dynamiques, un contrôleur instable peut causer des défaillances catastrophiques. Pour atténuer ces défaillances, les praticiens utilisent des techniques telles que l'optimisation robuste (par exemple, ajouter des contraintes de robustesse à l'objectif d'apprentissage), l'utilisation de méthodes basées sur Lyapunov pour imposer la stabilité, ou la formation à la simulation avec randomisation de domaine avant de se déployer sur le système réel. Une autre approche consiste à utiliser des stratégies d'exploration sûres qui limitent l'espace d'action aux régions sûres connues, en s'élargissant progressivement au fur et à mesure que les connaissances s'accumulent.

Efficacité et exploration des échantillons

Les systèmes très dynamiques fonctionnent souvent à une échelle de temps rapide, limitant le nombre d'interactions disponibles pour l'apprentissage. Les méthodes sans modèle sont notoirement peu efficaces. Pour améliorer l'efficacité des échantillons, on utilise des techniques telles que le rejouage de l'expérience (stockage des transitions passées et réutilisation de celles-ci), le démarrage à chaud basé sur le modèle (en utilisant un modèle approximatif pour générer des politiques initiales) et l'apprentissage hors politique (apprentissage à partir de données générées par une politique différente).

Contraintes à l'établissement des calculs en temps réel

Les exigences de calcul des algorithmes sans modèle, en particulier ceux qui utilisent des réseaux neuronaux profonds, peuvent être lourdes. Dans les systèmes embarqués ou les boucles de contrôle à haute fréquence, l'inférence doit être réalisée en microsecondes. Les solutions comprennent la taille du réseau, la quantification et l'accélération matérielle (p. ex., avec des GPU ou des FPGA).

Approches hybrides avancées

Pour combiner les forces des méthodes basées sur le modèle et sans modèle, les chercheurs ont développé des architectures hybrides. Par exemple, un composant basé sur le modèle peut générer des actions de contrôle préliminaires ou fournir un horizon de prévision à court terme, tandis qu'un composant sans modèle apprend à corriger des inexactitudes de modèle ou à gérer des perturbations imprévues. Un autre hybride populaire est l'utilisation « sans modèle » d'un modèle appris pour la planification (p. ex., optimisation de la politique basée sur le modèle) où le modèle est appris à partir de données mais l'optimisation du contrôleur est effectuée sans échantillon.

Applications du contrôle optimal sans modèle

La polyvalence des approches sans modèle a conduit à leur adoption dans de nombreuses industries. Ci-dessous sont des exemples élargis d'applications réelles.

Véhicules autonomes et drones

Les véhicules autonomes fonctionnant dans un trafic imprévisible, en changeant de conditions météorologiques ou sur terrain accidenté bénéficient grandement d'un contrôle sans modèle. Les algorithmes RL ont été utilisés pour former les politiques de conduite de bout en bout à partir des entrées de caméra, permettant aux véhicules de gérer des situations non explicitement rencontrées pendant l'entraînement.

Robotique en milieu non structuré

Les manipulateurs robotiques chargés de saisir des objets inconnus, de les assembler en conditions variables ou de les locomotionner sur un sol inégal utilisent des méthodes sans modèle pour s'adapter en temps réel. Les algorithmes évolutifs ont trouvé du succès dans l'évolution des modèles de démarche pour les robots à pattes, tandis que RL permet une manipulation dextérieuse avec une détection tactile haute dimension.

Énergie et systèmes d'alimentation électrique

Dans les réseaux intelligents et les microréseaux, la dynamique de la production et de la demande de charge renouvelables rend le contrôle optimal sans modèle attrayant. Des algorithmes comme ADP ont été appliqués pour gérer le stockage de la batterie, optimiser le débit d'énergie et stabiliser la fréquence en temps réel.

Contrôle des procédés et génie chimique

Les processus chimiques présentent souvent un comportement non linéaire et variable dans le temps, difficile à modéliser à partir des premiers principes. Le contrôle sans modèle a été utilisé pour le contrôle de la température du réacteur par lots, l'optimisation de la colonne de distillation et le contrôle de la qualité des polymères.

Orientations futures

Le champ de contrôle optimal sans modèle évolue rapidement. Les pistes prometteuses comprennent l'intégration de la quantification d'incertitude pour rendre les décisions robustes à des approximations sans modèle, combinant l'apprentissage hors ligne et en ligne pour l'adaptation tout au long de la vie, et le développement de garanties théoriques pour la sécurité et la convergence dans les espaces d'action continues. Une autre frontière est l'utilisation de contrôle sans modèle dans les systèmes multi-agents, où plusieurs contrôleurs interagissent et doivent apprendre des comportements coordonnés sans communication de modèles explicites.

Pour plus de détails, voir Wikipedia's panorama of model-free control[, un article de recherche sur l'apprentissage du renforcement pour le contrôle des drones, et un relevé des techniques de programmation dynamique adaptative.