control-systems-and-automation
Conception de lois de contrôle optimales pour les systèmes mécaniques sous-actués
Table of Contents
Introduction aux systèmes mécaniques sous-actués
Les systèmes mécaniques sous-actués constituent une classe fondamentale de systèmes dans lesquels le nombre d'entrées de commande indépendantes est strictement inférieur au nombre de degrés de liberté.Cette limitation inhérente rend leur contrôle beaucoup plus difficile que celui des systèmes entièrement actionnés, mais ils semblent omniprésents dans le cadre de l'ingénierie moderne.Par exemple, les manipulateurs robotiques à joints passifs, les véhicules aériens tels que les quadrateurs et les avions, les navires de surface et sous-marins, les structures flexibles et les robots à pied ou à pied.
Une inaction peut résulter de choix de conception (p. ex., réduction du poids ou du coût du servomoteur), de contraintes physiques (p. ex., un navire ne peut pas appliquer de force latérale directe) ou d'interaction environnementale (p. ex., un robot marcheur (le contact du pied avec le sol). Dans tous les cas, le contrôleur doit exploiter la dynamique du système (y compris la gravité, l'inertie et le couplage) pour manœuvrer efficacement.
Comprendre les systèmes mécaniques sous-actués
Caractéristiques essentielles
Un système sous-actué est défini par son espace de configuration et son espace de commande : si le vecteur de configuration a une dimension n et que le vecteur de commande a une dimension m, une sous-action signifie [m < n. Cette inadéquation implique que le système ne peut pas commander directement toutes les directions d'accélération. Le contrôleur doit plutôt compter sur un couplage dynamique entre les degrés de liberté actionnés et non actionnés. Par exemple, un pendule inversé classique sur un chariot est sous-actué : le chariot fournit de la force (une entrée de commande), mais le système a deux degrés de liberté (position de la carte et angle du pendule).
Exemples importants
- Cart-Pole System:[ Un chariot mobile avec un pendule oscillant librement. Utilisé largement dans l'éducation de la théorie du contrôle et comme un point de référence pour le contrôle non linéaire.
- Pendule inversé rotaire (Furuta Pendulum):Pendule fixé à un bras rotatif; le moteur contrôle seulement la rotation du bras, mais l'angle du pendule est non actionné.
- Quadrotor UAV: Quatre hélices fournissent poussée et couple, mais un quadrotor a six degrés de liberté (position et orientation). Il est sous-actué parce qu'il ne peut pas contrôler indépendamment tous les mouvements translationnels et rotationnels – il doit basculer pour générer une accélération horizontale.
- Robots de virage (p. ex. bipédistes, quadrupèdes):[ Pendant la phase de position, le contact du pied avec le sol impose des contraintes; le nombre de vérins est bien inférieur à la totalité des articulations, ce qui nécessite un équilibre attentif et une planification de la démarche.
- Véhicules sous-marins autonomes (AUV):[ Souvent, les propulseurs sont moins nombreux que les degrés de liberté, ce qui les rend sous-actués, surtout en vol stationnaire ou en manoeuvre à basse vitesse.
- Structures flexibles:[ Les grandes structures spatiales ou bras robotiques avec des liaisons flexibles ont infiniment de modes de vibrations mais seulement quelques actionneurs, exigeant un contrôle avancé pour l'amortissement et la précision.
Pourquoi l'inaction est importante
Les systèmes sous-actués offrent des avantages en termes de poids, de coût et d'efficacité énergétique. Ils imitent aussi la locomotion biologique – les animaux et les humains sont intrinsèquement sous-actués, en utilisant la dynamique passive et la coordination pour se déplacer avec élégance. Cependant, leur contrôle est fondamentalement non linéaire et non holonomique dans de nombreux cas, ce qui signifie que les mouvements réalisables dépendent de l'historique du chemin.
Objectifs de la conception de contrôle optimal
Stabilité
Pour les systèmes sous-actués, la stabilité consiste souvent à régler le système à un point d'équilibre (par exemple, équilibrer un pendule ou planer un quadroteur) ou le long d'une trajectoire souhaitée. Les méthodes basées sur Lyapunov sont couramment utilisées pour garantir la stabilité asymptotique ou exponentielle au sens de Lyapunov. Comme la dynamique sous-actuée est non linéaire, la linéarisation n'est valide que localement; la stabilisation mondiale peut nécessiter un contrôle par l'énergie ou la passivité.
Résultats
La performance est généralement quantifiée par une fonction objective ou de coût qui saisit la consommation d'énergie, le temps d'atteindre une cible, l'erreur de suivi, l'effort de contrôle ou une combinaison de ces deux. Le contrôle optimal vise à minimiser (ou à maximiser) ce coût sous réserve de la dynamique et des contraintes du système.Pour les systèmes sous-actués, les compromis sont inévitables : un basculement rapide d'un pendule consomme plus d'énergie et peut causer un grand dépassement, alors qu'un basculement lent peut être lisse mais inefficace.
Robusteté
Les systèmes du monde réel sont soumis à des incertitudes de paramètres (p. ex. masse, inertie, frottement), des perturbations externes (vent, ondes, variation de la charge utile) et une dynamique non modélisée (p. ex. bruit du capteur, saturation du vérin). Une loi de contrôle optimale doit fonctionner de manière fiable dans ces conditions. Des approches telles que la théorie de contrôle robuste, le contrôle prédictif du modèle (MPC)[ avec des contraintes, ou le contrôle adaptatif peuvent améliorer la robustesse.
Objectifs supplémentaires
- Constraint Satisfaction:[ De nombreux systèmes sous-actués fonctionnent dans des limites physiques – saturation de l'actuateur, limites articulaires, évitement des obstacles ou forces de contact.
- Planification des trajectoires:[ Dans de nombreuses applications (p. ex. manipulation robotique, vol de drone), le contrôleur doit générer des trajectoires réalisables et quasi optimales qui satisfont aux contraintes différentielles (dynamique nonholonomique).
- Efficacité énergétique: Particulièrement important pour les systèmes à piles ou sans pilote. Le contrôle optimal peut réduire la consommation d'énergie en exploitant la dynamique naturelle (p. ex., l'oscillation d'un pendule par pompage).
Méthodes pour concevoir des lois de contrôle optimales
Théorie de contrôle optimale
La base d'un contrôle optimal des systèmes sous-actués repose sur des principes de variation. Deux pierres angulaires sont Pontryagin= Principe minimum (PMP) et Programmation dynamique (qui conduit à l'équation Hamilton-Jacobi-Bellman (HJB)).
- Pontryagin=" Principe minimum: PMP fournit les conditions nécessaires pour l'optimalité. Il introduit les variables Hamiltoniennes, adjointes (cotes) et les conditions de limite. Pour les systèmes sous-actués, PMP peut être utilisé pour dériver bang-bang ou des arcs de contrôle singuliers, souvent apparaissant dans des problèmes d'énergie minimale ou minimale.
- Programmation dynamique: L'équation HJB offre une condition suffisante pour l'optimalité globale par une fonction de valeur. Cependant, pour les systèmes sous-actués haute dimension, la résolution de la PDE HJB est inextricable par calcul (curse de dimensionnalité).
Conception de contrôle basée sur Lyapunov
La méthode directe Lyapunovs est un outil puissant pour synthétiser les lois de contrôle de rétroaction stabilisant, même pour les systèmes sous-actués. L'idée est de construire une fonction Lyapunov V(x)] et puis de dériver le contrôle de façon à ce que sa dérivée le long des trajectoires V=x) soit définie négative (ou semi-définite). Pour les systèmes sous-actués, le contrôle ne peut pas apparaître directement dans V= pour tous les états, nécessitant un réglage de l'énergie ou un contrôle de la passivité basé sur l'interconnexion et l'aliénation (IDA-PBC).
Linéarisation de la rétroaction
Pour les systèmes sous-actués, le système peut être input-output linéarisable mais pas entièrement linéarisable (c.-à-d., la dynamique interne reste). La dynamique restante, connue sous le nom de dynamique zéro, doit être stable pour que le contrôleur puisse fonctionner. En contrôlant la sortie (comme l'angle du pendule par rapport à la verticale pour un môle-cart), la dynamique interne (mouvement de la carte) doit être limitée. Une approche commune combine la linéarisation de la rétroaction pour la sortie avec un contrôleur linéaire (p. ex., LQR) sur le sous-système linéarisé, tout en analysant la dynamique zéro séparément.
Modèle de contrôle prédictif (MPC)
Le contrôle prédictif du modèle résout un problème de contrôle optimal en ligne, à plusieurs reprises, à l'aide d'un modèle du système. Pour les systèmes sous-actués, le MPC non linéaire (NMPC) est particulièrement attrayant car il peut gérer simultanément les contraintes, la dynamique non linéaire et plusieurs objectifs. Le contrôleur prédit les états futurs sur un horizon N et optimise les entrées de contrôle tout en respectant les contraintes d'état et d'entrée. À chaque instant d'échantillonnage, seul le premier mouvement de contrôle est appliqué, et l'optimisation est résolue à nouveau avec des mesures actualisées.
Contrôle énergétique
De nombreux systèmes mécaniques sous-actués, en particulier ceux qui ont des degrés passifs de liberté, peuvent être contrôlés en formant leur énergie totale. L'exemple classique est le basculement d'un pendule : en pompant l'énergie dans le système (changement du point de pivot ou application du couple) à la bonne phase, le pendule gagne suffisamment d'énergie cinétique pour atteindre la position inversée. Les contrôleurs basés sur l'énergie dépendent souvent de la passivité, exploitant le fait que le système est dynamique naturelle et dissipative d'énergie. Une fonction Lyapunov peut être construite à partir de la différence entre l'énergie réelle et souhaitée plus un terme d'amortissement.
Contrôle du mode coulissant (SMC) et structure variable
SMC est une méthode non linéaire robuste qui force le système à glisser le long d'une surface conçue dans l'espace d'état. Il est efficace pour les systèmes sous-actués avec des incertitudes assorties, car il peut gérer des non-linéarités et des perturbations. Cependant, le bavardage dû à un changement discontinu peut dégrader les performances. Des modifications comme le lissage de la couche limite ou de l'ordre supérieur de SMC peuvent atténuer cette.
Renforcement de l'apprentissage (RL) pour un contrôle optimal
Ces dernières années, l'apprentissage du renforcement (en particulier le RL profond) est devenu une approche complémentaire du contrôle optimal traditionnel pour les systèmes sous-actués. Les algorithmes tels que DDPG (Deep Deterministic Policy Gradient), PPO et SAC apprennent les politiques (lois de contrôle) directement à partir des interactions avec l'environnement ou des simulations. Le RL peut gérer des dynamiques non linéaires complexes et des modèles inconnus, ce qui rend attrayant pour les tâches sous-actuées difficiles comme les manœuvres acrobatiques, la marche bipédale ou la course de drones.
Formulation mathématique du problème de contrôle optimal
Un problème de contrôle optimal typique pour un système mécanique sous-actué est formulé comme suit. La dynamique du système est donnée par l'équation différentielle du second ordre:
M(q) q=" + C(q, q=") q=" + G(q) = B(q) u
où q - sont des coordonnées généralisées, M(q) est la matrice d'inertie, C(q, q=] contient des termes coriolis et centrifuges, G(q) représente les forces gravitationnelles, u -[Rm est l'entrée de contrôle, et B(q) est la matrice de cartographie d'entrée. La sous-activité implique que rank(B) = m < n.
J = φ(q(T), q-(T)) + --0T L(q(t), q-(t), u(t)) dt
Le coût final φ et le coût d'exploitation L sont choisis par le concepteur. Résoudre ce problème directement est généralement insoluble sur le plan analytique pour les systèmes sous-actués non linéaires, d'où la dépendance à des méthodes numériques ou des solutions approximatives par les techniques décrites ci-dessus.
Défis dans la conception de lois de contrôle optimales pour les systèmes sous-actués
Non-linéarité et non-holonomie
Les systèmes sous-actués sont intrinsèquement non linéaires. Leur dynamique présente souvent des comportements complexes tels que les bifurcations, les mouvements chaotiques et les singularités. Beaucoup sont également non holonomiques, ce qui signifie que les vitesses réalisables du système à n'importe quelle configuration sont limitées à un sous-espace, mais les contraintes ne sont pas intégrables (par exemple, une roue roulante ou un robot serpent).
Contraintes d'entrée et d'État
Les limitations physiques telles que les limites de couple moteur, les limites d'angle d'articulation et l'évitement des obstacles imposent des inégalités tant sur les états que sur les entrées. L'application de celles-ci dans un cadre de contrôle optimal accroît la complexité des problèmes. Par exemple, un quadroteur ne peut dépasser sa poussée maximale; un robot marcheur doit maintenir sa force de contact au pied dans les cônes de friction.
Incertitude et perturbations du modèle
Les modèles précis de systèmes sous-actués sont souvent difficiles à obtenir. La friction, la flexibilité, la dynamique des actionneurs et les interactions environnementales (par exemple, la résistance à l'air, les contacts au sol) créent des incertitudes. Les lois de contrôle optimales conçues pour un modèle idéalisé peuvent être mal adaptées en réalité.
Complexité informatique
Le contrôle optimal en temps réel pour les systèmes sous-actués exige des résolveurs rapides. Le MPC non linéaire nécessite la résolution d'un problème d'optimisation limitée à chaque instant d'échantillonnage; pour les systèmes à haute dimension (par exemple, les robots humanoïdes à des dizaines de joints), cela peut être prohibitif. La réduction du modèle, le MPC explicite et l'optimisation hors ligne (par exemple, les primitifs de mouvement) sont des solutions de rechange communes.
Optimisum global par rapport à Optima local
Les algorithmes d'optimisation basés sur les gradients (par exemple, la collocation directe, la prise de vues unique) peuvent converger vers des solutions sous-optimales, sauf si les hypothèses initiales sont excellentes. Les méthodes d'optimisation globale (par exemple, essaim de particules, simulation de recuit) existent mais sont trop lentes en temps réel. Les approches hybrides qui combinent la planification basée sur l'échantillonnage (RRT, PRM) et l'optimisation locale (par exemple, CHOMP, TrajOpt) sont populaires dans la planification de mouvements pour les robots sous-actués.
Études de cas et applications
Suivi de la trajectoire du quadritor
Un contrôleur optimal typique minimise le shak ou le snap (quatrième dérivé de position) pour générer des trajectoires lisses et économes en énergie tout en respectant les limites de poussée. Le MPC non linéaire est largement utilisé : l'état du quadritor (position, vitesse, orientation, vitesse angulaire) est prédit sur un horizon court (0,5-2 secondes) tout en optimisant pour suivre l'erreur et l'effort d'entrée. La sous-activité est surmontée en permettant au vecteur de poussée d'incliner, introduisant un couplage entre la traduction et la rotation.
Marche bipédique
Les robots marchant comme le bipède Cassie ou Asimo sont fortement sous-actués pendant la phase de support unique (un pied seulement en contact, couples de cheville limité).Le contrôle optimal est utilisé pour planifier et stabiliser les cycles de démarche. Le problème est souvent formulé comme un système hybride (dynamique continue + impacts discrets du pied). Les méthodes comprennent la transcription directe du problème de contrôle optimal (par exemple, en utilisant FROST ou OCS2) combiné avec le contrôle prédictif modèle pour l'adaptation en ligne.
Véhicules autonomes sous-marins (AUV)
Plusieurs VAV utilisent seulement quelques propulseurs (p. ex. deux arrières et deux verticales) pour naviguer à six degrés de liberté. Les lois de contrôle optimales pour le suivi ou le vol de trajectoire doivent tenir compte de la traînée hydrodynamique, des courants et du couplage entre les axes (p. ex., la vitesse de tangage affecte la vitesse vers l'avant).
Orientations futures et tendances de la recherche
Le champ de contrôle optimal des systèmes mécaniques sous-actués évolue rapidement. Plusieurs tendances clés façonnent son avenir :
- Le contrôle basé sur l'apprentissage: L'apprentissage profond de renforcement et l'apprentissage d'imitation sont intégrés avec le contrôle optimal basé sur le modèle. Les approches hybrides (par exemple, l'apprentissage de la dynamique résiduelle ou des fonctions de coûts) promettent de combiner l'efficacité des données de MPC avec la capacité d'adaptation de RL. Les efforts pour garantir la stabilité et la sécurité via les fonctions Lyapunov dans la boucle d'apprentissage (par exemple, le contrôle neuronal Lyapunov) gagnent en traction.
- Sécurité-Critical Control:[ Le déploiement réel exige des garanties formelles. Les fonctions de barrière de contrôle (CBF) et de contrôle Lyapunov (CLF) assurent respectivement une sécurité et une stabilité prouvables.
- Systèmes coopératifs et multi-agents: Les systèmes sous-actués fonctionnent souvent en essaims (p. ex., formations de drones, équipes de robots). Le contrôle optimal distribué, où chaque agent résout un problème d'optimisation locale tout en communiquant avec les voisins, est une zone active.
- Modèles réduits et appris: Les techniques de réduction des modèles (p. ex., Décomposition orthogonale appropriée, Décomposition en mode dynamique) et les modèles appris (p. ex., équations différentielles ordinaires neurales) permettent un contrôle optimal en temps réel des systèmes sous-actués à haute dimension en comprimant la dynamique vers un espace latent à basse dimension.
- Simulation disfferentiable:[ Des outils comme MuJoCo, les moteurs de physique différenciables basés sur PyTorch et CasAdi permettent d'optimiser de bout en bout les lois de contrôle en utilisant des gradients à travers la dynamique. Cela facilite l'optimisation simultanée des paramètres de trajectoire et de haut niveau (par exemple, morphologie ou poids des coûts).
Conclusion
La conception de lois de contrôle optimales pour les systèmes mécaniques sous-actués est un effort difficile mais extrêmement gratifiant. L'asymétrie fondamentale entre les entrées de contrôle et les degrés de liberté oblige les ingénieurs à comprendre en profondeur la dynamique, à exploiter les phénomènes passifs et à utiliser des outils mathématiques sophistiqués. Des méthodes classiques comme le principe de Pontryagin et la conception Lyapunov à des approches modernes telles que la MPC non linéaire et l'apprentissage du renforcement, la boîte à outils continue de s'étendre.
Pour les lecteurs intéressés par une plongée plus profonde, d'excellentes ressources incluent le manuel classique Robotique sous-actuée de Russ Tedrake (MIT OpenCourseWare) et Systèmes non linéaires de H. K. Khalil. Pour une théorie optimale du contrôle, EE363 (Stanford) fournit des notes de cours sur l'optimisation linéaire et non linéaire.