Introduction aux réseaux neuraux dans le contrôle non linéaire

Contrairement aux systèmes linéaires, la sortie d'un système non linéaire n'est pas proportionnelle à son entrée ni à sa superposition. Cette complexité inhérente rend les techniques traditionnelles de contrôle linéaires comme les contrôleurs PID ou d'état-feedback inadéquats ou même instables lorsqu'elles sont appliquées en dehors d'une région d'exploitation étroite. Au cours des deux dernières décennies, les réseaux neuronaux artificiels (RAN) sont apparus comme un outil de transformation pour relever ces défis en tirant parti de leur approximation universelle des fonctions et de leurs capacités d'apprentissage directement à partir des données.

Les réseaux neuraux sont particulièrement attrayants car ils peuvent modéliser des cartes non linéaires arbitrairement complexes sans exiger de modèles mathématiques explicites du système.C'est crucial lorsque la physique sous-jacente est mal comprise, fortement incertaine ou variable dans le temps.En apprenant la dynamique du système en ligne ou hors ligne, les contrôleurs neuraux basés sur le réseau peuvent adapter, généraliser et maintenir les performances là où les méthodes conventionnelles échouent.

Les fondamentaux du contrôle non linéaire et pourquoi les réseaux neuraux?

La difficulté des systèmes non linéaires

Les systèmes non linéaires présentent des comportements tels que des points d'équilibre multiples, des cycles limites, des bifurcations et du chaos. Les objectifs de contrôle comme la stabilisation, le suivi et le rejet des perturbations deviennent beaucoup plus difficiles parce que la réponse du système change avec les conditions d'exploitation. Le contrôle linéaire classique repose sur la linéarisation autour d'un point d'exploitation fixe, mais cette approximation locale se décompose lorsque le système s'éloigne de ce point.

De plus, de nombreuses plantes du monde réel ont une dynamique inconnue ou partiellement connue. Même lorsqu'il existe un modèle de premier principe, les incertitudes des paramètres, les effets non modélisés et les perturbations environnementales exigent une approche adaptative ou basée sur l'apprentissage.

Pourquoi les réseaux neuraux?

Les réseaux neuraux possèdent plusieurs propriétés qui les rendent particulièrement adaptés pour le contrôle non linéaire:

  • Approximation universelle:[ Un réseau neuronal d'alimentation avec au moins une couche cachée et un nombre suffisant de neurones peut approximationner n'importe quelle fonction continue sur un domaine compact à toute précision souhaitée, comme l'établit le théorème d'approximation universelle. Cette propriété est le substrat de leur utilisation dans la modélisation des non-linéarités du système.
  • Adaptabilité et apprentissage:[ Grâce à l'apprentissage supervisé, non supervisé ou renforcé, les réseaux neuronaux peuvent mettre à jour leurs paramètres internes (poids et biais) afin de refléter les changements dans la dynamique du système.
  • Parallèle Traitement:[ La nature distribuée du calcul neuronal permet des évaluations rapides de l'alimentation en avant, ce qui est essentiel pour le contrôle en temps réel où les intervalles d'échantillonnage peuvent être aussi courts que des millisecondes.
  • Robustness to Bruit:[ Avec une formation appropriée, les réseaux neuronaux peuvent filtrer le bruit de mesure et généraliser à partir de données partielles ou corrompues, une caractéristique essentielle pour les boucles pratiques de capteur à actionneur.

Ces attributs ont motivé une recherche approfondie sur le contrôle neuronal en réseau (CNN), formant un champ riche à l'intersection de la théorie de l'apprentissage machine et du contrôle.

Architectures de réseau neuronal de base pour le contrôle

Réseaux neuronaux (RNF)

L'architecture la plus simple et la plus utilisée en contrôle est le perceptron multicouche (MLP) avec une ou deux couches cachées. Les DNN sont généralement utilisés pour l'approximation statique des fonctions, comme l'apprentissage de la dynamique inverse d'un manipulateur robot. Dans le contrôle inverse direct, le réseau est formé à cartographier les sorties souhaitées (par exemple, les angles de joint) aux entrées de commande requises (torques).

Réseaux neuronaux récurrents (RNN) et mémoire longue à court terme (LSTM)

Pour les systèmes à dynamique – où l'état évolue au fil du temps et dépend des entrées et des états précédents – les réseaux récurrents sont un choix naturel. Les RNN ont des connexions internes de rétroaction qui leur donnent une mémoire des signaux passés. Cela les rend efficaces pour l'identification du système (apprentissage de la fonction de transition d'une usine) et pour le contrôle prédictif du modèle où les sorties futures doivent être prédites sur un horizon.

Réseaux neuronaux convolutionnels (RCN) et modèles hybrides

Bien que les CNN soient principalement utilisés pour le traitement des images, ils ont trouvé des applications en contrôle lorsqu'il s'agit de rétroaction visuelle. Par exemple, un CNN peut traiter des images de caméra pour estimer l'état (p. ex., position de l'effet de bout d'un manipulateur), et ensuite un deuxième réseau ou un contrôleur standard génère le signal de contrôle.

Réseaux d'Etat (ESN)

Pour une formation extrêmement rapide et un contrôle en temps réel, les réseaux d'échostate (un type de calcul de réservoir) ont acquis une traction. L'idée est d'utiliser un réservoir aléatoire fixe qui cartographie les signaux d'entrée dans un espace haute dimension, et seulement former une simple couche de sortie linéaire. L'entraînement est extrêmement efficace (résolution d'une régression linéaire), ce qui rend les NSE adaptés pour le contrôle adaptatif en ligne dans des applications comme la suppression des tremblements dans la robotique assistée ou le contrôle des vibrations en temps réel.

Chaque architecture fait des compromis entre la puissance de représentation, la complexité de la formation et le coût de calcul. Le choix dépend du problème de contrôle spécifique et des ressources informatiques disponibles.

Stratégies de contrôle fondées sur le réseau neuronal

Les chercheurs en contrôle ont développé plusieurs paradigmes qui intègrent les réseaux neuronaux dans la boucle de contrôle.Les trois plus importants sont contrôle direct, [MPNC][contrôle adapté[. Chacun est discuté en détail ci-dessous.

Contrôle neuronal direct

En contrôle direct, le réseau neuronal assume le rôle du contrôleur lui-même. Le réseau reçoit les états du système actuel (ou un ensemble de mesures pertinentes) et émet directement le signal de contrôle. La formation peut être effectuée hors ligne à l'aide d'un ensemble de données de cartographies d'état à contrôle souhaitées (p. ex., d'un expert humain ou d'un contrôleur optimal), ou en ligne à l'aide d'un apprentissage du renforcement (RL).

Un exemple classique est neuro-control pour le suivi de trajectoire de bras robotique. Un réseau de transmission est formé pour apprendre la dynamique inverse du bras : étant donné une accélération souhaitée, le réseau produit les couples d'articulation. Une fois formé, le réseau peut calculer les commandes de contrôle en une fraction de milliseconde, ce qui permet un contrôle à haute bande passante. Le principal défi est que la cartographie inverse peut être non unique ou mal conditionnée, nécessitant des algorithmes d'entraînement spéciaux (p. ex., méthodes jacobinisées augmentées).

Dans le renforcement de l'apprentissage, le réseau neuronal agit comme approximant de la politique. L'agent interagit avec l'environnement, recueille des récompenses (ou des coûts) et met à jour ses poids pour maximiser la récompense cumulative. Le contrôle neuronal direct basé sur RL a été démontré avec succès dans la stabilisation des quadrotères, la manipulation des robots et le jeu (par exemple AlphaGo).

Modèle neuronal Contrôle prédictif (CNM)

Le contrôle prédictif du modèle (MPC) résout un problème d'optimisation en ligne à chaque étape : étant donné un modèle de l'usine, il calcule une séquence d'actions de contrôle futures qui minimisent une fonction de coût sur un horizon de prédiction, sous réserve de contraintes. La qualité du MPC dépend fortement de la précision du modèle. Les réseaux neuronaux sont utilisés pour apprendre ce modèle à partir de données, remplaçant le modèle traditionnel basé sur la physique.

Les avantages sont significatifs : le modèle réseau neuronal peut capter une dynamique complexe et non linéaire, difficile à obtenir analytiquement. Par exemple, dans le contrôle des processus chimiques, un modèle réseau neuronal d'un réacteur peut prédire les concentrations et les températures futures, permettant au MPC de calculer des positions de vannes optimales tout en respectant les contraintes de sécurité. L'inconvénient est le coût de calcul – la résolution de l'optimisation à chaque échantillon peut être exigeante, notamment avec des réseaux profonds.

Une variante populaire est le réseau non linéaire autorégressif avec des entrées exogènes (NARX), qui modélise la sortie du système en fonction des sorties passées et des entrées passées. Ce modèle est ensuite intégré dans l'optimisation MPC. Pour garantir la faisabilité, les contraintes sont souvent atténuées, et le réseau doit être formé sur les données qui couvrent la région d'exploitation attendue.

Contrôle d'adaptation neuronale

Le contrôle adaptatif a une longue tradition en théorie du contrôle, où les paramètres du contrôleur (gains) sont ajustés en ligne pour faire face aux variations de paramètres. Les réseaux neuraux mettent à niveau cette idée en permettant l'ajustement de paramètres non linéaires. Il y a deux approches primaires:

  • Le contrôle neuronal direct adaptatif: Le contrôleur est un réseau neuronal dont les poids sont ajustés en ligne pour minimiser une certaine mesure de suivi ou de stabilité. Par exemple, les lois d'adaptation basées sur Lyapunov sont dérivées pour garantir que le système de boucle fermée demeure stable pendant que le réseau apprend.
  • Contrôle neuronal indirect adaptatif:[ Deux réseaux sont utilisés: l'un agit comme un identifiant (modèle de l'usine) et l'autre comme contrôleur. L'identificateur est mis à jour en ligne en fonction des données d'entrée-sortie, et le contrôleur est recalculé (ou mis à jour) en fonction du modèle identifié. Cette approche peut fournir de meilleures performances parce que le contrôleur peut être redessiné au fur et à mesure que le modèle évolue.

La commande neuronale adaptative s'est avérée efficace pour les systèmes à paramètres variables, comme la commande de vol d'aéronef, où les coefficients aérodynamiques changent avec l'altitude et le nombre de Mach, ou pour la commande du pas de l'éolienne sous des vitesses de vent variables. Le principal défi consiste à s'assurer que l'adaptation ne mène pas à l'instabilité ou à un effort excessif de contrôle.

Formation des réseaux neuraux de contrôle

Formation hors ligne avec apprentissage automatique

Lorsqu'un ensemble de données suffisamment représentatif est disponible, les modèles de réseau neuronal peuvent être formés hors ligne en utilisant un apprentissage supervisé standard. Pour l'identification du système, les données d'entrée-sortie sont recueillies auprès de l'usine et le réseau est formé pour prédire les extrants futurs.

Formation en ligne et adaptation en temps réel

La formation en ligne permet au réseau de s'adapter en permanence. Cela peut être fait par des méthodes basées sur le gradient (p. ex. descente stochastique en gradient avec élan) ou des moindres carrés récursifs, mais doit être mis en œuvre avec soin pour éviter la cathétisation de la plante. Des mesures de protection algorithmiques telles que les zones mortes, la projection et l'excitation persistante sont courantes.

Dans le renforcement de l'apprentissage, la formation est intrinsèquement en ligne (ou en batch-online comme dans Deep Q‐Networks). L'agent explore l'environnement en utilisant une stratégie d'exploration (p. ex., epsilon‐greedy) tout en mettant à jour le réseau politique. Une considération importante est l'efficacité de l'échantillon : de nombreux algorithmes RL nécessitent des millions d'interactions pour des systèmes complexes, ce qui est peu pratique pour le matériel réel.

Applications des réseaux neuraux dans le contrôle non linéaire

Robotique

Les contrôleurs réseau neuronaux sont utilisés pour le contrôle du couple au niveau de la jointure, la manipulation du corps entier et la locomotion. Par exemple, deep renforcement learning a été utilisé pour former des quadrupèdes pour marcher et courir sur des terrains complexes. Le réseau neuronal prend des lectures de capteurs (angles de jonction, données IMU) et produit des couples de joint, tout en apprenant des essais et des erreurs dans la simulation.

Véhicules autonomes

La conduite de bout en bout, où un réseau neuronal cartographie directement les images de la caméra aux commandes de direction et de gaz, est une application directe de contrôle neuronal. Initiée par le système ALVINN à la fin des années 1980, les versions modernes utilisent des CNN profonds (p. ex. NVIDIAS PilotNet) et ont été démontrées dans le trafic réel.

Contrôle des procédés et génie chimique

Les modèles de MPC neural ont montré d'excellentes performances dans le suivi des consignes et le rejet des perturbations, souvent surperformant les MPC linéaires traditionnels. Par exemple, un réseau neural peut modéliser la cinétique complexe d'un réacteur à lots, permettant un contrôle optimal de la température pour maximiser le rendement tout en évitant les conditions dangereuses.

Systèmes aérospatial et maritime

Les contrôleurs d'adaptation neuronale ont été testés pour le contrôle des défauts, comme la compensation d'une surface de contrôle bloquée en réapprenant l'efficacité de contrôle restante. Dans les véhicules marins, les réseaux neuronaux sont utilisés pour le positionnement dynamique des navires sous des états de mer variables.

Défis et problèmes ouverts

Malgré des succès impressionnants, plusieurs obstacles doivent être surmontés avant que les contrôleurs de réseau neuronal ne deviennent des normes dans les systèmes critiques en matière de sécurité.

  • Stabilisabilité et robustesse Garanties:[ La preuve qu'un contrôleur réseau neural ne rendra pas le système instable dans toutes les conditions possibles est extrêmement difficile en raison de la non-linéarité du réseau lui-même.
  • Compatibilité informatique:[ Les réseaux profonds nécessitent un calcul important pour les passages avant et arrière. Dans les contrôleurs embarqués en temps réel avec des contraintes de latence strictes, les réseaux plus simples (p. ex., à deux couches cachées) sont préférés.
  • Exigences en matière de données : Les modèles neuronaux à haute fidélité nécessitent des ensembles de données vastes et diversifiés. Pour les systèmes coûteux ou impossibles à exciter sur toute la gamme d'exploitation (p. ex., les réacteurs nucléaires), la rareté des données constitue un obstacle majeur.
  • Interprétabilité: Les réseaux neuraux sont souvent considérés comme des boîtes noires.Pour l'approbation réglementaire et le diagnostic de défaillance, les ingénieurs doivent comprendre pourquoi un contrôleur a pris une certaine décision.
  • Exploration sécuritaire:[ Dans l'apprentissage en ligne (surtout RL), le contrôleur peut explorer des actions qui conduisent à des états dangereux ou dommageables.

Orientations futures

Plusieurs tendances vont façonner la prochaine génération de contrôle en réseau neuronal :

  • Réseaux neuronaux en formation physique (RIN):[ En intégrant des équations différentielles partielles dans la fonction perte, les RINP peuvent modéliser des systèmes avec des données peu nombreuses tout en respectant les lois physiques.
  • Meta‐Learning and Few‐Shot Adaptation:[ Les réseaux qui peuvent s'adapter à une nouvelle dynamique avec seulement une poignée d'observations réduiront considérablement le besoin d'une formation hors ligne étendue.
  • L'intégration avec les méthodes formelles:[ La combinaison de contrôleurs neuronaux avec des outils de vérification (p. ex. analyse de la accessibilité, certificats de barrière) peut fournir les garanties les plus défavorables, en se dirigeant vers la certification des systèmes de contrôle basés sur l'apprentissage.
  • Accélérateurs de logiciels fixes:[ Les processeurs de réseau neuronal dédiés (NPU) et les implémentations FPGA rendront possible l'inférence en temps réel de réseaux profonds dans les systèmes intégrés à faible puissance, l'expansion des applications dans les micro-drones et la robotique portable.

À mesure que ces technologies mûrissent, les réseaux neuronaux deviendront un composant de plus en plus standard dans la boîte à outils de l'ingénieur de contrôle, complétant les méthodes classiques plutôt que de les remplacer entièrement.

Conclusion

Leur capacité à rapprocher les dynamiques complexes, à s'adapter en ligne et à apprendre des données les rend indispensables à la robotique moderne, aux véhicules autonomes et au contrôle avancé des processus. Bien que des défis liés aux garanties de stabilité, au coût informatique et à l'interprétation demeurent, le progrès rapide des algorithmes, du matériel et de la théorie promet de surmonter ces obstacles. Les praticiens et les chercheurs bénéficieront d'une compréhension approfondie des principes et des compromis présentés ici, car le contrôle en réseau neuronal devient la pierre angulaire de systèmes intelligents.

Pour plus de détails, voir les travaux de base sur l'identification du réseau neuronal pour le contrôle par Narendra et Parthasarathy (1990), l'étude approfondie sur l'apprentissage du renforcement profond pour le contrôle par Mnih et al. (2015), et le guide pratique sur le MPC neuronal par L. Grondman et al. (2019). Les progrès récents dans les réseaux neuronaux informés en physique sont discutés dans Raissi, Perdikaris et Karniadakis (2019), tandis que les techniques d'apprentissage du renforcement sécuritaire sont étudiées par Garcia et Fernández (2015).