Quels sont les problèmes de valeur de la frontière dans le contrôle optimal?

La théorie du contrôle optimal fournit un cadre mathématique pour déterminer une politique de contrôle qui minimise ou maximise un indice de performance au fil du temps, sous réserve de contraintes dynamiques. Au cœur de nombreuses formulations de contrôle optimales réside la nécessité de résoudre un problème de valeur limite (BVP). Un problème de valeur limite est un système d'équations différentielles ordinaires ou partielles accompagnées de conditions qui doivent être satisfaites à deux ou plusieurs points distincts de la variable indépendante et #8212; typiquement les temps initial et final. Cela contraste fortement avec les problèmes de valeur initiale, où toutes les conditions sont spécifiées à un seul point de départ.

Comprendre les BVP est essentiel parce qu'ils régissent le comportement optimal d'une vaste gamme de systèmes : de l'optimisation de la trajectoire des engins spatiaux et de la planification du mouvement des robots à la maîtrise des processus chimiques et à la modélisation de la croissance économique.La complexité des BVP découle de leur nature non locale et n°8212; la solution à tout moment dépend des conditions aux deux frontières, ce qui les rend plus difficiles à résoudre analytiquement que les problèmes de valeur initiale.

Formuler le BVP dans le contrôle optimal

La formulation d'un BVP dans un contrôle optimal commence généralement par un système dynamique décrit par équations d'état[

\[\dot{\mathbf{x}}}(t) = \mathbf{f}(\mathbf{x}(t), \mathbf{u}(t), \quad \mathbf{x}(t 0) = \mathbf{x} 0\]

où \(\mathbf{x}(t) \in \mathbb{R}^n\) est le vecteur d'état, \(\mathbf{u}(t) \in \mathbb{R}^m\) est le vecteur de contrôle, et \(t ↓) est le moment initial. L'objectif est de trouver un contrôle \(\mathbf{u}(t)\) qui minimise un coût fonctionnel

\[J = \phi(\mathbf{x}(t f), t f) + \int {t 0}^{t f} L(\mathbf{x}(t), \mathbf{u}(t), t) \, dt\]

sous réserve des contraintes de terminal \(\psi(\mathbf{x}(t f), t f) = ↓).

En appliquant le PMP, nous définissons le Hamiltonien : \(H = L + \boldsymbol{\lambda}^T \mathbf{f}\), où \(\boldsymbol{\lambda}(t) \in \mathbb{R}^n\) sont des variables de coût (aussi appelées variables adjointes). Les conditions nécessaires pour l'optimalité sont :

  • Équations d'état : \(\dot{\mathbf{x}} = \partial H / \partial \bolbol{\lambda}\)
  • équations Costate: \(\dot{\bolbolbolbol{\lambda}} = -\partial H / \partial \mathbf{x}\)
  • État de stationnarité: \(\partial H / \partial \mathbf{u} = ↓)
  • Conditions de bordure: \(\mathbf{x}(t 0) = \mathbf{x} ю); \(\boldsymbol{\lambda}(t f) = \left( \partial \phi / \partial \mathbf{x} + \boldsymbol{\nu}^T \partial \psi / \partial \mathbf{x} \right) {t f}\)

La condition de stationnalité peut être utilisée pour éliminer le contrôle en termes d'état et de coût, donnant un système couplé d'équations différentielles ordinaires de premier ordre (ODE) de 2n avec des conditions limites divisées entre les temps initial et final.

Le système hamiltonien

Pour un problème de contrôle optimal typique sans contraintes de trajectoire, ces équations forment un système Hamiltonien qui préserve la valeur Hamiltonienne sur une trajectoire optimale si le système est autonome et le coût terminal n'a pas de dépendance explicite en temps. Les équations d'état se propagent en avant, tandis que les équations de coût se propagent en arrière dans le temps. Cette nature mixte en avant-arrière rend le BVP difficile : les conditions initiales ne sont que partiellement connues (état à \(t -)) et partiellement inconnues (costate à \(t --)), tandis que les autres conditions sont spécifiées en dernier temps. La solution doit croiser les deux limites simultanément.

Conditions de frontière et transversalité

Les conditions de limite dans les BVP de contrôle optimaux sont plus que des états initiaux et finaux fixés.

  • État initial fixe: \(\mathbf{x}(t 0) = \mathbf{x} 0\).
  • État final libre avec coût terminal:[ Le coût en dernier temps satisfait aux conditions de transversalité \(\boldsymbol{\lambda}(t f) = \partial \phi / \partial \mathbf{x} \big={t f}\).
  • Contraintes terminales: Si l'état final doit satisfaire \(\psi(\mathbf{x}(t f), t f) = ↓), la condition de transversalité devient \(\boldsymbol{\lambda}(t f) = \partial \phi / \partial \mathbf{x} + \boldsymbol{\nu}^T \partial \psi / \partial \mathbf{x}\), où \(\boldsymbol{\nu}\) est un vecteur multiplicateur de Lagrange associé aux contraintes terminales.
  • Heure finale libre:[ Une condition supplémentaire \(\left( H + \partial \phi / \partial t \right) {t f} = ↓) doit être satisfaite.

La formulation correcte de ces conditions limites est critique. Des conditions mal définies peuvent conduire à une instabilité numérique ou à une convergence vers des solutions non optimales. Pour un traitement approfondi des conditions de transversalité, voir le texte classique de Bryson et Ho.

Méthodes de résolution des problèmes de valeur de la frontière

Comme les solutions analytiques aux BVPs dans un contrôle optimal sont rarement possibles, sauf pour les systèmes très simples (par exemple, régulateur quadriatique linéaire avec temps final fixe), les méthodes numériques sont essentielles.Les principales catégories comprennent les méthodes de tir, les méthodes de différence finie et les méthodes de collocation.

Méthodes de tir

Les méthodes de tournage transforment le BVP en un problème initial de valeur (IVP) en devinant les conditions initiales manquantes (généralement le coût initial) et en intégrant le système Hamiltonien vers l'avant au moment du terminal. L'inadéquation terminale (différence entre les conditions finales calculées et les conditions terminales désirées) est alors utilisée pour mettre à jour l'hypothèse. Ce processus itératif consiste essentiellement à résoudre un problème de recherche de racine non linéaire. La prise de vue simple utilise seulement une peritération d'intégration vers l'avant; la prise de vue multiple divise l'intervalle de temps en segments, intégrant chaque segment séparément et imposant des conditions de continuité aux limites du segment.

Les méthodes de tir sont intuitives et permettent de tirer sur des intégrateurs d'ODE matures. Cependant, ils peuvent être sensibles aux mauvaises hypothèses initiales et peuvent échouer pour des problèmes avec des horizons longs ou une sensibilité élevée aux conditions initiales.

Méthodes de différence de finite

Les équations différentielles sont remplacées par des approximations de différence finie (p. ex. Euler avant, trapèze ou plans Runge-Kutta). Les conditions limites deviennent des contraintes d'égalité aux premier et dernier points de la grille. Le résultat est un grand système d'équations algébriques qui doivent être résolues simultanément— en utilisant habituellement des méthodes basées sur Newton. Cette approche évite l'intégration explicite vers l'avant et peut gérer naturellement les BVP multipoints. Un exemple proéminent est la méthode de lignes pour les PDE paraboliques, mais pour les BVP ODE il est simple de mettre en œuvre.

Les méthodes de différence de finite constituent une alternative robuste, surtout pour les problèmes de structure de solution connue. Elles nécessitent la résolution de grands systèmes linéaires clairsemés à chaque itération de Newton, qui peuvent être calculables coûteux pour les espaces d'état haute dimension mais qui bénéficient de la parallélisation et des techniques de matrice clairsemées.

Méthodes de répartition

Les méthodes de collocation représentent les trajectoires d'état et de contrôle comme polynômes à la pièce (généralement des splines) et font appliquer les équations différentielles exactement à un ensemble de points de collocation dans chaque intervalle de temps. Les conditions de limite et les conditions de continuité entre les intervalles sont imposées comme contraintes supplémentaires. Le problème de programmation non linéaire (NLP) résultant peut être résolu en utilisant des optimisateurs hors-sol comme IPOPT ou SNOPT. Les méthodes de collocation sont le fondement d'approches modernes de transcription directe pour un contrôle optimal, comme la méthode pseudospectrale Legendre-Gauss-Lobatta, qui est utilisée dans le logiciel populaire GPOPS-II. Ces méthodes offrent une grande précision (convergence exponentielle pour des problèmes lisses) et sont particulièrement adaptées aux problèmes avec des contraintes de trajectoire.

Pour une comparaison détaillée des méthodes numériques BVP, voir Ascher, Mattheij et Russell " Solution numérique des problèmes de valeur de frontière pour les équations différentielles ordinaires".

Choisir la bonne méthode

Le choix de la méthode dépend de plusieurs facteurs:

  • Taille du problème:[ Pour l'état de faible dimension (n ≤ 10), les méthodes de tir sont souvent adéquates. Pour les problèmes de haute dimension ou de grande échelle, la collocation ou la différence finie peut être plus grande.
  • Stiffness de la dynamique:[ Les systèmes rigides nécessitent une intégration implicite, qui la collocation et la différence finie se manipulent naturellement.
  • Disponibilité d'une bonne hypothèse initiale:[ Les méthodes de tir dépendent fortement de la qualité de la prévision initiale. Si une approximation approximative de la trajectoire optimale est disponible (p. ex., à partir d'un modèle heuristique ou simplifié), la prise de vue peut converger rapidement.
  • Contraintes de la patte :[ Lorsque des contraintes d'inégalité sur les états ou les contrôles sont présentes, les méthodes de transcription directe (collocation) sont généralement plus flexibles.

Défis et considérations

La résolution de BVP dans un contrôle optimal n'est pas une tâche courante; plusieurs défis doivent être relevés.

Sensibilité et convergence

De petits changements dans les conditions de limites inconnues peuvent causer de grandes déviations à l'état final en raison de la croissance exponentielle des erreurs dans les directions instables. Ceci est particulièrement aigu dans le tir simple, qui peut présenter un mauvais conditionnement. Plusieurs stratégies de tir et de maillage réduisent ce problème en fournissant un problème mieux conditionné.

Élargissement et normalisation

Les variables (états, coûts, temps) s'étendent souvent sur différents ordres de grandeur. Une mauvaise échelle conduit à des Jacobiens mal conditionnés et à une convergence lente. Normaliser le temps à un intervalle fixe (p. ex. [0,1]) et les états de gradation à une gamme d'unités sont des étapes standard de prétraitement.

Arcs singuliers et solutions non lisses

Dans certains cas de problèmes optimaux de contrôle, le Hamiltonien peut être linéaire dans le contrôle, ce qui entraîne des arcs singuliers où la condition de stationarité ne détermine pas le contrôle. Ces arcs nécessitent une manipulation spéciale, comme l'utilisation du fait que les dérivés temporels de la fonction de commutation disparaissent. Les BVPs singulars sont plus complexes et nécessitent souvent des conditions d'ordre supérieur (p. ex., la condition Kelley). De même, les contraintes de contrôle peuvent causer des profils de contrôle bang-bang avec des trajectoires de contrôle discontinues, ce qui remet en question les méthodes numériques qui supposent la différenciation.

Coût informatique

Les systèmes à haute dimension (n > 50) sont communs dans l'aérospatiale et la robotique. Les méthodes de colocation et de différence de finite conduisent à de grandes NLP avec des milliers de variables et de contraintes. Des techniques efficaces d'algèbre linéaire et de décomposition (par exemple, programmation quadratique séquentielle) sont essentielles. Les méthodes de tir peuvent être plus efficaces pour des dimensions modérées si la dynamique est peu coûteuse à intégrer.

Applications et études de cas dans le monde réel

La résolution de problèmes de valeur de frontière dans le contrôle optimal n'est pas un exercice académique et n°8212; elle est employée quotidiennement dans la conception et les opérations d'ingénierie.

Aéronautique : montée en flèche du lanceur

L'une des applications classiques est l'ascension optimale d'un lanceur de la Terre à l'orbite. La dynamique du véhicule implique un mouvement tridimensionnel, une masse variable due à la combustion du carburant et à la traînée atmosphérique. L'objectif est de minimiser la consommation de carburant (ou de maximiser la charge utile). Le TPBVP résultant comprend des contraintes terminales sur l'altitude, la vitesse et l'angle de trajectoire de vol. Les méthodes de tir, combinées à l'homotopie d'une solution connue plus simple (p. ex., vol sous vide), sont couramment utilisées.

Robotique : Voie temporelle optimale suivant

Pour les manipulateurs robotisés chargés de suivre un chemin géométrique prescrit, le problème de contrôle optimal réduit le temps de passage soumis à des limites de couple. La dynamique conduit à un ensemble d'équations différentielles avec des conditions de limite sur la position et la vitesse au début et à la fin du chemin. Les méthodes de collocation excellent ici parce que le chemin peut être paramétré par une seule variable scalaire, ce qui donne un petit BVP qui peut être résolu en temps réel pour la planification réactive du mouvement.

Économie : modèles de croissance optimaux

En macroéconomie, le modèle de croissance Ramsey cherche à trouver la voie de consommation qui maximise le bien-être social sur un horizon infini, ce qui conduit à un BVP avec des équations d'état (capital) et de coût (prix de l'ombre), avec des conditions de transversalité à l'infini (souvent approximatives à un grand temps fini).

Exemple d'illustration : Problème simple à une dimension

Considérez le problème de minimiser \(\int 0^1 (x^2 + u^2) dt\) avec la dynamique \(\dot{x} = u\), l'état initial fixe \(x(0)=1\) et l'état final libre. Le Hamiltonien est \(H = x^2 + u^2 + \lambda u\). PMP donne \(\dot{\lambda} = -2x\), \(\partial H/\partial u = 2u + \lambda = ↓) so \(u = -\lambda/2\). Cela se réduit à \(\dot{x} = -\lambda/2\), \(\dot{\lambda} = -2x\). Le système est linéaire avec les conditions limites \(x(0)=1\) et \(\lambda(1)=0\) (puisque le coût terminal est nul).

Conclusion

De la formulation théorique via le principe maximal de Pontryagin à la solution numérique pratique utilisant des méthodes de tir, de différence finie ou de collocation, la compréhension des BVP est indispensable pour toute personne travaillant avec l'optimisation dynamique.Les défis inhérents à la sensibilité, l'échelle et la non-lissage exigent une sélection minutieuse des algorithmes et un prétraitement des problèmes.Cependant, le bénéfice est substantiel: la capacité de calculer des trajectoires vraiment optimales pour une large gamme de systèmes réels.