Le développement d'algorithmes de contrôle de la sûreté des réacteurs est un domaine de recherche crucial en génie nucléaire.Avec l'avènement de l'apprentissage automatique, de nouvelles possibilités sont apparues pour améliorer la sûreté et l'efficacité des réacteurs nucléaires. Cet article explore comment les techniques d'apprentissage machine sont intégrées dans les systèmes de contrôle des réacteurs afin de prioriser la sûreté tout en maintenant des performances optimales.

Contexte historique : De l'analogique au contrôle intelligent

La commande du réacteur nucléaire est passée de réglages manuels et de boucles de rétroaction analogiques à des systèmes numériques qui surveillent des milliers de paramètres en temps réel. Les algorithmes de commande précoces se sont appuyés sur des contrôleurs proportionnels-intégraux-dérivés et des points de consigne précalculés. Ces systèmes sont robustes mais ne disposent pas de la flexibilité nécessaire pour gérer des conditions transitoires au-delà de leur base de conception.

Exigences de base en matière de sécurité dans le contrôle des réacteurs

Tout algorithme de contrôle d'un réacteur nucléaire doit satisfaire à des critères de sécurité stricts : il doit maintenir le réacteur dans des limites de sécurité, éviter les dommages au revêtement du combustible et assurer un arrêt fiable au besoin.Les algorithmes traditionnels sont conçus avec des marges prudentes.L'apprentissage automatique introduit toutefois l'incertitude parce que les modèles apprennent à partir de données et peuvent se comporter de manière inattendue en dehors de leur distribution de formation.Une première approche de sécurité s'attaque à cela en intégrant les contraintes dans le processus d'apprentissage – en veillant à ce que le système ne puisse jamais proposer une action qui viole les limites de sécurité, même si cette action améliorerait les performances.

L'apprentissage automatique en sécurité des réacteurs

Les algorithmes d'apprentissage automatique peuvent analyser de grandes quantités de données provenant des capteurs de réacteurs pour identifier les modèles qui indiquent des problèmes potentiels de sécurité.Ces algorithmes peuvent prédire les anomalies avant qu'elles ne s'aggravent, ce qui permet des interventions proactives.Les techniques clés comprennent l'apprentissage supervisé pour la détection des défauts et le renforcement de l'apprentissage pour l'optimisation du contrôle.

Apprentissage supervisé pour la détection des fautes

Une fois formés, ces modèles peuvent surveiller les données en temps réel pour détecter rapidement les écarts et déclencher des protocoles de sécurité. Par exemple, un classificateur peut être formé pour identifier le début d'un accident de perte de refroidissement ou d'une rupture du tube générateur de vapeur en analysant les signaux de pression, de température et de débit. Les sorties du modèle sont ensuite utilisées pour ajuster les positions des tiges de commande ou pour amorcer le refroidissement d'urgence. Des recherches ont montré que les méthodes d'ensemble (p. ex., les forêts aléatoires ou le dynamisation des gradients) obtiennent une grande précision même avec des données bruyantes provenant de simulateurs de plantes (Khan et al., 2022).

Renforcement de l'apprentissage pour l'optimisation du contrôle

L'apprentissage du renforcement (RL) permet aux algorithmes de contrôle d'apprendre des actions optimales par des essais et des erreurs dans des environnements simulés. Les premières approches de sécurité intègrent des contraintes dans le processus d'apprentissage, garantissant que le système privilégie la sécurité sur les performances au besoin. Une méthode commune consiste à utiliser un critique de sécurité qui note les actions en fonction de leur proximité avec les limites de sécurité.

Modèle Contrôle prédictif avec dynamique apprise

Un optimisation MPC résout ensuite un problème d'optimisation limité à chaque étape, en utilisant le modèle appris pour prédire les états futurs. Parce que le modèle peut être mis à jour en ligne, le système s'adapte aux conditions changeantes (par exemple, épuisement du combustible, usure de la tige de commande) tout en satisfaisant aux contraintes de sécurité dures. Cette approche hybride offre le meilleur des deux mondes : les garanties de sécurité de la théorie traditionnelle du contrôle et la flexibilité de l'apprentissage machine.

Intégrer les contraintes de sécurité dans l'apprentissage

Pour que les algorithmes d'apprentissage automatique respectent les limites de sécurité, il faut une conception minutieuse.

  • Processus décisionnels de Markov [ – L'agent maximise la récompense sous réserve de contraintes sur les coûts cumulatifs de sécurité (p. ex., nombre maximal de voyages par année). La solution peut être trouvée en utilisant des méthodes lagrangiennes ou l'optimisation primaire du double.
  • Synthèse de rendement – Un module de vérification distinct, ou -Shield, , , , , surveille les actions de l'agent et écrase toute violation. Le bouclier peut être construit à partir d'un modèle de physique simplifié ou une spécification formelle du réacteur , enveloppe de fonctionnement sûre.
  • Optimisation bayésienne sécuritaire – Utilisée pour l'accordage des points de réglage ou des gains de contrôleur, l'optimisation bayésienne modélise la fonction de sécurité comme un processus gaussien et explore seulement des points qui sont susceptibles d'être sûrs avec une forte probabilité.

Ces méthodes ont été validées dans des simulateurs de haute fidélité, et les chercheurs travaillent maintenant à les transférer dans des bancs d'essai de matériel réel dans la boucle (Nuclear Science and Engineering, 2024).

Difficultés rencontrées dans la mise en œuvre

Malgré des résultats prometteurs, le déploiement de l'apprentissage automatique dans une salle de contrôle du réacteur nucléaire est confronté à plusieurs obstacles :

  • Interprétabilité – Les régulateurs exigent que les opérateurs comprennent pourquoi un système de contrôle a pris une certaine décision. Les réseaux neuraux à boîtes noires sont difficiles à expliquer, mais des techniques telles que la propagation de la pertinence par couche et les valeurs de Shapley peuvent aider à identifier les caractéristiques d'entrée influentes.
  • La robustesse au déplacement de distribution[ – Les conditions de réacteur peuvent dériver progressivement (p. ex., vieillissement du carburant) ou changer brusquement (p. ex., collage de valves).Le modèle doit rester précis dans des conditions non vues pendant l'entraînement.
  • La vérification et la validation (V&V) – Les méthodes V&V traditionnelles (tests par rapport à un ensemble de scénarios) peuvent ne pas suffire pour les contrôleurs expérimentés.Les outils de vérification officiels qui prouvent que le système ne quitte jamais une région sécuritaire sont un domaine de recherche actif, surtout pour les réseaux neuronaux linéaires à la pièce.
  • Acceptation réglementaire – La Commission de réglementation nucléaire des États-Unis et d'autres autorités ont des lignes directrices strictes pour les systèmes de sécurité numérique. L'acceptation de l'apprentissage automatique nécessitera une base de données solides, des mesures claires pour une performance fiable et un cadre pour la surveillance continue du comportement de l'algorithme.

Études de cas et projets pilotes

Plusieurs groupes de recherche ont démontré le potentiel pratique de l'apprentissage de la première machine en matière de sûreté pour le contrôle des réacteurs. À la centrale nucléaire de Forsmark en Suède, un agent d'apprentissage du renforcement a appris à optimiser les vitesses des pompes à recirculation tout en respectant les limites thermiques, à obtenir une augmentation de 0,5 % de l'efficacité sans violer aucune contrainte.

Orientations futures

Pour l'avenir, le terrain se dirige vers des systèmes de commande de bout en bout qui peuvent gérer plusieurs réacteurs dans une station, l'allocation dynamique de la vapeur et l'interaction avec le réseau électrique.

  • I.-------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------
  • Quantification d'incertitude[ – Utiliser des réseaux neuronaux ou des méthodes d'ensemble bayésiens pour fournir des intervalles de confiance sur les prédictions et les actions recommandées.
  • Trafer learning[ – Modèles de préformation sur simulateurs génériques de réacteurs et les ajuster pour des installations spécifiques, réduisant ainsi la quantité de données spécifiques au site.
  • Systèmes humains dans la boucle – Conception d'interfaces où l'agent d'apprentissage de la machine suggère des actions mais la décision finale incombe à un opérateur. Le système doit être suffisamment transparent pour construire la confiance.

Conclusion

L'intégration de l'apprentissage des machines dans les algorithmes de contrôle des réacteurs offre des progrès prometteurs en matière de sécurité et d'efficacité. En tirant parti des techniques d'adaptation et de prévision – apprentissage supervisé pour la détection précoce des défaillances, renforcement de l'apprentissage pour un contrôle optimal sous des contraintes et dynamique hybride des MPC – les réacteurs nucléaires peuvent fonctionner de façon plus sécuritaire dans un environnement de plus en plus complexe.