Die Entwicklung von Sicherheits-Reaktor-Steueralgorithmen ist ein wichtiger Forschungsbereich in der Kerntechnik. Mit dem Aufkommen des maschinellen Lernens sind neue Möglichkeiten entstanden, die Sicherheit und Effizienz von Kernreaktoren zu verbessern. Dieser Artikel untersucht, wie maschinelle Lerntechniken in Reaktorsteuerungssysteme integriert werden, um Sicherheit zu priorisieren und gleichzeitig eine optimale Leistung zu gewährleisten. Durch die Kombination adaptiver, datengesteuerter Modelle mit strengen Sicherheitsbeschränkungen entwerfen Forscher Steuerungsstrategien, die Fehler antizipieren, die Leistungsabgabe optimieren und auf unvorhergesehene Ereignisse effektiver reagieren können als herkömmliche regelbasierte Systeme.

Historischer Kontext: Vom Analogen zur Intelligenten Steuerung

Die Steuerung von Kernreaktoren hat sich von manuellen Anpassungen und analogen Rückkopplungsschleifen zu digitalen Systemen entwickelt, die Tausende von Parametern in Echtzeit überwachen. Frühe Steuerungsalgorithmen stützten sich auf proportional-integrale abgeleitete Steuerungen und vorberechnete Sollwerte. Diese Systeme sind robust, aber nicht flexibel genug, um transiente Bedingungen über ihre Auslegungsgrundlage hinaus zu bewältigen. Da Reaktoren mehr Sensoren und Rechenleistung enthalten, bietet maschinelles Lernen einen Weg, um von der reaktiven zur prädiktiven Steuerung überzugehen. Die Internationale Atomenergiebehörde (IAEO) hat das Potenzial moderner digitaler Instrumente und Steuerung, einschließlich KI, erkannt, um Sicherheit und Zuverlässigkeit zu verbessern.

Kernanforderungen an die Sicherheit in der Reaktorsteuerung

Jeder Regelalgorithmus für einen Kernreaktor muss strenge Sicherheitskriterien erfüllen: Er muss den Reaktor innerhalb sicherer Betriebsgrenzen halten, Schäden an der Brennstoffverkleidung verhindern und bei Bedarf eine zuverlässige Abschaltung gewährleisten. Herkömmliche Algorithmen sind mit konservativen Margen konzipiert. Maschinelles Lernen führt jedoch zu Unsicherheit, da Modelle aus Daten lernen und sich außerhalb ihrer Trainingsverteilung unerwartet verhalten können. Ein Sicherheitsansatz geht diesem Problem durch die Einbettung von Einschränkungen in den Lernprozess entgegen, wodurch sichergestellt wird, dass das System niemals eine Aktion vorschlagen kann, die gegen Sicherheitsgrenzen verstößt, selbst wenn diese Aktion die Leistung verbessern würde. Dies wird oft durch eingeschränktes verstärkendes Lernen erreicht, wo ein sicherer Bereich definiert wird und der Algorithmus bestraft wird, wenn er ihn verlässt.

Machine Learning in der Reaktorsicherheit

Machine-Learning-Algorithmen können riesige Datenmengen von Reaktorsensoren analysieren, um Muster zu identifizieren, die auf potenzielle Sicherheitsprobleme hinweisen. Diese Algorithmen können Anomalien vorhersagen, bevor sie eskalieren, was proaktive Interventionen ermöglicht. Zu den Schlüsseltechniken gehören überwachtes Lernen zur Fehlererkennung und Verstärkungslernen zur Steuerungsoptimierung. Deep-Learning-Architekturen wie konvolutionale neuronale Netze und lange Kurzzeitgedächtnisnetze sind besonders effektiv bei der Verarbeitung von Zeitreihensensordaten und räumlichen Verteilungen (z. B. Neutronenflusskarten).

Überwachtes Lernen zur Fehlererkennung

Beaufsichtigte Lernmodelle werden auf historischen Daten trainiert, um Signaturen von Fehlern oder unsicheren Bedingungen zu erkennen. Einmal trainiert, können diese Modelle Echtzeitdaten überwachen, um Abweichungen zu erkennen und Sicherheitsprotokolle sofort auszulösen. Beispielsweise kann ein Klassifikator trainiert werden, um den Beginn eines Kühlmittelverlustunfalls oder eines Dampferzeugerrohrbruchs durch Analyse von Druck-, Temperatur- und Durchflusssignalen zu erkennen. Die Ergebnisse des Modells werden dann verwendet, um die Position der Steuerstäbe einzustellen oder eine Notfallkühlung einzuleiten. Untersuchungen haben gezeigt, dass Ensemble-Methoden (z. B. zufällige Wälder oder Gradientenverstärkung) hohe Genauigkeit erreichen auch mit verrauschten Daten von Pflanzensimulatoren [FLT: 0] (Khan et al., 2022) [FLT: 1].

Reinforcement Learning für die Steuerungsoptimierung

Verstärkungslernen (Reinforcement Learning, RL) ermöglicht es Regelalgorithmen, optimale Aktionen durch Versuch und Irrtum in simulierten Umgebungen zu lernen. Sicherheits-Erstansätze integrieren Einschränkungen in den Lernprozess, um sicherzustellen, dass das System bei Bedarf Sicherheit gegenüber Leistung priorisiert. Eine gängige Methode ist die Verwendung eines Sicherheitskritikers, der Aktionen basierend auf ihrer Nähe zu Sicherheitsgrenzen bewertet. Während des Trainings darf der RL-Agent nur innerhalb eines sicheren Umschlags erkunden. Jeder Schritt, der einen Schwellenwert überschreiten würde, führt zu einer Strafe und einem Zurücksetzen in einen sicheren Zustand. Diese Technik wurde erfolgreich an vereinfachten Reaktormodellen demonstriert, bei denen der Agent lernt, Stromtransienten zu verwalten, während die Kraftstofftemperaturen unter Grenzwerten bleiben.

Modellprädiktive Steuerung mit gelernter Dynamik

Eine weitere vielversprechende Richtung ist die Kombination von maschinellem Lernen mit Modellprädiktivsteuerung (MPC). Statt eines festen, auf Physik basierenden Modells lernt ein neuronales Netzwerk die Reaktordynamik aus Daten. Ein MPC-Optimierer löst dann in jedem Zeitschritt ein eingeschränktes Optimierungsproblem, indem er das gelernte Modell zur Vorhersage zukünftiger Zustände verwendet. Da das Modell online aktualisiert werden kann, passt sich das System an wechselnde Bedingungen an (z. B. Brennstoffabbrand, Steuerstabverschleiß) und erfüllt gleichzeitig harte Sicherheitsauflagen. Dieser hybride Ansatz bietet das Beste aus beiden Welten: die Sicherheitsgarantien der traditionellen Regeltheorie und die Flexibilität des maschinellen Lernens.

Integration von Sicherheitsbeschränkungen in das Lernen

Um sicherzustellen, dass Algorithmen des maschinellen Lernens die Sicherheitsgrenzen einhalten, ist ein sorgfältiges Design erforderlich.

  • Eingeschränkte Markov-Entscheidungsprozesse – Der Agent maximiert die Belohnung, abhängig von Einschränkungen der kumulativen Sicherheitskosten (z. B. maximale Anzahl von Reisen pro Jahr).
  • Shield-Synthese – Ein separates Verifikationsmodul, oder “Shield”, überwacht die Handlungen des Agenten und überschreibt alle, die zu einer Verletzung führen würden.
  • Safe Bayessche Optimierung – Wird zum Tuning von Sollpunkten oder Controller-Verstärkungen verwendet, modelliert die Bayessche Optimierung die Sicherheitsfunktion als Gauß-Prozess und erforscht nur Punkte, die wahrscheinlich mit hoher Wahrscheinlichkeit sicher sind.

Diese Methoden wurden in High-Fidelity-Simulatoren validiert, und Forscher arbeiten nun daran, sie auf echte Hardware-in-the-Loop-Testumgebungen zu übertragen (Nuclear Science and Engineering, 2024) .

Herausforderungen bei der Umsetzung

Trotz vielversprechender Ergebnisse steht der Einsatz von maschinellem Lernen in einem Kontrollraum für Kernreaktoren vor mehreren Hürden:

  • Interpretierbarkeit – Die Regulierungsbehörden verlangen, dass die Betreiber verstehen, warum ein Steuerungssystem eine bestimmte Entscheidung getroffen hat. Neurale Blackbox-Netzwerke sind schwer zu erklären, aber Techniken wie die schichtweise Relevanzausbreitung und Shapley-Werte können helfen, einflussreiche Eingabemerkmale zu identifizieren.
  • Robustheit gegenüber Verteilungsverschiebung – Die Reaktorbedingungen können allmählich driften (z. B. Alterung des Kraftstoffs) oder sich abrupt ändern (z. B. ein Ventilkleben). Das Modell muss unter Bedingungen, die während des Trainings nicht zu sehen sind, genau bleiben. Domänenzufallsbestimmungen und gegnerisches Training werden untersucht, um die Robustheit zu verbessern.
  • Verifikation und Validierung (V&V) – Traditionelle V&V-Methoden (Tests gegen eine Reihe von Szenarien) sind für gelernte Controller möglicherweise nicht ausreichend. Formale Verifizierungswerkzeuge, die beweisen, dass das System niemals eine sichere Region verlässt, sind ein aktives Forschungsgebiet, insbesondere für stückweise lineare neuronale Netze.
  • Regulierungsakzeptanz – Die US-amerikanische Nuclear Regulatory Commission und andere Behörden haben strenge Richtlinien für digitale Sicherheitssysteme. Die Akzeptanz von maschinellem Lernen erfordert eine starke Evidenzbasis, klare Metriken für eine zuverlässige Leistung und einen Rahmen für die laufende Überwachung des Verhaltens des Algorithmus.

Fallstudien und Pilotprojekte

Mehrere Forschungsgruppen haben das praktische Potenzial von Sicherheit-erstem maschinellem Lernen für die Reaktorsteuerung demonstriert. Im Kernkraftwerk Forsmark in Schweden lernte ein verstärkender Lernagent, die Drehzahlen von Rezirkulationspumpen unter Einhaltung thermischer Grenzen zu optimieren und eine Effizienzsteigerung von 0,5% zu erreichen, ohne irgendwelche Einschränkungen zu verletzen. Am Massachusetts Institute of Technology verwendeten Forscher ein tiefes neuronales Netzwerk, um die Kernneutronik eines kleinen modularen Reaktors zu modellieren, und wandten dann eine modellprädiktive Steuerung an, um die Steuerstabbewegungen während der Lastfolgeoperationen zu planen. In beiden Fällen wurden die gelernten Controller mit herkömmlichen PID-Controllern verglichen und zeigten schnellere Reaktionszeiten mit geringerem Überschwingen.

Zukünftige Richtungen

Mit Blick auf die Zukunft bewegt sich das Feld in Richtung durchgängig erlernter Steuerungssysteme, die mehrere Reaktoren in einer Station, dynamische Dampfzuteilung und Interaktion mit dem Stromnetz bewältigen können.

  • Erklärbare KI – Entwicklung von Modellen, die nicht nur sichere Entscheidungen treffen, sondern auch menschenlesbare Erklärungen wie Kausalgraphen oder kontrafaktische Szenarien liefern.
  • Quantifizierung der Unsicherheit – Verwendung von Bayesschen neuronalen Netzen oder Ensemble-Methoden, um Vertrauensintervalle für Vorhersagen und empfohlene Aktionen zu liefern, was es dem Kontrollsystem ermöglicht, bei hoher Unsicherheit menschliches Eingreifen zu verlangen.
  • Transfer Learning – Vorschulungsmodelle für generische Reaktorsimulatoren und deren Feinabstimmung für spezifische Anlagen, wodurch die Menge der erforderlichen standortspezifischen Daten reduziert wird.
  • Human-in-the-Loop-Systeme – Gestaltung von Schnittstellen, bei denen der Agent für maschinelles Lernen Aktionen vorschlägt, die endgültige Entscheidung jedoch bei einem Bediener liegt. Das System muss transparent genug sein, um Vertrauen aufzubauen.

Schlussfolgerung

Die Integration des maschinellen Lernens in Reaktorsteuerungsalgorithmen bietet vielversprechende Fortschritte in Bezug auf Sicherheit und Effizienz. Durch die Nutzung adaptiver und prädiktiver Techniken - überwachtes Lernen für die Fehlerfrüherkennung, Verstärkungslernen für eine optimale Steuerung unter Einschränkungen und hybride MPC-erlernte Dynamik - können Kernreaktoren in einer zunehmend komplexen Umgebung sicherer arbeiten. Der Weg zum Einsatz erfordert jedoch eine sorgfältige Aufmerksamkeit auf Interpretierbarkeit, Robustheit und regulatorische Validierung. Fortgeführte Forschung und Zusammenarbeit zwischen Wissenschaft, Industrie und Sicherheitsbehörden sind unerlässlich, um das volle Potenzial dieser Technologien zu nutzen. Mit einer Sicherheitsvorstellung kann maschinelles Lernen ein vertrauenswürdiger Partner im Kontrollraum werden und den Betreibern helfen, sowohl Routinemanöver als auch außergewöhnliche Ereignisse zu navigieren.