Lo sviluppo di algoritmi di controllo dei reattori di sicurezza è un settore critico della ricerca nell'ingegneria nucleare. Con l'avvento dell'apprendimento automatico, sono emersi nuove possibilità per migliorare la sicurezza e l'efficienza dei reattori nucleari. Questo articolo esplora come le tecniche di apprendimento automatico sono integrate nei sistemi di controllo dei reattori per privilegiare la sicurezza mantenendo le prestazioni ottimali.

Contesto storico: da Analog a Controllo Intelligente

Il controllo del reattore nucleare si è evoluto da aggiustamenti manuali e loop di feedback analogici ai sistemi digitali che monitorano migliaia di parametri in tempo reale.

Requisiti di sicurezza fondamentali nel controllo reattore

L'algoritmo di controllo di un reattore nucleare deve soddisfare criteri di sicurezza rigorosi: deve mantenere il reattore entro limiti operativi sicuri, prevenire danni al rivestimento del combustibile e garantire un arresto affidabile quando necessario. Gli algoritmi tradizionali sono progettati con margini conservatori. L'apprendimento automatico, tuttavia, introduce l'incertezza perché i modelli imparano dai dati e possono comportarsi inaspettatamente al di fuori della loro distribuzione di formazione.

Imparare la macchina nella sicurezza del reattore

Gli algoritmi di apprendimento automatico possono analizzare vaste quantità di dati dai sensori del reattore per identificare i modelli indicativi di potenziali problemi di sicurezza. Questi algoritmi possono prevedere anomalie prima di escalare, consentendo interventi proattivi. Le tecniche chiave includono l'apprendimento supervisionato per il rilevamento dei guasti e l'apprendimento del rinforzo per l'ottimizzazione del controllo.

Imparare supervisionato per la rilevazione di guasti

I modelli di apprendimento supervisionati sono formati su dati storici per riconoscere le firme di errori o condizioni non sicure. Una volta addestrati, questi modelli possono monitorare in tempo reale i dati per rilevare tempestivamente deviazioni e attivare i protocolli di sicurezza. Ad esempio, un classificatore può essere addestrato per identificare l'insorgenza di un incidente di raffreddamento di perdita-di-coolant o di una rottura del tubo del vapore analizzando i segnali di pressione, temperatura e portata.

Apprendimento di rinforzo per l'ottimizzazione del controllo

L'apprendimento delle forze di sicurezza (RL) consente agli algoritmi di controllo di apprendere azioni ottimali attraverso processi ed errori all'interno di ambienti simulati. I primi approcci di sicurezza incorporano vincoli nel processo di apprendimento, assicurando che il sistema preveda la sicurezza sulle prestazioni quando necessario. Un metodo comune è quello di utilizzare un critico di sicurezza che segna azioni basate sulla loro prossimità ai confini di sicurezza. Durante la formazione, l'agente RL è autorizzato a esplorare solo all'interno di una busta sicura; qualsiasi passo che attraversi un risultato di soglia in una penalità.

Controllo predittivo del modello con dinamiche imparate

Un altro orientamento promettente è quello di combinare l'apprendimento automatico con il controllo predittivo del modello (MPC), invece di utilizzare un modello basato sulla fisica fissa, una rete neurale impara le dinamiche del reattore dai dati. Un ottimizzatore MPC risolve quindi un problema di ottimizzazione a livello di tempo, utilizzando il modello imparato per prevedere gli stati futuri.

Integrare i vincoli di sicurezza nell'apprendimento

Garantire che gli algoritmi di machine learning rispettino i limiti di sicurezza richiede un design attento.

  • Procedimenti di decisione di Markov[[[]] – L'agente massimizza la ricompensa soggetta a vincoli sui costi di sicurezza cumulativi (ad esempio, il numero massimo di viaggi all'anno). La soluzione può essere trovata utilizzando metodi lagrangiani o ottimizzazione primal-duale.
  • Sintesi dello sparo[[[] – Un modulo di verifica separato, o “selezionato”, monitora le azioni dell’agente e sovrascrive qualsiasi cosa che possa portare a una violazione. Lo scudo può essere costruito da un modello fisico semplificato o da una specifica formale della busta di funzionamento sicura del reattore.
  • ottimizzazione Bayesian [[] – Utilizzato per la messa a punto di punti o di controllo, l'ottimizzazione Bayesian modella la funzione di sicurezza come processo Gaussian ed esplora solo i punti che sono probabilmente sicuri con alta probabilità.

Questi metodi sono stati convalidati in simulatori ad alta fedeltà e i ricercatori stanno ora lavorando per trasferirli in veri e propri testbed hardware-in-the-loop (Nuclear Science and Engineering, 2024).

Sfide in attuazione

Nonostante i risultati promettenti, l'impiego di un'apprendimento automatico in una sala di controllo del reattore nucleare affronta diversi ostacoli:

  • Interpretabilità[[] – I regolatori richiedono che gli operatori capiscano perché un sistema di controllo ha preso una determinata decisione. Le reti neurali della scatola nera sono difficili da spiegare, ma tecniche come la propagazione della rilevanza a livello e i valori di Shapley possono aiutare a identificare le caratteristiche di input influenti.
  • Rbustibilità al cambiamento di distribuzione[[[] – Le condizioni del reattore possono derivare gradualmente (ad esempio, l'invecchiamento del carburante) o cambiare bruscamente (ad esempio, un appiattimento della valvola).Il modello deve rimanere preciso in condizioni non viste durante l'allenamento.
  • Verificazione e validazione (V&V)[[] – I metodi tradizionali V&V (testando contro un insieme di scenari) non possono essere sufficienti per i controller appresi.
  • Accogliere il regolamento[[ – La Commissione per la regolamentazione nucleare degli Stati Uniti e altre autorità hanno linee guida rigorose per i sistemi di sicurezza digitale. L’accettazione dell’apprendimento automatico richiederà una base di prova forte, metriche chiare per prestazioni affidabili e un quadro per il monitoraggio continuo del comportamento dell’algoritmo.

Studi di casi e progetti pilota

In Svezia, un agente di formazione per il rafforzamento ha imparato ad ottimizzare le velocità di ricircolo delle pompe nel rispetto dei limiti termici, raggiungendo uno 0,5% di efficienza senza violare i casi di riferimento.

Le direzioni future

In vista di un futuro, il campo si sta muovendo verso sistemi di controllo apprendeti end-to-end che possono gestire più reattori in una stazione, allocazione dinamica del vapore e interazione con la rete elettrica.

  • A spiegabile[[] – Sviluppare modelli che non solo prendono decisioni sicure ma anche producono spiegazioni leggibili dall'uomo, come i grafici causali o gli scenari controproducenti.
  • Centificazione dell'incertezza[[] – Utilizzando reti neurali Bayesian o metodi di ensemble per fornire intervalli di fiducia sia sulle previsioni che sulle azioni raccomandate, questo consente al sistema di controllo di richiedere l'intervento umano quando l'incertezza è alta.
  • Trasferimento apprendimento[[] – Modelli di pre-formazione su simulatori generici di reattore e la loro regolazione fine per impianti specifici, riducendo la quantità di dati specifici del sito richiesti.
  • Sistemi Human‐in‐the-loop[[] – Interfacce di progettazione in cui l'agente di machine learning suggerisce azioni, ma la decisione finale si basa su un operatore. Il sistema deve essere abbastanza trasparente da costruire fiducia.

Conclusioni

L'integrazione dell'apprendimento automatico negli algoritmi di controllo dei reattori offre promettenti progressi in termini di sicurezza ed efficienza. Grazie alle tecniche adattative e predittive, i reattori di fiducia sono in grado di operare in modo più sicuro in un ambiente sempre più complesso, l'apprendimento dei rinforzi per un controllo ottimale sotto vincoli e le dinamiche di apprendimento ibrido MPC-learned-learned-based, e la realizzazione di una sicurezza di controllo di controllo.