Table of Contents
安全第一原子炉制御アルゴリズムの開発は、原子力工学の研究の重要な領域です。機械学習の出現により、原子力原子炉の安全と効率性を高めるために新たな可能性が現れています。この記事では、機械学習技術が最適な性能を維持しながら、安全を優先する原子炉制御システムに統合されている方法について説明します。適応型、データ主導型モデルと厳格な安全制約を組み合わせることで、研究者は、欠陥を予測し、出力を最適化し、従来のシステムよりも効果的に応答できる制御戦略を設計しています。
歴史のコンテキスト: アナログからインテリジェント制御
核原子炉制御は、手動調節とアナログフィードバックループからリアルタイムで数千のパラメータを監視するデジタルシステムへと進化しました。初期制御アルゴリズムは、比例した統合型コントローラと前計算式セットポイントに依存しています。これらのシステムは堅牢ですが、設計基準を超えた条件を処理する柔軟性が欠如しています。より多くのセンサーとコンピューティングパワーを組み込むように、機械学習は、反応から予測制御までの移動経路を提供します。国際原子エネルギー機関(AI)は、AI(AI)およびAR(AI)の信頼性を向上するために、AI(AI)を向上します。
原子炉制御におけるコア安全要件
原子力原子炉のための制御アルゴリズムは、厳しい安全基準を満たす必要があります:それは安全な動作限界内の原子炉を維持し、燃料のクラッディングへの損傷を防ぎ、必要なときに信頼性の高いシャットダウンを保証します。従来のアルゴリズムは、保守的なマージンで設計されています。しかし、モデルがデータから学んだので、不確実性を導入し、訓練の配布の外で予期しない動作をすることができます。安全第一のアプローチは、システムが行動を提案できないことを保証することで、学習プロセスに制約を埋め込むことによって、このアドレスを適切に対処します。それは、それが、安全と定義された領域を制限する場合でも、その性能を制限するかどうかを制限します。
リアクターの安全における機械学習
マシン学習アルゴリズムは、反応センサーから膨大な量のデータを分析し、潜在的な安全問題のパターンを識別することができます。これらのアルゴリズムは、エスカレーションの前に異常を予測し、積極的な介入を可能にします。キー技術には、障害検知と制御の最適化のための強化学習のための監視された学習が含まれます。このような、複雑なニューラルネットワークや長期のメモリネットワークなどのディープラーニングアーキテクチャは、処理時に特に効果的です センサーのデータと空間分布(egtron、flugtron、flugtron、flugtron、flug)。
故障検出のための超視学習
監視された学習モデルは、障害や危険な条件の署名を認識するために、歴史的データに訓練されています。訓練されたら、これらのモデルは、逸脱を検出し、安全プロトコルを迅速にトリガーするために、リアルタイムデータを監視することができます。例えば、分類器は、損失防止事故の発症を識別するために訓練することができます。または、圧力、温度、および流量信号を分析することにより、蒸気発生管破裂を分析することができます。モデルの出力は、ロッドの位置を調節するために使用され、または強制的な冷却方法が確認されていない[F]を強制的に確認するために、または、テストが行われます。[F] [F] 強制的なフロー は、または、テストが実行されます。[F] [F] [F] [F] 強制的なフローは、テスト] 測定結果は、テストは、または、テストは、テストは、テストを強制的に、またはテストを強制的に、テストするかどうかを強制的に、またはテストするかどうかを強制的に、またはテストするかどうかを強制的に、またはテストするかどうかを強制的に、またはテストする[F [[F] またはテストする] またはテストする[F [[F] またはテストする] またはテストする] または[F
制御最適化のための強化学習
強化学習(RL)は、制御アルゴリズムが、シミュレーションされた環境内での試行錯誤と誤によって最適な行動を学ぶことを可能にします。 Safety-first は、制約を学習プロセスに組み入れ、システムが必要に応じて、性能上の安全を優先することを確認します。 一般的な方法は、安全限界に基づいて行動をスコアする安全批判を使用することです。 訓練中、RL エージェントは安全なエンベロープ内でのみ探索することができます。 トランスファーを横断する任意のステップは、安全基準を保ち、適切な状態を保ち、適切な状態を保ち、適切な状態に保つために、適切な作業を制限します。
学習したダイナミクスによるモデル予測制御
もう一つの有望な方向は、モデル予測制御(MPC)で機械学習を組み合わせています。固定物理ベースのモデルを使用する代わりに、ニューラルネットワークは、データから原子炉の動的を学びます。 MPCオプティマイザは、学習モデルを使用して、将来の状態を予測するたびに、制約された最適化の問題を解決します。モデルはオンラインで更新することができるので、システムは、システムが変更条件(例えば、燃料燃焼、制御ロッドウェア)に適応し、硬い安全対策を満たしながら、調整します。この方法は、両方のハイブリッド制御の理論と、両方の方法を保証します。
安全制約を学習に統合
マシン学習アルゴリズムが安全限界を尊重するということを把握するには、慎重に設計する必要があります。いくつかのフレームワークが提案されています。
- []禁忌のMarkovの決定プロセス[ - エージェントは、累積的な安全コスト(例えば、年間旅行の最大数)の制約に応じて報酬を最大化します。 溶液は、ラグランジアンメソッドまたはプライマル最適化を使用して見つけることができます。
- [シールド合成 - 別の検証モジュール、または「シールド」は、エージェントの行動を監視し、違反につながる任意のオーバーライドします。シールドは、単純化された物理モデルまたはリアクターの安全な動作封筒の正式な仕様から構築することができます。
- [:安全ベイジアン最適化 - 調整のために使用される - 点またはコントローラゲイン、ベイジアン最適化は、ガウスのプロセスとして安全機能をモデル化し、高い確率で安全である可能性があるポイントを探索します。
これらは、高忠実度シミュレータで検証され、研究者は、実際のハードウェア・イン・ループ・テストベッドに転送する作業をしています。(核科学工学、工学、2024)])。
導入課題
有望な結果にもかかわらず、原子力原子炉制御室で機械学習を展開するいくつかのハードルに直面しています。
- [ 解釈] - 規制当局は、制御システムが特定の決定を下した理由を理解している必要があります。 黒い - 箱のニューラルネットワークは説明が困難ですが、レイヤーの方向の関連伝播やShapley値などの技術は、影響力のある入力機能を識別するのに役立ちます。
- 分配シフトに対する負荷 – 原子炉条件は、徐々に漂流(例えば、燃料老化)するか、突然(例えば、バルブの粘着)を変えることができます。 モデルは、訓練中に見ていない条件の下で正確ままでなければなりません。 ドメインのランダム化と副産学的訓練は、堅牢性を改善するために調査されています。
- []検証と検証(V&V)[ - 従来のV&Vメソッド(一連のシナリオに対してテスト)は、学習されたコントローラには十分ではないかもしれません。 システムの証明の形式検証ツールは、安全な領域が、特に部分的な - 線形ニューラルネットワークのために、アクティブな研究領域であるという事実を証明します。
- [規制受諾] - 米国原子力規制委員会およびその他の当局は、デジタル安全システムのための厳格なガイドラインを持っています。 機械学習の受諾は、信頼性の高い性能のための強力な証拠ベース、明確なメトリック、およびアルゴリズムの行動の継続的な監視のためのフレームワークが必要です。
事例・試験プロジェクト
いくつかの研究グループは、原子炉制御のための安全第一機械学習の実用的な可能性を実証しました。スウェーデンのForsmark原子力発電所では、熱限界を尊重しながら再循環ポンプ速度を最適化するために学んだ補強学習エージェントは、0.5%の上昇を任意の制約を違反することなく達成しました。マサチューセッツ工科大学では、研究者は、小さなモジュラー原子炉のコアニューロンをモデル化するためにディープニューラルネットワークを使用して、その後、モデルの予測制御を適用して、動きの回転をスケジュールすることができました。 応答は、両方の応答をPIDとより速く、両方の応答を計測しました。
今後の方向性
今後、フィールドは、ステーション内の複数の原子炉を処理することができるエンドツーエンドの学習制御システム、蒸気の動的配分、および電気グリッドとの相互作用に向かって移動しています。 研究は、次のことに焦点を当てています。
- 説明可能なAI – 安全な決定を行うだけでなく、原因グラフや偽造シナリオなどの人読みやすい説明を生成するモデルを開発する。
- []不確実性定量[ -ベイジアンニューラルネットワークまたはアンサンブルメソッドを使用して、予測と推奨行動の両方に関する自信の間隔を提供します。これにより、不確実性が高いときに、制御システムが人間の介入を要求することができます。
- 学習を転送する - 一般的な原子炉シミュレータのモデルを事前トレーニングし、特定の植物のためにそれらを微調整し、サイト固有のデータ量を削減する。
- []ヒトインループシステム[ - 機械学習エージェントがアクションを提案するインターフェイスの設計、最終的な決定は、オペレータと休息します。 システムは、信頼を築くのに十分な透明性が必要です。
コンテンツ
反応制御アルゴリズムへの機械学習の統合は、安全と効率の有望な進歩を提供しています。適応技術と予測技術を活用することで、早期の障害検出のための学習、制約下での最適な制御のための強化学習、ハイブリッドMPC学習ダイナミクス-核反応器は、ますますます複雑な環境でより安全に動作させることができます。しかし、導入への道は、解釈、堅牢性、規制検証に慎重な注意が必要です。アカデミア、業界、および潜在的な安全運航者と、これらを十分に認識し、これらの安全を十分に認識することができます。