Sự phát triển của các thuật toán điều khiển lò phản ứng thứ nhất là một lĩnh vực quan trọng của nghiên cứu về kỹ thuật hạt nhân. với sự ra đời của máy học tập, những khả năng mới đã được phát triển để tăng cường sự an toàn và hiệu quả của lò phản ứng hạt nhân. bài báo này khám phá cách máy học kỹ thuật đang được kết hợp vào hệ thống kiểm soát lò phản ứng để ưu tiên sự an toàn trong khi duy trì sự an toàn tối ưu hóa. bằng cách kết hợp những mô hình dựa trên sự thích nghi, sự điều khiển dữ liệu với sự hạn chế an toàn nghiêm ngặt, các nhà nghiên cứu đang thiết kế thiết kế chiến lược có thể dự đoán lỗi, năng lượng tối ưu hóa năng lượng, và phản ứng lại với sự kiện bất ngờ hiệu quả hơn so với hệ thống luật truyền thống truyền thống truyền thống truyền thống truyền thống truyền thống truyền thống.

Văn cảnh lịch sử: Từ Analog đến kiểm soát Intelligent

Điều khiển lò phản ứng hạt nhân đã tiến hóa từ các điều chỉnh bằng tay và các vòng phản hồi tương tự đến hệ thống số theo dõi hàng ngàn tham số trong thời gian thực. Các thuật toán điều khiển sớm phụ thuộc vào khả năng điều khiển tương ứng- tiêu chuẩn và các thiết lập điểm điện tử. Các hệ thống này hoạt động mạnh mẽ nhưng thiếu khả năng xử lý các điều kiện nhất thời vượt quá cơ sở thiết kế của chúng. Khi các lò phản ứng kết hợp các cảm biến và tính toán, máy học đưa ra một đường dẫn từ khả năng dự đoán phản ứng. Cơ quan Năng lượng nguyên tử (EA) đã nhận ra tiềm năng của các công cụ kỹ thuật số và AI, bao gồm cả sự an toàn [F] và sự an toàn [F] [F] [F].A] [F].L].L]

Cần có sự an toàn cốt lõi trong việc kiểm soát phản ứng

Bất kỳ thuật toán điều khiển cho một lò phản ứng hạt nhân phải thỏa mãn các tiêu chuẩn an toàn nghiêm ngặt: nó phải bảo trì lò phản ứng trong giới hạn hoạt động an toàn, ngăn ngừa sự hư hại để đóng băng nhiên liệu, và đảm bảo sự không dùng được khi cần thiết. Các thuật toán truyền thống được thiết kế với lề bảo vệ. Tuy nhiên, việc học tập không chắc chắn vì mô hình học từ dữ liệu và có thể hành động bất ngờ bên ngoài việc đào tạo. Một phương pháp an toàn đầu tiên được xác định bởi việc đưa ra các địa chỉ này vào tiến trình học - xác định rằng hệ thống không bao giờ có thể vi phạm các hành động có thể vi an toàn, ngay cả nếu hiệu suất đó sẽ cải thiện. Điều này thường đạt được thông qua việc tăng cường việc học tập, nơi mà thuật toán được xác định và để lại cho nó được định.

Máy học cách phản ứng an toàn

Các thuật toán học tập có thể phân tích một lượng lớn dữ liệu từ các bộ nhạy lò phản ứng để xác định các mẫu ảnh của các vấn đề an toàn tiềm năng. Các thuật toán này có thể dự đoán những điều dị thường trước khi chúng tăng trưởng, cho phép sự can thiệp hoạt động. kỹ thuật khóa bao gồm việc giám sát việc học phát hiện lỗi và tăng cường việc học để tối ưu hóa. Việc học cấu trúc sâu như mạng thần kinh hình thành tiến hóa và mạng bộ nhớ ngắn, đặc biệt hiệu quả trong thời gian xử lý dữ liệu cảm biến và phân phối không gian (v. d., bản đồ sóng nơ-ron).

Được giám sát để biết lỗi

Một khi được huấn luyện để nhận diện các lỗi trong khi học tập, các mô hình này có thể giám sát dữ liệu thời gian thực để phát hiện sự lệch hướng và khởi động các giao thức an toàn. Chẳng hạn, bộ phân loại có thể được huấn luyện để nhận diện sự mất mát về chất làm mát của ống hơi nước hoặc một máy phát điện bị vỡ bằng cách phân tích áp suất, nhiệt độ và tốc độ lưu thông. Kết quả của mô hình được dùng để điều chỉnh vị trí điều khiển hoặc khởi động hệ thống làm mát khẩn cấp. Cuộc nghiên cứu cho thấy rằng các phương pháp điều chỉnh nhanh (v. d. jw, hoặc tăng cường độ chuyển động ngẫu nhiên) đạt được độ chính xác cao từ các dữ liệu giả lập nhiễu từ các nhà máy phát âm [FK].

Học cách kiểm soát việc làm báp têm

Tăng cường việc học tập (RL) cho phép việc điều khiển các thuật toán điều khiển hành động tối ưu thông qua thử và lỗi trong môi trường đã mô phỏng. An toàn đầu tiên trong tiến trình kiểm soát sự ràng buộc vào quá trình học tập, đảm bảo hệ thống ưu tiên an toàn trên hiệu suất khi cần thiết. Một phương pháp phổ biến là sử dụng một nhà phê bình an toàn có thể hoạt động dựa vào các hành động dựa trên các ranh giới an toàn của họ. Trong khi đào tạo, tác nhân RL được phép khám phá chỉ trong một phong bì an toàn; bất kỳ bước nào qua một mức độ bảo mật kết quả trong một hình phạt và đặt lại an toàn đến một trạng thái an toàn. Kỹ thuật này đã được chứng minh thành công trên các mô hình đơn giản hóa, nơi mà tác nhân học cách quản lý năng lượng trong khi giữ nhiệt độ không gian hẹp.

Kiểm soát mô hình dự đoán với động lực học

Một hướng khác hứa hẹn là kết hợp máy học với việc kiểm soát dự đoán (MPC). Thay vì sử dụng mô hình vật lý cố định dựa trên cơ sở vật lý, một mạng thần kinh học học động lực từ dữ liệu. Một bộ tối ưu MPC sau đó giải quyết một vấn đề tối ưu hóa tại mỗi bước, bằng cách sử dụng mô hình học để dự đoán các trạng thái tương lai. Vì mô hình có thể được cập nhật trực tuyến, hệ thống thích nghi để thay đổi điều kiện (v. d. nhiên liệu đốt cháy, kiểm soát cơ chế mặc) trong khi áp dụng an toàn khó khăn. Cách tiếp cận này kết hợp tốt nhất của cả hai thế giới: bảo đảm sự an toàn của lý thuyết truyền thống và tính linh hoạt của máy học.

Kết hợp các hội viên về sự an toàn vào việc học hỏi

Để bảo vệ máy học thuật toán tôn trọng giới hạn an toàn yêu cầu thiết kế cẩn thận. một số khung đã được đề xuất:

  • Conslyed Markov Conscries ) – Tác vụ tối đa hóa phần thưởng là do hạn chế về mức an toàn tích lũy (v. d. số lần di chuyển tối đa mỗi năm). Giải pháp có thể tìm thấy bằng phương pháp Lagrin hoặc tối ưu hóa nền tảng của phương pháp Lagrangian.
  • Sự tổng hợp ) – Một mô-đun phân biệt, hoặc “sield, Tổng hợp hành động của tác nhân và ghi đè lên bất cứ cái gì dẫn đến sự vi phạm.
  • Sự tối ưu hóa ) – Dùng để điều chỉnh thiết lập điểm hay điểm điều khiển, Bayesian tối ưu hóa chức năng an toàn như một tiến trình kiểu Gaussian và chỉ khám phá các điểm có khả năng an toàn với xác suất cao.

Những phương pháp này đã được xác nhận trong các giả lập cao cấp về tính trung lập, và các nhà nghiên cứu đang tiến hành chuyển chúng sang các dụng cụ thực tế của phần cứng [Nuofuth Science and Ecternity, 2024] .

Những thử thách trong việc khích lệ

Mặc dù kết quả hứa hẹn, triển khai máy học tập trong phòng điều khiển lò phản ứng hạt nhân đối mặt với nhiều chướng ngại vật:

  • Khả năng truy cập ) – Bộ điều khiển yêu cầu người điều khiển hiểu tại sao hệ thống điều khiển lại có một quyết định. Mạng thần kinh hộp đen khó giải thích, nhưng các kỹ thuật như sự truyền bá qua lớp và giá trị Shapley có thể giúp nhận diện các tính năng đầu vào có ảnh hưởng.
  • Sự chuyển dịch để phân phối ) – Điều kiện phản ứng có thể trôi dần dần (v. d., tăng trưởng nhiên liệu) hoặc thay đổi đột ngột (v. d. một cái van gắn vào). Mô hình phải được giữ chính xác trong điều kiện không thấy trong quá trình đào tạo. Việc ngẫu nhiên và đào tạo đối kháng đang được điều tra để tăng cường độ mạnh.
  • Sự xác thực và xác thực [V&V] ) – Phương pháp truyền thống V&V có thể không đủ cho những người điều khiển học tập. Các công cụ xác thực không bao giờ để lại một vùng an toàn là một khu vực nghiên cứu, đặc biệt đối với mạng thần kinh kiểu mẫu.
  • Chấp nhận ) – Ủy ban Điều phối hạt nhân Hoa Kỳ và các nhà cầm quyền khác có những hướng dẫn nghiêm ngặt cho hệ thống an toàn số.

Nghiên cứu và dự án phi công

Một số nhóm nghiên cứu đã chứng minh tiềm năng thực tế của máy tính an toàn đầu tiên học cách kiểm soát lò phản ứng. Tại Viện Công nghệ Massachusetts, các nhà nghiên cứu đã sử dụng một mạng lưới thần kinh sâu để mô phỏng hạt nhân của một lò phản ứng đa chiều nhỏ, sau đó áp dụng khả năng kiểm soát thời gian vận động trong quá trình nạp đạn. Trong cả hai trường hợp, người điều khiển học được huấn luyện chống lại sự kiểm soát thông thường và nhanh hơn.

Hướng tương lai

Nhìn về phía trước, cánh đồng đang hướng về phía cuối đường ống dẫn điện, hệ thống điều khiển học được có thể xử lý nhiều lò phản ứng trong một trạm, sự định vị hơi nước và tương tác với mạng điện.

  • Giải thích được Al ) – phát triển mô hình không những đưa ra quyết định an toàn mà còn tạo ra những lời giải thích dễ đọc của con người, như đồ thị hình nhân hoặc kịch bản đối chứng.
  • Không chắc chắn ) – dùng mạng thần kinh Bayesian hoặc các phương pháp xác định cách thức riêng để cung cấp khoảng cách tự tin về cả dự đoán lẫn hành động khuyến khích. Tính năng này cho phép hệ thống điều khiển yêu cầu sự can thiệp của con người khi sự bấp bênh là cao.
  • Transfer học ) – Pre tKmated models trên các lò phản ứng chung và fine tlungting chúng cho các cây cụ thể, giảm lượng dữ liệu đặc trưng cần thiết.
  • Hệ thống vòng tròn – Thiết kế giao diện nơi mà các đại lý học máy gợi ý hành động nhưng quyết định cuối cùng là với một nhà điều hành. Hệ thống phải trong suốt đủ để xây dựng lòng tin.

Kết luận

Sự kết hợp của máy học tập vào các thuật toán điều khiển lò phản ứng mang lại sự tiến bộ đầy hứa hẹn trong sự an toàn và hiệu quả. bằng cách sử dụng các kỹ thuật thích nghi và dự đoán - giám sát kỹ thuật phát hiện lỗi sớm, tăng cường việc học để kiểm soát tối ưu dưới sự hạn chế, và kết hợp MPC học được các động lực học - lò phản ứng hạt nhân có thể hoạt động an toàn hơn trong môi trường ngày càng phức tạp. tuy nhiên, đường dẫn đến việc phát triển đòi hỏi sự chú ý để giải thích kỹ lưỡng, sự mạnh mẽ, và hợp tác điều khiển. Tiếp tục nghiên cứu và hợp tác giữa các học viên, công nghệ, và an toàn là thiết yếu tố cần thiết để nhận ra tiềm năng của những công nghệ này. đầu tiên, có thể học tập trung tâm trí óc có thể trở thành một phòng điều khiển, giúp điều khiển và điều khiển hoạt động cơ thể điều khiển hoạt động.