Table of Contents
Hiểu cách điều khiển tự do mô hình
Điều khiển tối ưu mô hình đại diện một sự thay đổi mô hình trong kỹ thuật điều khiển, đặc biệt là đối với các hệ thống có tính năng hoạt động cao nơi mà các mô hình truyền thống tiến tới thấp. Trong hệ thống như máy bay tự động, điều khiển robot trong môi trường không cấu trúc, hoặc tế bào sản xuất linh hoạt, có được một mô hình toán học chính xác thường không thực tế hoặc không thể. Các phương pháp không có mô hình này chỉ ra cách điều khiển trực tiếp từ dữ liệu tương tác hoặc phản thời gian thực, mà không cần thiết một mô hình rõ ràng. Điều này làm cho chúng rất hấp dẫn đối với ứng khi các ứng hệ thống thay đổi nhanh, nơi mà tính toán không chi tiết, hoặc hệ thống bị cấm.
Lợi thế chính của việc kiểm soát mô hình không có mô hình nằm trong khả năng thích nghi với động lực không rõ. Thay vì dựa vào một mô hình đã được công bố trước, người điều khiển khám phá không gian hành động trạng trạng thái và sử dụng quan sát để tăng cường hiệu suất. phương pháp này điều chỉnh dữ liệu tương ứng với khả năng cảm biến và tính toán hiện đại, cho phép tối ưu hóa thời thực trong thiết lập mà trước đây được xem là quá phức tạp cho việc kiểm soát lý thuyết truyền thống.
Công nghệ lõi trong việc kiểm soát mô hình miễn phí
Một số phương pháp khác nhau nằm dưới sự điều khiển tối ưu không có mô hình. và sự lựa chọn kỹ thuật thường tùy thuộc vào bản chất của hệ thống, nguồn tài nguyên máy tính sẵn có, và các yêu cầu hiệu suất.
Học thêm lực
Học tập thêm vào. Ý tưởng chính là tăng cường phần thưởng theo thời gian mà không cần thiết mô hình chuyển tiếp. Trong RL, một tác nhân học một chính sách tối ưu bằng cách liên tục tương tác với môi trường, nhận phần thưởng hay hình phạt cho hành động của nó. Ý tưởng chính là tăng cường phần thưởng theo thời gian mà không cần thiết một mô hình chuyển tiếp. Các cấu hình cấu hình phức tạp như Q-Net, và Q-Net works (DQN), và các phương pháp chuyển đổi như PPO (Sự cải tiến chính sách chính sách tối ưu) đã được áp dụng thành công trong việc điều khiển liên tục. Đối với các hệ thống tính năng, các diễn viên phê chuẩn tính năng hoạt động: ứng xử xử, theo định giá trị của các nhà phê chuẩn, và cách dạy tính năng hiệu quả hơn, nhưng tiến hóa tập tính năng chuyển đổi theo phép thử và tiến tiến trình chuyển đổi.
Lập trình sinh động thích nghi
Chương trình lập trình động thích nghi (ADP) là một nhóm các phương pháp mà nó cố định có khả năng đánh giá chính sách (lên chức năng giá trị tối ưu và chính sách điều khiển). Kỹ thuật AP thường dùng mạng thần kinh hoặc các chức năng ứng dụng chức năng khác để đại diện chức năng giá trị và điều khiển. Quá trình lặp bao gồm đánh giá chính sách (lên chức năng dựa trên chính sách hiện thời) và cải tiến (lên chính sách dựa trên chức năng mới). ADP có thể được thực hiện hoặc gián tiếp trong hệ thống, aero, robot và robot. A đáng chú ý là cách tiếp cận chức năng (HP, một mạng duy nhất mà không có kết quả nhận dạng chính sách, và không có hệ thống.
Thuật toán tiến hóa
Các thuật toán tiến hóa (CMA-ES) tiến hóa một phương pháp kiểm soát dân số trên các thế hệ. Tại mỗi thế hệ, các chính sách được đánh giá trên hệ thống thực tế hoặc mô phỏng, và những người biểu diễn giỏi nhất được chọn và đột biến để tạo thế hệ tiếp theo. Như là thẳng thắn để thực hiện và không yêu cầu chuyển đổi, làm cho chúng phù hợp với các hệ thống không hoạt động hoặc không hoạt động.
Những thử thách và tinh thần phấn đấu
Triển khai kiểm soát mô hình trong hệ thống năng động cao đưa ra một loạt thách thức cần phải được giải quyết để đảm bảo an toàn, ổn định và hiệu quả hoạt động. các tiểu tiết mục sau đây chi tiết các vấn đề cấp bách nhất và các nhà nghiên cứu chiến lược và kỹ sư sử dụng để vượt qua chúng.
Khả năng vững vàng và những vấn đề đáng chú ý
Các thuật toán tự do mô hình thường thiếu sự đảm bảo chính thức, đặc biệt trong giai đoạn học tập. Trong hệ thống năng động, một bộ điều khiển không ổn định có thể gây ra sự thất bại thảm khốc. Để giảm thiểu việc sử dụng kỹ thuật như tối ưu hóa mạnh mẽ (v. d., thêm các hạn chế độ mạnh vào mục tiêu học tập), sử dụng phương pháp Lyapunov để thực hiện ổn định, hoặc trong việc mô phỏng việc sắp xếp các miền ngẫu nhiên hóa trước khi triển khai hệ thống thực. Một phương pháp khác là sử dụng cách an toàn để hạn chế các hành động không gian an toàn, dần dần mở rộng kiến thức tích lũy.
Sự khai thác và khai thác mẫu
Hệ thống năng động cao thường hoạt động ở mức nhanh, hạn chế số lượng tương tác sẵn có cho việc học. Phương pháp tự do mô hình nổi tiếng là việc học mẫu. Để cải thiện hiệu suất mẫu, kỹ thuật như trải nghiệm xem xét lại (các chuyển đổi qua và sử dụng lại chúng), sử dụng mô hình kích hoạt nhiệt mô hình (dùng mô hình xấp xỉ để tạo ra các chính sách ban đầu), và việc học thiếu chính sách (học tập từ một chính sách khác). Tính năng cũng có thể được hướng dẫn bằng các tín hiệu nội tại hay học cách khởi động lại mô hình kích hoạt và tìm kiếm nơi cần thiết nhất.
Các tổ hợp thời gian thực
Các yêu cầu tính toán không mô hình- riêng biệt sử dụng mạng thần kinh sâu có thể nặng. Trong hệ thống nhúng hoặc vòng điều khiển tần số cao, các chương trình điện toán phải được hoàn thành trong vòng một phần triệu giây. Giải pháp bao gồm việc cắt tỉa mạng, định lượng, và tăng tốc phần cứng (v. d., sử dụng GPU hay FPGAs). Đối với một số ứng dụng, cấu trúc nhỏ như mạng chức năng Radal hoặc ứng dụng chức năng ứng dụng tuyến tính là đủ để đạt hiệu suất tốt trong khi gặp hạn chót. (dạy dỗ tính toán) so với một hệ thống khác: một số hệ thống có thể mô phỏng và sửa đổi nhỏ nhất các hệ thống: một số tính năng tốt và sau đó là một số tính năng nhỏ nhất.
Những phương pháp pha giống cao cấp
Để kết hợp các ưu điểm của phương pháp mô hình và không mô hình, các nhà nghiên cứu đã phát triển cấu trúc lai. Ví dụ, một thành phần dựa trên mô hình có thể tạo ra các hành động sơ bộ hoặc cung cấp một dự đoán ngắn hạn, trong khi một thành phần không có mô hình học để sửa chữa các mô hình không chính xác hoặc xử lý sự bất ngờ. Một người lai phổ biến khác là sử dụng "del-free" một mô hình được học để lên kế hoạch (v. d., tối ưu hóa chính sách dựa trên mô hình) nơi mà các mô hình được học từ dữ liệu nhưng kiểm soát tối ưu được thực hiện để giải phóng mẫu. Những phương pháp này thường mang lại hiệu quả học nhanh hơn và hiệu suất hoàn toàn miễn phí, đặc biệt khi hệ thống được biết đến các phương pháp hoạt động.
Ứng dụng quản lý kiểu mẫu tự do
Sự đa dạng của việc tiếp cận không có mô hình đã dẫn đến việc nhận nuôi họ trong nhiều ngành công nghiệp. bên dưới là những ví dụ mở rộng của ứng dụng thực tế.
Xe cộ và máy khoan tự động
Các thuật toán RL đã được sử dụng để huấn luyện các chính sách điều khiển cuối cùng từ đầu vào máy ảnh, cho phép phương tiện xử lý các tình huống không rõ ràng trong quá trình đào tạo. Quartor sử dụng khả năng kiểm soát không mô hình trong môi trường hoạt động, như bay qua rừng hoặc thích nghi với các thay đổi mà không cần tái định hình mô hình. Các nhà nghiên cứu cũng đã sử dụng AD để tối ưu hóa năng lượng trong xe điện bằng cách học tăng tốc và các mẫu xe tăng tốc.
Người máy trong môi trường không có cấu trúc
Các thuật toán robot được giao nhiệm vụ nắm bắt các vật thể lạ, lắp ráp trong điều kiện biến đổi, hoặc chuyển động trên mặt đất không phẳng sử dụng các phương pháp tự thích nghi mô hình trong thời gian thực. Các thuật toán tiến hóa đã tìm thấy thành công trong việc phát triển các mô hình gait cho rô bốt chân, trong khi RL cho phép thao tác khéo léo với cảm biến cao không gian. Trong thiết lập công nghiệp, điều khiển mô hình không có mô hình cho phép robot duy trì độ chính xác mặc dù công cụ hoặc thay đổi hình học.
Hệ thống năng lượng và năng lượng
Trong mạng lưới thông minh và vi mạch, bản chất năng động của thế hệ tái tạo và tải nhu cầu làm cho việc kiểm soát tối ưu mô hình không có mô hình. Các thuật toán như Agrithm như ADP đã được áp dụng để quản lý pin lưu trữ, năng lượng tối ưu hóa dòng điện, và ổn định tần số trong thời gian thực.
Kiểm soát tiến trình và kỹ thuật hóa học
Quá trình hóa học thường cho thấy hành vi không tuyến tính, thay đổi thời gian khó để mô hình từ các nguyên tắc đầu tiên. kiểm soát tự do mô hình đã được sử dụng cho việc kiểm soát nhiệt độ của lò phản ứng, giảm thiểu hiệu quả, và kiểm soát chất lượng. những ứng dụng này tăng khả năng học từ dữ liệu tiến trình và thích nghi với sự suy giảm chất xúc tác hoặc các biến thể dinh dưỡng.
Hướng tương lai
Các lĩnh vực điều khiển tối ưu không mô hình đang phát triển nhanh. Các đại lộ tiên đoán bao gồm sự tích hợp các tính toán không chắc chắn để đưa ra các quyết định mạnh mẽ để mô hình không có mô hình đo lường, kết hợp các tính năng ngoại tuyến và trực tuyến cho việc học tập để thích nghi lâu dài, và phát triển các bảo đảm cho sự an toàn và hội tụ trong không gian–oction. Một biên giới khác là việc sử dụng sự kiểm soát không có mô hình trong các hệ thống đa tác vụ, nơi mà nhiều bộ điều khiển tương tác và phải học tập hợp hành vi không cần liên lạc với mô hình rõ ràng. Khi sức mạnh của máy tính tiếp tục phát triển và thuật toán trở nên hiệu quả hơn, sự kiểm soát tối ưu hóa mô hình sẽ trở thành tiêu chuẩn trong hộp kỹ thuật công cụ.
Để đọc thêm, xin xem của tóm tắt của việc tự do mô hình ), bài học thêm về việc học điều khiển máy , và một cuộc khảo sát kỹ thuật lập trình linh động ).