Table of Contents
درک کنترل مدل-Free Optimal Control
کنترل بهینه مدل نشان دهنده یک تغییر پارادایم در مهندسی کنترل، به ویژه برای سیستم های بسیار پویا که در آن رویکردهای سنتی مبتنی بر مدل کوتاه می شوند.در سیستم هایی مانند هواپیماهای بدون سرنشین، دستکاری رباتیک در محیط های بدون ساختار، یا سلول های تولید انعطاف پذیر، به دست آوردن یک مدل دقیق ریاضی از پویایی گیاه اغلب غیر عملی یا غیر ممکن است.
مزیت اصلی کنترل بدون مدل در توانایی خود برای سازگاری با پویایی ناشناخته است، به جای تکیه بر یک مدل پیش فرض، کنترل کننده فضای حالت-عمل را بررسی می کند و از مشاهدات برای بهبود تدریجی عملکرد استفاده می کند.این رویکرد مبتنی بر داده به خوبی با قابلیت های مدرن سنجش و محاسباتی سازگار است، امکان بهینه سازی زمان واقعی در تنظیمات که قبلاً برای تئوری کنترل سنتی بسیار پیچیده در نظر گرفته شده بود.
تکنیک های اصلی در کنترل مدل-Free Control
چندین روش متمایز تحت چتر کنترل بهینه بدون مدل قرار می گیرند.هر کدام نقاط قوت و تجارت منحصر به فرد را ارائه می دهند و انتخاب تکنیک اغلب به ماهیت سیستم، منابع محاسباتی موجود و الزامات عملکردی بستگی دارد.
آموزش تقویت
یادگیری تقویت (RL) به عنوان یک چارچوب غالب برای کنترل بدون مدل ظهور کرده است.در RL، یک عامل یک سیاست بهینه را با تعامل مکرر با محیط، دریافت پاداش یا مجازات برای اقدامات خود، به حداکثر رساندن پاداش تجمعی در طول زمان بدون نیاز به یک مدل انتقال یاد می گیرد.
برنامه نویسی دینامیک Adaptive Dynamic Programming
برنامه نویسی پویا تطبیقی (ADP) یک کلاس از روش هایی است که به طور غریزی به عملکرد ارزش مطلوب و سیاست کنترل آن نزدیک است. تکنیک های ADP اغلب از شبکه های عصبی یا سایر تقریبی کننده های تابع برای نشان دادن عملکرد ارزش و کنترل کننده سیستم شناسایی یکپارچه استفاده می کنند (از طریق استفاده از تابع ارزش بر اساس سیاست فعلی) و بهبود سیاست قابل توجه (از طریق سیاست گذاری جدید که در یک تابع سیستم شناسایی آنلاین استفاده می شود).
الگوریتم های تکاملی
الگوریتم های تکاملی (EAs) یک رویکرد مبتنی بر جمعیت را به تکنیک های بهینه سازی بدون مدل ارائه می دهند. تکنیک هایی مانند الگوریتم های ژنتیکی، تکامل تفاوت و استراتژی تکامل انطباق ماتریس تخمدان (CMA-ES) یک مجموعه از سیاست های کنترل کاندید را بر نسل ها تکامل می دهد، سیاست ها در سیستم واقعی یا شبیه ساز ارزیابی می شوند و بهترین اجرا کنندگان انتخاب شده و جهش یافته اند تا بتوانند مشکلات چشم انداز بالا را ایجاد کنند و یا سیستم های ساده را برای آنها را متوقف کنند.
چالش های اجرایی و استراتژی های پذیرش
استقرار کنترل بدون مدل در سیستم های بسیار پویا مجموعه ای از چالش هایی را ارائه می دهد که باید برای اطمینان از عملیات ایمن، پایدار و کارآمد مورد توجه قرار گیرد. زیر بخش ها بیشترین مسائل را به طور دقیق و استراتژی ها و مهندسان برای غلبه بر آنها استفاده می کنند.
ثبات و مسائل متقابل
الگوریتم های بدون مدل اغلب فاقد تضمین های ثبات رسمی هستند، به ویژه در طول فاز یادگیری در سیستم های پویا، یک کنترل کننده ناپایدار می تواند باعث خرابی های فاجعه بار شود.برای کاهش این، تمرین کنندگان از تکنیک هایی مانند بهینه سازی قوی (به عنوان مثال، اضافه کردن محدودیت های قوی برای هدف یادگیری)، استفاده از روش های مبتنی بر Lyapunov برای اجرای ثبات، یا آموزش در شبیه سازی دامنه با استفاده از استراتژی های اکتشاف واقعی به تدریج محدود کردن فعالیت های امن است که به منظور محدود کردن محیط زیست است.
قابلیت های نمونه و اکتشاف
سیستم های بسیار پویا اغلب در مقیاس های سریع کار می کنند، محدود کردن تعداد تعاملات موجود برای یادگیری. روش های بدون مدل به طور بدنام نمونه ای است که باعث بهبود کارایی نمونه می شود، تکنیک هایی مانند تجربه مجدد (راهنمایی انتقال گذشته و استفاده مجدد از آنها)، شروع گرم (استفاده از یک مدل تقریبی برای تولید سیاست های اولیه)، و یادگیری سیاست (از طریق عدم اطمینان حاصل می شود) و همچنین می تواند با استفاده از سیگنال های مختلف هدایت شده و یا استفاده از آن، استفاده از یک سیاست های اکتشاف، استفاده از انگیزه های مختلف از آن را هدایت کند.
زمان واقعی قطع عضو
خواسته های محاسباتی الگوریتم های بدون مدل - به ویژه کسانی که از شبکه های عصبی عمیق استفاده می کنند - می توانند سنگین باشند.در سیستم های جاسازی شده یا حلقه های کنترل فرکانس بالا، استنتاج باید در میکرو ثانیه ها تکمیل شود، راه حل های شبکه شامل تجزیه و تحلیل شبکه ها، و شتاب سخت افزار (به عنوان مثال، استفاده از GPU ها یا FPGA ها) برای برخی از برنامه ها، معماری سبک مانند عملکرد مبتنی بر پردازش خطی یا تنظیم دقیق (در زمان دقیق) در زمان دقیق دیگر) در زمان دقیق است.
Advanced Hybrid Approaches
برای ترکیب نقاط قوت روش های مبتنی بر مدل و بدون مدل، محققان معماری هیبریدی را توسعه داده اند.به عنوان مثال، یک جزء مبتنی بر مدل می تواند اقدامات کنترل اولیه را ایجاد کند یا افق پیش بینی کوتاه مدت را ارائه دهد، در حالی که یک جزء بدون مدل یاد می گیرد برای اصلاح برای ناکارآمدی مدل و یا برخورد با اختلالات پیش بینی نشده است.
برنامه های کنترل مدل-Free Optimal Control
تطبیق رویکرد های بدون مدل منجر به پذیرش آنها در صنایع مختلف شده است.در زیر نمونه های گسترده ای از برنامه های دنیای واقعی است.
وسایل نقلیه مستقل و هواپیماهای بدون سرنشین
وسایل نقلیه مستقل که در ترافیک غیر قابل پیش بینی، تغییر آب و هوا یا در زمین خشن به طور گسترده ای از کنترل بدون مدل بهره مند شده اند. الگوریتم های RL برای آموزش سیاست های رانندگی در نهایت به پایان از ورودی دوربین استفاده شده است، اجازه می دهد تا وسایل نقلیه به طور واضح در طول آموزش با استفاده از کنترل بدون مدل در محیط های پویا، مانند پرواز از طریق جنگل ها یا سازگاری با تغییرات سرعت استفاده از دستگاه های انرژی، با سرعت استفاده از سرعت استفاده از سرعت مصرف و سرعت استفاده از دستگاه های الکتریکی نیز ثابت شده است.
رباتیک در محیط های غیر ساختاری
دستکاری های روباتیک با درک اشیاء ناشناخته، مونتاژ در شرایط متغیر یا locomotion در زمینه ناهموار استفاده از روش های بدون مدل برای انطباق در زمان واقعی کار می کنند. الگوریتم های تکاملی موفق در الگوهای در حال تحول برای ربات های پا افتاده پیدا کرده اند، در حالی که RL امکان دستکاری پیچیده با سنجش بالا لمسی را فراهم می کند.
سیستم های انرژی و قدرت
در شبکه های هوشمند و میکروشبکه ها، ماهیت پویا از نسل های تجدید پذیر و تقاضا بار باعث می شود تا الگوریتم های بدون مدل کنترل جذاب باشند. الگوریتم هایی مانند ADP برای مدیریت ذخیره سازی باتری، بهینه سازی جریان برق و تثبیت فرکانس در زمان واقعی بهره مند شده اند.
کنترل فرآیند و مهندسی شیمی
فرآیندهای شیمیایی اغلب رفتارهای غیر خطی، زمان متغیر را نشان می دهند که از اصول اولیه مدل سازی سخت است.کنترل بدون مدل برای کنترل دما دسته ای، بهینه سازی ستون تقطیر و کنترل کیفیت پلیمر استفاده می شود.این برنامه ها توانایی روش های بدون مدل برای یادگیری از داده ها و انطباق با کاتالیزور یا تغییرات تغذیه را به کار می برند.
مسیر های آینده
زمینه کنترل بهینه مدل به سرعت در حال تحول است.راه های متقاعد کننده شامل ادغام عدم اطمینان اندازه گیری برای تصمیم گیری قوی به تقریب بدون مدل، ترکیب یادگیری آنلاین و آنلاین برای سازگاری مادام العمر، و توسعه تضمین های نظری برای ایمنی و همگرایی در فضاهای مداوم - عمل دیگر مرز استفاده از کنترل مدل بدون مدل در سیستم های چند عامل است، که در آن ابزار چندگانه باید بدون نظارت دقیق تر و دقیق تر به عنوان یک مدل کنترل دقیق تر به عنوان ادامه می دهد.
برای مطالعه بیشتر، وکیپیا را از کنترل مدل بدون مدل ، یک مقاله تحقیق در مورد یادگیری تقویت کننده برای کنترل هواپیماهای بدون سرنشین و a بررسی از تکنیک های برنامه نویسی پویا [FLT5:5:5].