मॉडल-फ्री ऑप्टिमल कंट्रोल को समझना

मॉडल-मुक्त इष्टतम नियंत्रण नियंत्रण इंजीनियरिंग में एक प्रतिमान बदलाव का प्रतिनिधित्व करता है, विशेष रूप से अत्यधिक गतिशील प्रणालियों के लिए जहां पारंपरिक मॉडल-आधारित दृष्टिकोण कम हो जाते हैं। सिस्टम में जैसे स्वायत्त ड्रोन, असंरचनात्मक वातावरण में रोबोटिक मैनिपुलेटर, या लचीली विनिर्माण कोशिकाएं, जो प्लांट गतिशीलता का एक सटीक गणितीय मॉडल प्राप्त करना अक्सर अव्यवहारिक या असंभव है। मॉडल-मुक्त तरीके सीधे संपर्क डेटा या वास्तविक समय में प्रतिक्रिया से इष्टतम नियंत्रण नीतियों को सीखकर, बिना किसी स्पष्ट प्रणाली मॉडल की आवश्यकता के इसे बेहद आकर्षक बनाती हैं। इससे उन्हें उन अनुप्रयोगों के लिए बेहद आकर्षक बनाती है जहां सिस्टम पैरामीटर तेजी से बदल जाते हैं, जहां गैर-रेखीयता प्रभुत्व होती है, या जहां सिस्टम पहचान की लागत निषेधात्मक है।

मॉडल-मुक्त नियंत्रण का मुख्य लाभ अज्ञात गतिशीलता के अनुकूल होने की क्षमता में निहित है। एक पूर्वनिर्मित मॉडल पर भरोसा करने के बजाय, नियंत्रक राज्य-एक्शन स्पेस की पड़ताल करता है और प्रदर्शन को बढ़ाने के लिए अवलोकन का उपयोग करता है। यह डेटा संचालित दृष्टिकोण आधुनिक संवेदन और कंप्यूटिंग क्षमताओं के साथ अच्छी तरह से संरेखित करता है, जो पहले पारंपरिक नियंत्रण सिद्धांत के लिए बहुत जटिल माना जाता था।

मॉडल-फ्री कंट्रोल में कोर तकनीक

कई विशिष्ट पद्धतियां मॉडल-मुक्त इष्टतम नियंत्रण की छतरी में आती हैं। प्रत्येक अद्वितीय शक्तियां और व्यापार-बंद प्रदान करता है, और तकनीक का विकल्प अक्सर सिस्टम की प्रकृति, उपलब्ध कम्प्यूटेशनल संसाधन और प्रदर्शन आवश्यकताओं पर निर्भर करता है।

सुदृढ़ीकरण शिक्षा

सुदृढीकरण सीखने (आरएल) मॉडल-मुक्त नियंत्रण के लिए एक प्रमुख ढांचा के रूप में उभरा है। आरएल में, एक एजेंट पर्यावरण के साथ बार-बार बातचीत करके इष्टतम नीति सीखता है, अपने कार्यों के लिए पुरस्कार या दंड प्राप्त करता है। महत्वपूर्ण विचार एक संक्रमण मॉडल की आवश्यकता के बिना समय के साथ संचयी इनाम को अधिकतम करना है। एल्गोरिथ्म जैसे क्यू-लर्निंग, डीप क्यू-नेटवर्क्स (डीक्यूएन) और पीपीओ (प्रोक्सिमल पॉलिसी ऑप्टिमाइज़ेशन) जैसे नीतिगत तरीकों को सफलतापूर्वक नियंत्रित करने के लिए लागू किया गया है। अत्यधिक गतिशील प्रणालियों के लिए, अभिनेता-critic आर्किटेक्चर विशेष रूप से प्रभावी हैं: अभिनेता नियंत्रण को नियंत्रित करने के लिए मार्गदर्शन करता है, जबकि एक अनुश्रित व्यवहार की सीमा को कम करता है।

अनुकूली गतिशील प्रोग्रामिंग

अनुकूली गतिशील प्रोग्रामिंग (ADP) उन तरीकों का एक वर्ग है जो कि इष्टतम मूल्य समारोह और नियंत्रण नीति को अनुमान लगाते हैं। ADP तकनीक अक्सर मूल्य समारोह और नियंत्रक का प्रतिनिधित्व करने के लिए तंत्रिका नेटवर्क या अन्य फ़ंक्शन लगभगियों का उपयोग करती है। यह प्रक्रिया पॉलिसी मूल्यांकन (वर्तमान नीति के आधार पर मूल्य समारोह) और नीति सुधार (नए मूल्य समारोह के आधार पर नीतिगत सुधार) शामिल है। ADP को ऑनलाइन या ऑफलाइन लागू किया जा सकता है और इसका उपयोग पावर सिस्टम, एयरोस्पेस और रोबोटिक्स में किया जा सकता है। एक उल्लेखनीय संस्करण है कि हेरिस्टिक गतिशील प्रोग्रामिंग (HDP) दृष्टिकोण है, जो एक एकल आलोचक नेटवर्क और एक पूर्ववर्ती प्रदर्शन प्रणाली के लिए एक अभिनेता नेटवर्क का उपयोग करता है।

विकासवादी अल्गोरिथम

विकासवादी एल्गोरिदम (EAs) मॉडल-मुक्त अनुकूलन के लिए एक जनसंख्या आधारित दृष्टिकोण प्रदान करते हैं। आनुवंशिक एल्गोरिदम, अंतर विकास और समीकरण मैट्रिक्स अनुकूलन विकास रणनीति (CMA-ES) जैसी तकनीकें पीढ़ी पर उम्मीदवार नियंत्रण नीतियों का एक सेट विकसित करती हैं। प्रत्येक पीढ़ी में, नीतियों का मूल्यांकन वास्तविक प्रणाली या एक सिम्युलेटर पर किया जाता है, और सबसे अच्छा कलाकारों को अगली पीढ़ी के परिदृश्य में जहां महत्वपूर्ण घटनाओं की गारंटी होती है, वहां वैश्विक स्तर पर निगरानी रखने के लिए सरल हैं और उन्हें निष्क्रिय गतिशीलता या गैर-चिकनी लागत कार्यों के साथ प्रणालियों के लिए उपयुक्त बनाती हैं। जबकि आम तौर पर उच्च आयामी खोज के लिए आर एल से धीमी गति से, जहां वे वैश्विक परिदृश्य की लागत को बाहर निकालते हैं।

कार्यान्वयन चुनौतियां और शमन रणनीतियाँ

अत्यधिक गतिशील प्रणालियों में मॉडल-मुक्त नियंत्रण को तैनात करने से उन चुनौतियों का एक सेट प्रस्तुत होता है जिन्हें सुरक्षित, स्थिर और कुशल संचालन सुनिश्चित करने के लिए संबोधित किया जाना चाहिए। निम्नलिखित उपधाराएं सबसे अधिक दबाने वाले मुद्दों और रणनीतियों के शोधकर्ताओं और इंजीनियरों को उन्हें दूर करने के लिए उपयोग करते हैं।

स्थिरता और अभिसरण मुद्दे

मॉडल-मुक्त एल्गोरिदम में अक्सर औपचारिक स्थिरता की गारंटी होती है, खासकर सीखने के चरण के दौरान। गतिशील प्रणालियों में, एक अस्थिर नियंत्रक catastrophic विफलताओं का कारण बन सकता है। इसे कम करने के लिए, चिकित्सक मजबूत अनुकूलन (जैसे, सीखने के उद्देश्य के लिए मजबूती बाधाओं को जोड़ने), वास्तविक प्रणाली पर तैनात होने से पहले डोमेन यादृच्छिकीकरण के साथ सिमुलेशन में स्थिरता को लागू करने, या प्रशिक्षण के लिए Lyapunov-आधारित तरीकों को नियोजित करते हैं। एक अन्य दृष्टिकोण सुरक्षित अन्वेषण रणनीतियों का उपयोग करना है जो ज्ञात सुरक्षित क्षेत्रों में कार्रवाई स्थान को बाधित करते हैं, धीरे-धीरे ज्ञान के रूप में विस्तार करते हैं।

नमूना दक्षता और अन्वेषण

अत्यधिक गतिशील सिस्टम अक्सर तेजी से समय पर काम करते हैं, सीखने के लिए उपलब्ध बातचीत की संख्या को सीमित करते हैं। मॉडल-मुक्त तरीके न केवल नमूना-hungry हैं। नमूना दक्षता में सुधार करने के लिए, अनुभव पुनः प्रदर्शन (पिछले संक्रमणों को बहाल करना और उन्हें फिर से उपयोग करना), मॉडल आधारित वार्म-स्टार्टिंग (प्रारंभिक नीतियों को उत्पन्न करने के लिए लगभग मॉडल का उपयोग करना), और ऑफ-पॉलिसी लर्निंग (एक अलग नीति द्वारा उत्पन्न डेटा से सीखना) नियोजित हैं। अन्वेषण को आंतरिक प्रेरणा संकेतों का उपयोग करके या अनिश्चितता को मापने के लिए मॉडलों के एक विनम्र सीखने और अन्वेषण को सीखने के लिए भी निर्देशित किया जा सकता है जहां यह सबसे अधिक आवश्यक है।

रियल टाइम कम्प्यूटेशन कंस्ट्रक्शन

मॉडल-मुक्त एल्गोरिदम की कम्प्यूटेशनल मांग-विशेष रूप से उन गहरे तंत्रिका नेटवर्क का उपयोग करते हैं- भारी हो सकते हैं एम्बेडेड सिस्टम या उच्च आवृत्ति नियंत्रण लूप में, माइक्रोसेकेंड के भीतर अनुमान पूरा किया जाना चाहिए। समाधान में नेटवर्क प्रूनिंग, क्वांटाइज़ेशन और हार्डवेयर त्वरण (जैसे GPUs या FPGAs का उपयोग करते हुए) शामिल हैं। कुछ अनुप्रयोगों के लिए, हल्के आर्किटेक्चर जैसे रेडियल आधार फ़ंक्शन नेटवर्क या रैखिक कार्य लगभग वास्तविक समय की समय की समय सीमा को पूरा करते समय अच्छा प्रदर्शन हासिल करने के लिए पर्याप्त हैं। ऑफलाइन कम्प्यूटेशन (प्रशिक्षण) बनाम ऑनलाइन अनुकूलन एक अन्य व्यापार-बंद है: कुछ सिस्टम सिमुलेशन में पूर्व-प्रशिक्षण नीतियां और फिर से ऑनलाइन समायोजन के साथ कर सकते हैं।

उन्नत हाइब्रिड दृष्टिकोण

मॉडल आधारित और मॉडल-मुक्त तरीकों की ताकत को जोड़ने के लिए, शोधकर्ताओं ने हाइब्रिड आर्किटेक्चर विकसित किया है। उदाहरण के लिए, एक मॉडल-आधारित घटक प्रारंभिक नियंत्रण क्रिया उत्पन्न कर सकता है या एक अल्पकालिक भविष्यवाणी क्षितिज प्रदान कर सकता है, जबकि एक मॉडल-मुक्त घटक मॉडल अशुद्धियों के लिए सही करना सीखता है या अप्रत्याशित गड़बड़ी को संभालता है। एक अन्य लोकप्रिय हाइब्रिड योजना के लिए एक सीखा मॉडल का "मॉडल-फ्री" उपयोग है (उदाहरण के लिए, मॉडल-आधारित नीति अनुकूलन) जहां मॉडल डेटा से सीखा जाता है लेकिन नियंत्रक अनुकूलन नमूना-मुक्त किया जाता है। ये दृष्टिकोण अक्सर शुद्ध रूप से मॉडल-मुक्त तरीकों की तुलना में तेजी से सीखने और बेहतर अंतिम प्रदर्शन पैदा करते हैं, खासकर जब सिस्टम गतिशीलता आंशिक रूप से ज्ञात होती है।

मॉडल-फ्री ऑप्टिमल कंट्रोल के अनुप्रयोग

मॉडल-मुक्त दृष्टिकोण की बहुमुखी प्रतिभा ने कई उद्योगों में अपना गोद लेने का नेतृत्व किया है। नीचे वास्तविक दुनिया के अनुप्रयोगों के विस्तृत उदाहरण हैं।

स्वायत्त वाहन और ड्रोन

अप्रत्याशित यातायात में काम करने वाले स्वायत्त वाहन, मौसम बदलने या किसी क्षेत्र में मॉडल-मुक्त नियंत्रण से बहुत लाभ उठाते हैं। आर एल एल्गोरिदम का उपयोग कैमरा इनपुट से अंत तक चलने वाली ड्राइविंग नीतियों को प्रशिक्षित करने के लिए किया गया है, जिससे वाहनों को प्रशिक्षण के दौरान स्पष्ट रूप से सामना नहीं होने वाली स्थितियों को संभालने की अनुमति मिलती है। मॉडल-मुक्त नियंत्रण का उपयोग करने वाले क्वाड्रोटर ने गतिशील वातावरण में उग्रता का प्रदर्शन किया है, जैसे कि जंगलों के माध्यम से उड़ान या मॉडल पुनरावर्तन के बिना पेलोड परिवर्तनों के अनुकूल। शोधकर्ताओं ने भी एडीपी का उपयोग किया है ताकि कुशल त्वरण और ब्रेकिंग पैटर्न सीखकर बिजली वाहनों में ऊर्जा खपत को अनुकूलित किया जा सके।

असंरचनात्मक वातावरण में रोबोटिक्स

रोबोटिक मैनिपुलेटर्स ने अज्ञात वस्तुओं को समझने, परिवर्तनीय स्थितियों में असेंबली, या वास्तविक समय में अनुकूलित करने के लिए असमान जमीन उपयोग मॉडल-मुक्त तरीकों पर लोकोमोशन के साथ काम किया। विकासवादी एल्गोरिदम ने लेगेड रोबोट के लिए गेट पैटर्न विकसित करने में सफलता प्राप्त की है, जबकि आर एल उच्च-आयामी स्पर्श संवेदन के साथ डेक्सटरस हेरफेर को सक्षम बनाता है। औद्योगिक सेटिंग्स में, मॉडल-फ्री कंट्रोल रोबोट को आंशिक ज्यामिति में उपकरण पहनने या परिवर्तन के बावजूद सटीक बनाए रखने की अनुमति देता है।

ऊर्जा और ऊर्जा प्रणालियों

स्मार्ट ग्रिड और माइक्रोग्रिड में, अक्षय पीढ़ी और लोड की मांग की गतिशील प्रकृति मॉडल-मुक्त इष्टतम नियंत्रण आकर्षक बनाती है। ADP जैसे अल्गोरिथम्स को बैटरी स्टोरेज का प्रबंधन करने, बिजली प्रवाह को अनुकूलित करने और वास्तविक समय में आवृत्ति को स्थिर करने के लिए लागू किया गया है। पवन टरबाइन पिच नियंत्रण और बिल्डिंग HVAC सिस्टम अनुकूली मॉडल-मुक्त रणनीतियों से भी लाभ उठाते हैं जो विस्तृत थर्मल या वायुगतिकीय मॉडल की आवश्यकता के बिना ऊर्जा दक्षता में सुधार करते हैं।

प्रक्रिया नियंत्रण और रासायनिक इंजीनियरिंग

रासायनिक प्रक्रियाएं अक्सर गैर-रैखिक, समय-समय पर व्यवहार प्रदर्शित करती हैं जो पहले सिद्धांतों से मॉडलिंग करना मुश्किल है। बैच रिएक्टरर तापमान नियंत्रण, आसवन स्तंभ अनुकूलन और बहुलक गुणवत्ता नियंत्रण के लिए मॉडल-मुक्त नियंत्रण का उपयोग किया गया है। ये अनुप्रयोग प्रक्रिया डेटा से सीखने और उत्प्रेरक निष्क्रियता या फीडस्टॉक विविधताओं के अनुकूल मॉडल-मुक्त तरीकों की क्षमता का लाभ उठाते हैं।

भविष्य निर्देश

मॉडल-मुक्त इष्टतम नियंत्रण का क्षेत्र तेजी से विकसित हो रहा है। विकसित करने वाले एवेन्यू में मॉडल-मुक्त अनुमानों के लिए मजबूत निर्णय लेने के लिए अनिश्चितता मात्रा को एकीकृत करना शामिल है, जीवन भर अनुकूलन के लिए ऑफ़लाइन और ऑनलाइन सीखने का संयोजन करना और निरंतर राज्य-क्रिया स्थान में सुरक्षा और अभिसरण के लिए सैद्धांतिक गारंटी विकसित करना। एक अन्य फ्रंटियर बहु-एजेंट सिस्टम में मॉडल-मुक्त नियंत्रण का उपयोग है, जहां एकाधिक नियंत्रकों ने एक्सप्लिकिट मॉडल के संचार के बिना समन्वित व्यवहार सीखना चाहिए। चूंकि कम्प्यूटेशनल पावर बढ़ने के लिए जारी है और एल्गोरिदम अधिक कुशल हो जाते हैं, मॉडल-मुक्त इष्टतम नियंत्रण नियंत्रण नियंत्रण इंजीनियर के उपकरण में एक मानक उपकरण बन जाएगा।

आगे पढ़ने के लिए, ]Wikipedia मॉडल-मुक्त नियंत्रण का अवलोकन , a ]]], और अनुकूल गतिशील प्रोग्रामिंग तकनीकों का एक सर्वेक्षण ]].