Table of Contents
تعزيز التعلم ومكافحة البيوت: نموذج جديد
ويظل القائمون على الرقابة على نظام " التعليم بلا حدود " ، الذين يتعلمون بصورة مباشرة من نظم التحكم في الأسلحة غير التقليدية، ويدرسون في كل شيء من نظم التحكم في الأسلحة الآلية، أو نماذج التوليد، أو نماذج الاختبارات غير المستجيبة، أو من أجل تحقيق سلوك مستقر ومستجيب، يشكل تحديا هندسيا كلاسيكيا.
ما هو نموذج التعليم المجاني لتعزيز التنفيذ؟
فالتعليم المعزز هو فرع للتعلم الآلي حيث يتعلم الوكيل اتخاذ سلسلة من القرارات بالتفاعل مع بيئة ما، ويتخذ الوكيل إجراءات (مثلا، تعديل مكاسب PID)، ويراقب الدولة الناشئة والإشارة إلى المكافآت، ويستكمل سياستها الرامية إلى تحقيق أكبر قدر ممكن من المكافأة التراكمية مع مرور الوقت، وفي إطار نظام RL، لا يحاول التعرّف على نموذج من الديناميات الانتقالية للبيئة أو وظيفة مكافئة، بدلا من ذلك، يتعلم مباشرة وظيفة السياسات.
وهذا يتناقض مع القانون النموذجي القائم على أساس القانون النموذجي، حيث يقوم الوكيل أولاً ببناء نموذج داخلي للبيئة ثم يستخدم ذلك النموذج لتخطيط أو محاكاة الإجراءات المقبلة، وفي حين أن النُهج القائمة على النموذج يمكن أن تكون فعالة من حيث العينة، فإنها تعاني من تحيز نموذجي ويمكن أن تفشل بشكل كارثي عندما يكون النموذج غير دقيق.
لماذا تعمل بلا حدود
وتعيش نظم المراقبة، ولا سيما تلك التي تحكمها إدارة شؤون الإعلام، في حيز مستمر للعمل: إذ يمكن أن تكون المكاسب أي أرقام حقيقية داخل حدود، إذ أن الخوارزميات الخالية من النماذج القائمة على القانون الإقليمي مثل نماذج السياسة العامة المتميزة، أو التخصيب الأمثل للسياسات، لا يمكن أن تُعالج بالضبط مثل هذه الأماكن، بل إنها تتعلم سياسة تُلاحظ وجود ضوضاء (تُعُدُم، أو تُحدِّدِّدُ من هذا النوع من الإنتاج).
مزايا القانون النموذجي - التحرر من المسؤولية عن المساعدة التقنية المؤقتة
القابلية للاعتماد في الوقت الحقيقي
وفي كثير من السيناريوهات العملية، تتغير ديناميات النبات بمرور الوقت بسبب ارتدائه أو تحوله البيئي أو تفاوت ظروف الحمولة، إذ أن أحد متحكمي البيوت الدولية يسجل خارجا عن المسارات التقليدية قد يصبح غير مستقر، بل قد يصبح غير مستقر.
القضاء على نماذج النظام
إن بناء نموذج رياضي دقيق لعملية صناعية معقدة مثل مفاعل كيميائي، أو ذراع آلي مرن، أو تربين رياحي يستغرق أسابيع أو أشهراً من جهد الخبراء، ولا يكون النموذج مثالياً أبداً، وكثيراً ما تؤدي تبسيطه إلى تدهور أداء الرقابة، فمع وجود نظام لإزالة الألغام، فإن الشرط الوحيد هو القدرة على إدارة النظام المادي (أو جهاز محاكاة هندسية عالي الجودة) ومراقبة المكافأة.
معالجة أوجه عدم التقادم وعدم اليقين
فالنظام التقليدي لأجهزة الاستنشاق تعتمد في كثير من الأحيان على التسلسل حول نقطة التشغيل، وعندما يكون النظام غير خطي إلى حد كبير، مثل الانحرافات المغناطيسية، أو الملاجئ الهيدروليكية، أو الأجهزة الطبية الحيوية - فإن التقريبية الساطعة تنهار خارج منطقة ضيقة، ولا تفترض الخصم النموذجي، بل تتعلم سياسة من خلال العديد من حلقات التفاعل، فإن الاضطرابات الناجمة عن التقلبات تُعَدَرَبَتَبَبَتَتَتَتَ.
التشغيل الآلي، من نهاية إلى أخرى
فالتدريب في أجهزة التفجير المتعددة الأبعاد هو مشكلة متعددة الجوانب: إذ أن المرء يريد الحصول على وقت سريع، وخطأ طفيف ثابت في الدول، وقوية الاضطرابات، فالطرق التقليدية تتطلب من المصمم أن يتبادل يدوياً هذه الأهداف، ويمكن أن يدمج كل هذه الأهداف مباشرة في وظيفة المكافآت، وعلى سبيل المثال يمكن أن تعاقب على ضبط الوقت، والخطأ المطلق المتكامل، واستهلاك الطاقة، والجهد الأمثل في مجال السيطرة في آن واحد.
تنفيذ القانون النموذجي الخاص بالحرية من أجل تحقيق الاستخدام الأمثل
تحديد أماكن عمل الدولة والعمل
وينبغي أن يورد تمثيل الدولة جميع المعلومات اللازمة لتحديد المكاسب الجيدة التي تحققت في مجال التنمية، وتشمل الخيارات المشتركة آخر عينات قليلة من خطأ التتبع، والخطأ المكمل، والخطأ المشتق، إلى جانب احتمال أن تكسب الدول الجزرية الصغيرة نفسها، وفي بعض الحالات، تكون الدولة مجرد الخطأ العادي، والمتكامل، والمشتقات (المكونات الثلاثة التي تعمل عليها شركة PID) وهي عادة ناجمة عن التغيرات في القيمة المطلقة أو القيمة الدالة.
تصميم المهام المستردة
(أ) إن وظيفة المكافأة هي أهم جانب من جوانب التدريب على أساس السحب على أساس السحب، ويمكن أن تؤدي المكافأة السيئة التصميم إلى حدوث خطأ أو سلوك عدواني أو عدم الخلط، وتتمثل الممارسة الجيدة في تحديد مكافأة مرجحة من العقوبات السلبية: r(t) = - [w1 ⁇ e(t) +2 ⁇
Algorithm Selection
وفيما يتعلق بأماكن العمل المستمرة، فإن أكثر الخوارزميات استخداما هي:
- Deep Deterministic Policy Gradient (DDPG)]: An actor-critic method that learns a deterministic policy and a Q-function. It is sample-efficient and works well in low-dimensional state spaces typical of PID tuning.
- Proximal Policy Optimization (PPO)]: A policy-gradient method that constrains the policy update to avoid destroy large changes. PPO is more stable across a wider range of hyperparameters and is often preferred for real-world systems where reliable matters.
- Twin Delayed DDPG (TD3)]: An improvement over DDPG that mitigates value overestimation, offering better performance and stability.
وبالنسبة للحالات البسيطة، المنخفضة الأبعاد، يمكن استخدام التعليم النوعي الأساسي أو السار، إذا تم تفريق الحيز المتاح للدولة والأماكن المخصصة للعمل، ولكن نادرا ما يكون ذلك عملياً من أجل مواصلة التقاط الكسب.
التدريب على المحاكاة ضد برنامج " البرمجيات الحقيقية "
ويتحمل تدريب عامل من عناصر القانون الجنائي على نظام مادي مباشرة مخاطر الضرر ويحتاج إلى العديد من الحلقات (بالآلاف المحتملة) للترابط، ويتمثل النهج المعياري في التدريب الأول في محفز رفيع المستوى، يستخدم محركاً فيزياء مثل موجوكو، غازيبو، أو توأم رقمي، ثم ينقل السياسة المتعلمة إلى النظام الحقيقي (النقل من مكان لآخر)
اعتبارات الهندسة المعمارية للشبكة العصبية
وفيما يتعلق بكسب البيوتاغات، فإن شبكات السياسات والقيمة هي عادة طبقة صغيرة أو ثلاث طبقات مخبأة بها 64-256 من الأعصاب، وتتطابق طبقة المدخلات مع البعد الحكومي (في كثير من الأحيان من 3 إلى 10)، وطبقة الإنتاج لديها ثلاثة أعصاب (في شكل حرق، أو في شكل حرق، أو في شكل حرق، وفي حالة وجود تذبذب في البيانات، أو في مرحلة التحلل، حيث يوجد حيز القرار.
التحديات والنظر في المسألة
الكفاءة الوافية والوقت المتزامن
وتتطلب عملية تحرير نظام RL، التي لا تصلح للنموذج، عادة، عشرات الآلاف إلى ملايين الوقت للالتقاء بسياسة جيدة، ولبطء عملية صناعية تتطابق فيها لحظة واحدة من الزمن الحقيقي، يمكن أن يستغرق التدريب ساعات أو أيام، وهذا حاجز رئيسي للتدريب المباشر على الإنترنت، وتشمل الحلول استخدام المحاكاة السريعة (يمكن للمحفز أن يُجرى أسرع من الزمن الحقيقي)، أو بيئة تدريب متوازية، أو نقل التعلم من مهمة مماثلة.
السلامة أثناء الاستكشاف
ويجب على وكيل القانون الإقليمي، أثناء التدريب، أن يستكشف حيز العمل لإيجاد سياسات أفضل، ويمكن أن يؤدي استكشاف المكاسب التي تجنيها أجهزة الشرطة إلى جعل المتحكم غير مستقر، أو يُنبذ برا أو يقود النظام إلى مناطق غير آمنة، ومن الضروري تنفيذ قيود السلامة: تقادم الإجراءات، والعقوبات المفروضة على تجاوز الحدود الآمنة، والإعادة الدورية إلى سياسة خط الأساس مستقرة معروفة، حيث لا يكون تدريب العناصر الرقابية المنخفضة المستوى غير آمنة.
Reward Engineering and Multi-Objective Trade-offs
ومن الصعب للغاية تصميم وظيفة مكافأة تؤدي إلى السلوك المرغوب دون التأثيرات الجانبية غير المقصودة، وقد يستغل هذا الوكيل وظيفة المكافأة بطرق لم يكن المصمم يتوقعها، على سبيل المثال، بالتسبب في حدوث تذبذبات سريعة تؤدي إلى تقليل الخطأ، بل تضر بالموقن بمرور الوقت، ومن المهم اختبار مختلف المكافآت في المحاكاة ورصد القياسات الإضافية أثناء التدريب، باستخدام مكافأة متأة مخففة (كشوفة).
الموارد الحاسوبية
ويحتاج تدريب وكلاء القانون العام إلى قوة حاسوبية كبيرة (GPU) لتحديث الشبكة العصبية) غير أنه نظراً لأن حيزات الدولة والعمل في مجال تدريب PID صغير، فإن الطلب على الحاسوب أقل بكثير من الطلب على اللعب أو الروبوتات التي تحتوي على مدخلات ذات رؤية رفيعة المستوى، فإن حاسوباً محمولاً حديثاً به جهاز تدريبي صغير المدى في غضون ساعات قليلة بالنسبة لمصنع بسيط نسبياً.
الترجمة الشفوية والتقدير
ومن ناحية أخرى، فإن أساليب الضبط التقليدية في PID تعطي نظرة واضحة على الرياضيات: كسب الهامش، والهامش التدريجي، والأماكن المتجذرة، وما إلى ذلك، وإحدى السياسات التي تعتمد على أساس RL، هي شبكة عصبية ذات صندوق أسود، وقد يتردد المهندسون في الثقة دون تحقق واسع النطاق، ومن أجل معالجة هذه المعايير يمكن أن يحلل السياسة المتعلمة بتفسير شروط التشغيل والتحقق من أن الحافظات الأولية هي خطوة.
التطبيقات العالمية الحقيقية ودراسات الحالات الإفرادية
وقد ثبت في عدة مجالات وجود تطعيم معتمد على نظام تبادل المعلومات بشأن التعريفات الجمركية (PID) خال من النماذج:
- Robotics:] Tuning joint-level PID controllers for manipulators leggedroidroid Robs to adapt to varying payloads or terrain. A study by researchers at ETH Zurich showed that DDPG could learn gain schedules for a quadcopt disturbance
- Process Control:] Optimizing PID cycles for temperature, pressure, and flow in chemical plantsيناً
- Power Electronics:] Tuning PID controllers for DC-DC converters and motor drives where varying load conditions degrade performance. RL-tuned controllers have shown faster transient recovery and better efficiency across operating points.
- Automotive:] Adaptive cruise control and suspension systems that learn to adjust PID parameters based on road conditions and driving fashion.
خاتمة
فالتعليم بالتقوية بدون نماذج يوفر مساراً قاهراً نحو تحقيق الحد الأمثل من البارامترات، لا سيما في النظم التي تتسم بعدم التقادم وعدم التيقن والديناميات المتغيرة، ومن خلال إزالة الحاجة إلى نماذج نباتية واضحة، والتكييف في الوقت الحقيقي، يمكن أن يؤدي إلى الحد بدرجة كبيرة من الجهد الهندسي وتحسين أداء الرقابة في التطبيقات المتطلبة، غير أنه يتعين على الممارسين أن يتدبروا بعناية التحديات المتصلة بكفاءة العينات، وبتصميم المكافآت، وباحتيا، وباحتيا، وباحتياجات، وباحتيا، وباحتياجات، وبأدوات، وباحتياجات، وبأدوات، التي تكيفات، مع استخدام أدوات القياسات،
For further reading, see the comprehensive survey on RL for control by Busoniu et al. (2018) and ] a practical guide to RL for PID tuning from the Control and Automation community.