mathematical-modeling-in-engineering
فوائد استخدام التعلم في مجال الإنفاذ بدون نماذج من أجل تحقيق الاستخدام الأمثل لبارامترات الرمود
Table of Contents
تعزيز التعلم ومكافحة البيوت: نموذج جديد
ويظل القائمون على الرقابة على نظام " التعليم بلا حدود " ، الذين يتعلمون بصورة مباشرة من نظم التحكم في الأسلحة غير التقليدية، ويدرسون في كل شيء من نظم التحكم في الأسلحة الآلية، أو نماذج التوليد، أو نماذج الاختبارات غير المستجيبة، أو من أجل تحقيق سلوك مستقر ومستجيب، يشكل تحديا هندسيا كلاسيكيا.
ما هو نموذج التعليم المجاني لتعزيز التنفيذ؟
فالتعليم المعزز هو فرع للتعلم الآلي حيث يتعلم الوكيل اتخاذ سلسلة من القرارات بالتفاعل مع بيئة ما، ويتخذ الوكيل إجراءات (مثلا، تعديل مكاسب PID)، ويراقب الدولة الناشئة والإشارة إلى المكافآت، ويستكمل سياستها الرامية إلى تحقيق أكبر قدر ممكن من المكافأة التراكمية مع مرور الوقت، وفي إطار نظام RL، لا يحاول التعرّف على نموذج من الديناميات الانتقالية للبيئة أو وظيفة مكافئة، بدلا من ذلك، يتعلم مباشرة وظيفة السياسات.
وهذا يتناقض مع القانون النموذجي القائم على أساس القانون النموذجي، حيث يقوم الوكيل أولاً ببناء نموذج داخلي للبيئة ثم يستخدم ذلك النموذج لتخطيط أو محاكاة الإجراءات المقبلة، وفي حين أن النُهج القائمة على النموذج يمكن أن تكون فعالة من حيث العينة، فإنها تعاني من تحيز نموذجي ويمكن أن تفشل بشكل كارثي عندما يكون النموذج غير دقيق.
لماذا تعمل بلا حدود
وتعيش نظم المراقبة، ولا سيما تلك التي تحكمها إدارة شؤون الإعلام، في حيز مستمر للعمل: إذ يمكن أن تكون المكاسب أي أرقام حقيقية داخل حدود، إذ أن الخوارزميات الخالية من النماذج القائمة على القانون الإقليمي مثل نماذج السياسة العامة المتميزة، أو التخصيب الأمثل للسياسات، لا يمكن أن تُعالج بالضبط مثل هذه الأماكن، بل إنها تتعلم سياسة تُلاحظ وجود ضوضاء (تُعُم، أو تعديلات مُتَصَمِّدة، أو نظام إنتاج).
مزايا القانون النموذجي - التحرر من المسؤولية عن المساعدة التقنية المؤقتة
القابلية للاعتماد في الوقت الحقيقي
وفي كثير من السيناريوهات العملية، تتغير ديناميات النبات بمرور الوقت بسبب ارتدائه أو تحوله البيئي أو تفاوت ظروف الحمولة، إذ أن أحد متحكمي البيوت في البيوت ذات العجلات التقليدية يصبح دون المستوى الأمثل وقد يصبح غير مستقر، بينما تستمر التفوقات في التكييف الإلكتروني مع النظام وصقل سياسته، مثلاً، في حالة حدوث ضرر ثابت من نوع RL-tuned في حالة حدوث مضخمات كهربائية متنقلة.
القضاء على نماذج النظام
إن بناء نموذج رياضي دقيق لعملية صناعية معقدة مثل مفاعل كيميائي، أو ذراع آلي مرن، أو تربين رياحي يستغرق أسابيع أو أشهراً من جهد الخبراء، ولا يكون النموذج مثالياً أبداً، وكثيراً ما تؤدي تبسيطه إلى تدهور أداء الرقابة، فمع وجود نظام لإزالة الألغام، فإن الشرط الوحيد هو القدرة على إدارة النظام المادي (أو جهاز محاكاة هندسية عالية الجودة) ومراقبة المكافأة.
معالجة أوجه عدم التقادم وعدم اليقين
فالنظام التقليدي لأجهزة الاستنشاق تعتمد في كثير من الأحيان على التسلسل حول نقطة التشغيل، وعندما يكون النظام غير خطي إلى حد كبير، مثل الانحرافات المغناطيسية، أو الملاجئ الهيدروليكية، أو الأجهزة الطبية الحيوية - فإن التقريبية الساطعة تنهار خارج منطقة ضيقة، ولا تفترض الخصم النموذجي، بل تتعلم السياسة من خلال العديد من حلقات التفاعل، فإن الاضطرابات الناجمة عن التقلبات تُعَدَرَبَتَبَبَتَتَتَتَ.
التشغيل الآلي، من نهاية إلى أخرى
فالتدريب في أجهزة التفجير المتعددة الأبعاد هو مشكلة متعددة الجوانب: فالحد الأدنى من الزمان، والخطأ في الدول الثابتة الصغيرة، والقوة في الاضطرابات، والطرق التقليدية تتطلب من المصمم أن يتبادل يدويا هذه الأهداف، ويمكن أن يدمج كل هذه الأهداف مباشرة في وظيفة المكافآت، وعلى سبيل المثال يمكن أن تعاقب على ضبط الوقت، والخطأ المطلق المتكامل، واستهلاك الطاقة، والجهد الأمثل في مجال الرقابة في آن واحد.
تنفيذ القانون النموذجي الخاص بالحرية من أجل تحقيق الاستخدام الأمثل
تحديد أماكن عمل الدولة والعمل
وينبغي أن يورد تمثيل الدولة جميع المعلومات اللازمة لتحديد المكاسب الجيدة التي تحققت في مجال التنمية، وتشمل الخيارات المشتركة آخر عينات قليلة من خطأ التتبع، والخطأ المكمل، والخطأ المشتق، إلى جانب احتمال أن تكسب الدول الجزرية الصغيرة نفسها، وفي بعض الحالات، تكون الدولة مجرد الخطأ العادي، والمتكامل، والمشتقات (المكونات الثلاثة التي تعمل عليها شركة PID) وهي عادة ناجمة عن التغيرات في القيمة المطلقة أو القيمة الدالة.
تصميم المهام المستردة
(أ) إن وظيفة المكافأة هي أهم جانب من جوانب التدريب على أساس السحب على أساس السحب، ويمكن أن تؤدي المكافأة السيئة التصميم إلى حدوث خطأ أو سلوك عدواني أو عدم الخلط، وتتمثل الممارسة الجيدة في تحديد مكافأة مرجحة من العقوبات السلبية: r(t) = - [w1 ⁇ e(t) +2 ⁇
Algorithm Selection
وفيما يتعلق بأماكن العمل المستمرة، فإن أكثر الخوارزميات استخداما هي:
- Deep Deterministic Policy Gradient (DDPG)]: An actor-critic method that learns a deterministic policy and a Q-function. It is sample-efficient and works well in low-dimensional state spaces typical of PID tuning.
- Proximal Policy Optimization (PPO)]: A policy-gradient method that constrains the policy update to avoid destroy large changes. PPO is more stable across a wider range of hyperparameters and is often preferred for real-world systems where reliable matters.
- Twin Delayed DDPG (TD3)]: An improvement over DDPG that mitigates value overestimation, offering better performance and stability.
وبالنسبة للحالات البسيطة، المنخفضة الأبعاد، يمكن استخدام التعليم النوعي الأساسي أو السار، إذا تم تفريق الحيز المتاح للدولة والأماكن المخصصة للعمل، ولكن نادرا ما يكون ذلك عملياً من أجل مواصلة التقاط الكسب.
التدريب على المحاكاة ضد برنامج " البرمجيات الحقيقية "
ويتحمل تدريب عامل من عناصر القانون الجنائي على النظام المادي مباشرة مخاطر الضرر ويحتاج إلى العديد من الحلقات (بالآلاف المحتملة) للترابط، ويتمثل النهج المعياري في التدريب الأول في محفز رفيع المستوى يستخدم محركاً للفيزياء مثل موجوكو، غازيبو، أو في تطبيق سياسة رقمية بعد ذلك، وينقل السياسة المتعلمة إلى النظام الحقيقي (النقل من المجازفة إلى الخلفية).
اعتبارات الهندسة المعمارية للشبكة العصبية
وفيما يتعلق بكسب البيوتاغات، فإن شبكات السياسات والقيمة هي عادة طبقة صغيرة أو ثلاث طبقات مخبأة بها 64-256 من الأعصاب، وتتطابق طبقة المدخلات مع البعد الحكومي (في كثير من الأحيان من 3 إلى 10)، وطبقة الإنتاج لديها ثلاثة أعصاب (في شكل دنيوي، أو في شكل دنيء، وفي حالة التراكم، وفي حالة الاختباء، فإن وجود عوامل تثبيتية في الناتج.
التحديات والنظر في المسألة
الكفاءة الوافية والوقت المتزامن
وتتطلب عملية تحريرية نموذجية من الرنين المغناطيسي عادة عشرات الآلاف إلى ملايين الوقت للالتقاء بسياسة جيدة، ولبطء عملية صناعية تتطابق فيها لحظة واحدة من الزمن الحقيقي مع خطوة واحدة، يمكن أن يستغرق التدريب ساعات أو أيام، وهذا حاجز رئيسي للتدريب المباشر على الإنترنت، وتشمل الحلول استخدام المحاكاة السريعة (يمكن للمحفز أن يُجرى أسرع من الزمن الحقيقي)، أو بيئة تدريب متوازية، أو نقل التعلم من مهمة مماثلة.
السلامة أثناء الاستكشاف
ويجب على وكيل القانون الإقليمي، أثناء التدريب، أن يستكشف حيز العمل لإيجاد سياسات أفضل، ويمكن أن يؤدي استكشاف المكاسب التي تجنيها أجهزة الشرطة إلى جعل المتحكم غير مستقر، أو يُنبذ برا أو يقود النظام إلى مناطق غير آمنة، ومن الضروري تنفيذ قيود السلامة: تقادم الإجراءات، والعقوبات المفروضة على تجاوز الحدود الآمنة، والإعادة الدورية إلى سياسة خط الأساس مستقرة معروفة، حيث لا يكون تدريب العناصر الرقابية المنخفضة المستوى غير آمنة.
Reward Engineering and Multi-Objective Trade-offs
ومن الصعب للغاية تصميم وظيفة مكافأة تؤدي إلى السلوك المرغوب دون التأثيرات الجانبية غير المقصودة، وقد يستغل هذا الوكيل وظيفة المكافأة بطرق لم يكن المصمم يتوقعها، على سبيل المثال، بالتسبب في حدوث تذبذبات سريعة تؤدي إلى تقليل الخطأ إلى حد ما، بل تضر بالمضيف بمرور الوقت، ومن المهم اختبار مختلف المكافآت في المحاكاة ورصد القياسات الإضافية أثناء التدريب، باستخدام مكافأة متأة مخففة (مثلة في نهاية).
الموارد الحاسوبية
ويحتاج تدريب وكلاء القانون العام إلى قوة حاسوبية كبيرة (GPU) لتحديث الشبكة العصبية) غير أنه نظراً لأن حيزات الدولة والعمل في مجال تربيتها صغيرة، فإن الطلب على الحاسوب أقل بكثير من الطلب على اللعب أو الروبوتات التي تحتوي على مدخلات ذات رؤية رفيعة المستوى، فإن حاسوباً محمولاً حديثاً به جهاز تدريبي متعدد الأبعاد في غضون ساعات قليلة بالنسبة لمصنع بسيط نسبياً.
الترجمة الشفوية والتقدير
ومن ناحية أخرى، فإن أساليب الضبط التقليدية في PID تعطي نظرة واضحة على الرياضيات: كسب الهامش، والهامش التدريجي، والأماكن المتجذرة، وما إلى ذلك، وإحدى السياسات التي تعتمد على أساس RL، هي شبكة عصبية ذات صندوق أسود، وقد يتردد المهندسون في الثقة دون تحقق واسع النطاق، ومن أجل معالجة هذه المعايير يمكن أن يحلل السياسة المتعلمة بتفسير شروط التشغيل والتحقق من أن الحافظات الأولية هي خطوة.
التطبيقات العالمية الحقيقية ودراسات الحالات الإفرادية
وقد ثبت في عدة مجالات وجود تطعيم معتمد على نظام تبادل المعلومات بشأن التعريفات الجمركية (PID) خال من النماذج:
- Robotics:] Tuning joint-level PID controllers for manipulators leggedroidroid Robs to adapt to varying payloads or terrain. A study by researchers at ETH Zurich showed that DDPG could learn gain schedules for a quadcopt disturbance
- Process Control:] Optimizing PID cycles for temperature, pressure, and flow in chemical plantsيناً
- Power Electronics:] Tuning PID controllers for DC-DC converters and motor drives where varying load conditions degrade performance. RL-tuned controllers have shown faster transient recovery and better efficiency across operating points.
- Automotive:] Adaptive cruise control and suspension systems that learn to adjust PID parameters based on road conditions and driving fashion.
خاتمة
فالتعليم بالتقوية بدون نماذج يوفر مساراً قاهراً نحو تحقيق الحد الأمثل من البارامترات، لا سيما في النظم التي تتسم بعدم التقادم وعدم التيقن والديناميات المتغيرة، ومن خلال إزالة الحاجة إلى نماذج نباتية واضحة، والتكييف في الوقت الحقيقي، يمكن أن يؤدي إلى الحد بدرجة كبيرة من الجهد الهندسي وتحسين أداء الرقابة في التطبيقات المتطلبة، غير أنه يتعين على الممارسين أن يتدبروا بعناية التحديات المتصلة بكفاءة العينات، وبتصميم المكافآت، وباحتيا، وباحتيا، وباحتياجات، وباحتيا، وباحتياجات، وبأدوات، وباحتياجات، وبأدوات، التي تكيفات، مع استخدام أدوات القياسات،
For further reading, see the comprehensive survey on RL for control by Busoniu et al. (2018) and ] a practical guide to RL for PID tuning from the Control and Automation community.