Table of Contents

التعريف بالمراقبين عن الدول الجزرية الصغيرة النامية وحدودهم

أما أجهزة التحكم في الانبعاثات التناسبية - المتكاملة فهي أجهزة تشغيل نظم الرقابة الصناعية، ومن تنظيم درجة الحرارة في المفاعلات الكيميائية لتثبيت الرحلات الجوية بدون طيار، فإن أجهزة التحكم في البيوت العاملة في كل قطاع تقريباً يتطلب مراقبة منافذ مغلقة، بينما يقوم المتحكم بتعديل ناتج التحكم على ثلاثة شروط: التناسب (P)، والمتر (I)، والمعادن (D)، وكلها ذات مكسب مثالي.

(أ) إن أساليب التنسيب التقليدية - مثل زيغلر - نيوكولز، أو كوهين - مون، أو دليل المحاكمات والحرق - تنتج نتائج مقبولة للنظم ذات الديناميات الثابتة، غير أن العديد من نظم العالم الحقيقي ديناميكية : تغير سلوكها بمرور الوقت بسبب تغيرات في الحمولات، أو ارتداء المكونات، أو التحولات البيئية، أو عوامل غير مباشرة في هذه النظم؛

ويتيح التعلُّم في مجال تعزيز القدرات إطاراً للاستمرار في استخدام معايير PID في الوقت الحقيقي دون اشتراط نموذج صريح للنظام، بل يتعلم وكيل القانون الإقليمي من التفاعل المباشر، ويكيف المكاسب التي تُحقق أقصى قدر من المكافأة تعكس أداء الرقابة، وهذا النهج يبشر بالخير بوجه خاص للتطبيقات التي يكون فيها التطويع اليدوي غير عملي أو التي تكون فيها طلبات الأداء عالية.

فهم التعلُّم في مجال الرقابة

تعلم التعزيز هو فرع للتعلم الآلي الذي يتعلم فيه العميل اتخاذ القرارات بالتفاعل مع البيئة في كل خطوة، يلاحظ العميل الحالة الراهنة (مثلاً، إشارة الخطأ، مشتق للخطأ، ناتج النظام)، يختار إجراء (مثل تعديل كب، كي، أو كاد) ويتلقى جائزة (أو عقوبة) بناء على النتيجة

وتتمثل العناصر الرئيسية في نظام تربيتها القائم على القانون النموذجي في ما يلي:

  • Environment:] The dynamic system under control (e.g., a motor, Robic arm, or chemical process) along with its sensor feedback and actuator limits.
  • Agent:] The RL algorithm that decides how to modify the PID gains.
  • State representation:] Typically includes the mistake signal (e), its integral ( ⁇ e dt), and its derivative (de/dt), but can also incorporate historical states or system outputs.
  • Action space:] Continuous or discrete adjustments to Kp, Ki, and Kd. In more advanced implementations, the agent directly outputs the gains themselves.
  • Reward function:] A scalar measure of control quality, often combining terms for tracking error, overshoot, settling time, control effort, and stability margin.

(ج) إن التطبيقات الحديثة لشبكة البحث والتطوير في مجال إدارة المعلومات والتعلم، التي تعتمد على أساليب التعلم المعزز [(FLT:1]) التي تستخدم الشبكات العصبية في وضع سياسات وقيم متماثلة، وتشمل نماذج السياسة العامة في مجال التنوع البيولوجي.

How Reinforcement Learning Optimizes PID Parameters Continuous

والفكرة الأساسية هي وضع إطار لمشكلة تدوين البارامترات كعملية لقرار ماركوف حيث تلتقط الدولة المعلومات ذات الصلة عن المصنع والأداء المنشود، وتُعدل إجراءات العميل مكاسب PID في كل خطوة من خطوات المراقبة (أو في إطار زمني أبطأ) وتعاقب المكافأة على ضعف جهود التتبع والمراقبة المفرطة في الوقت الذي تكافئ فيه التقارب والاستقرار على نحو سريع.

إجراءات التدريب

التدريب يحدث عادة في بيئة محاكاة تُمثل النظام المادي، النهج المشترك هو استخدام البرامجيات في اللووب أو محاكاة الأجهزة في اللوب، وعامل RL يتفاعل مع المحاكاة على العديد من الحلقات، كل حلقة تُجرى في الأفق المحدد زمنياً أو حتى يتم استيفاء حالة الفشل

ونظراً لأن أجهزة التحكم في البيوتادايين بي دي غير متجانسة ] (يوفر المصطلح المتكامل ذاكرة، ولكن القيم المربحة نفسها لا توجد بها دولة داخلية خارج نطاق النظام المتكامل)، يمكن للعامل أن يكيف المكاسب بسرعة استجابة للديناميات المتغيرة، مثلاً إذا ما احتفظت ذراع آلي بعبء ثقيل، والزيادة الفعلية في الأخطاء في معدلات الإصابة بالعدوى، وقد تؤدي المكاسب الأصلية في معدل التباطؤ في الاستجابة.

تصميم المهام المستردة

إن تصميم وظيفة المكافأة هو أحد أهم الخطوات، إذ أن المكافأة غير المصممة بشكل سليم يمكن أن تؤدي إلى سلوك غير آمن أو غير مستقر، وتشمل تركيبات المكافأة المشتركة ما يلي:

  • Quadratic cost:] Minimizing the integral of squared error (ISE) plus a penalty on control effort.
  • Multi-objective:] Combining terms for overshoot, settling time, rise time, and steady-state error with user-specified weights.
  • هامش القابلية للتحمل: ] بما في ذلك علاوة للحفاظ على مكاسب مقبولة وعلى هوامش المرحلة، التي كثيرا ما تكون مستمدة من نموذج مبسط.

ونظراً لأن وكيل القانون الإقليمي يتعلم من خلال المحاكمة والعرض، يجب أن تشكل وظيفة المكافأة أيضاً السلوك أثناء الاستكشاف المبكر، كما أن التقنيات مثل تشكيل المكافأة والتعلم في مجال الحدة (من قاعدة بيانات أساسية من نوع PID) يمكن أن تعجل بالتقارب وتخفف من خطر الفشل الكارثي أثناء التدريب.

Reinforcement Learning Algorithms Suitable for PID Tuning

ويؤثر اختيار الخوارزمية الصحيحة على كفاءة التعلم، وتعقيد العينات، وأداء المراقب النهائي، فيما يلي أكثر الخوارزميات استخداما في هذا المجال:

سياسة ديم ديم ديم دي إنديستية

ودليل التنمية البشرية هو خوارزمية غير سياسية مصممة لأماكن العمل المستمرة، وتستخدم شبكات عصبية توأم: يقوم الفاعل بإخراج العمل (في هذه الحالة، يكتسب الرقم القياسي لتسوية مقر العمل تعديلات) من الدولة، ويقدر الناقِد قيمة الكمية (المكافأة المتراكمة المتوقعة) ويستخدم هذا المقياس كعامل للعينة لأنه يعيد استخدام التجارب السابقة المخزنة في عاصمة ضغط دموية.

Learn more about DDPG in the original paper: ] "Continuous Control with Deep Reinforcement Learning" by Lillicrap et al.]

تحقيق الاستفادة المثلى من السياسات العامة

فبرنامج العمل السياسي هو خوارزمية قائمة على السياسة تحقق التوازن بين تبسيط التنفيذ وأدائه، ويستخدم وظيفة موضوعية مجزأة للحد من تحديثات السياسات، ومنع حدوث تغييرات كبيرة مدمرة في السياسات، ويعرف أن المنظمة مستقرة وموثوقة في العديد من مهام الرقابة، وبالنسبة لمؤسسة PID tuning، يمكن أن تتعلم سياسات سلسة تتجنب التقلبات العدوانية، التي هي مهمة بالنسبة للمحاضرين ولها ولأساليب الأمان.

وللتفسير المتعمق، انظر ورقة " فتح " (FLT:0)) السياساتية البديلة().

ناشطة - كرياتية

وشركة SAC هي خوارزمية غير سياسية لا تكتفي بتعظيم العودة المتوقعة بل أيضاً بنسخة السياسة العامة، وتشجع على الاستكشاف، وتحقق باستمرار أحدث أداء بشأن معايير المراقبة المستمرة، وفي سياق الدراسة الاستقصائية التي تقدمها شركة PID، يمكنها تلقائياً أن توازن الاستكشاف والاستغلال، مما يؤدي إلى ضبط قوي ومكيف، كما أنها تميل إلى أن تكون أكثر فعالية وأقل حساسية إزاء أجهزة قياس الانبعاثات الناجمة عن الارتفاع.

Read the original SAC paper: ]"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor" by Haarnoja et al.]

نُهج أخرى جديرة بالذكر

كما طبق الباحثون Trust Region Policy Optimization (TRPO) مع التقريب الوظيفي (محدودة على إجراءات منفصلة بشأن بارامترات PID)، و استراتيجيات التغيير [الخيارات الدائمة]

محاكاة البيئات والأدوات الخاصة بشبكة توليد الطاقة الكهربائية

ويتطلب تطوير واختبار عوامل القانون النموذجي لصرف خدمات تنمية قدرات إدارة التنمية الدولية وجود بيئة مرنة للمحاكاة، وقد برزت عدة أطر:

  • OpenAI Gym / Gymnasium:] The standard interface for RL environments. Custom environments can be built wrapping control Library such as ]control (Python) or Simulink[FT:
  • MuJoCo:] A physics simulator widely used forroidics. It can model complex dynamic systems (e.g., Robic arms, humanoids) where PID controllers are common.
  • Gazebo + ROS:] For more realityroid simulations with sensor noise and actuator limits. The Robot Operating System (ROS) provides a standard way to interface RL agents with real or simulated equipment.
  • Dymola / Modelica:] For large-scale industrial systems (e.g., power plants, HVAC) where PID controllers are abundant. These tools can be connected to RL frameworks via Functional Mock-up Interface (FMI).

Popular RL Library such as Stable-Baselines3], ]RLlib, and TensorFlow agents] provide ready-to-use implementations of DDPG, PPO, SAC.

دراسات الحالة والتطبيقات العالمية الحقيقية

ويتسارع الانتقال من المحاكاة إلى نشر العالم الحقيقي، ويتضح أدناه أمثلة توضيحية تبين فيها الاستفادة المثلى من استخدام PID القائمة على القانون الإقليمي فوائد قابلة للقياس:

Quadrotor Attitude Control

(ج) إن أجهزة التحكم في أجهزة تحديد الهوية هي نظم ذات دينامية عالية، رهناً بعجلات الرياح، وتغيرات الحمولة، وتقلبات بطارية الفولط، وكثيراً ما يحتاج الشاحنون المختلطون إلى إعادة دراسة لمختلف أساليب الطيران (الطوارئ، والمناورات العدوانية) وقد أثبت الباحثون في جامعة ستانفورد وشركة إيث زيورخ أن عميلاً من طراز RL يستخدم PPO يمكن أن يكيف باستمرار مكاسب PID من أجل دليل تعقب النفق الرباعي.

جهاز التحكم الآلي مع الحمولة المتغيرة

وكثيرا ما تعالج الأسلحة الآلية الصناعية في خطوط التجميع أشياء ذات كتلة مختلفة، ويؤدي جهاز التحكم في أجهزة PID الثابتة إلى الإفراط في إطلاق النار عندما يكون الذراع فارغا وردا متباطلا تحت حمولات ثقيلة، وقد تم نشر عامل معتمد على إدارة التنمية العالمية مدرب على المحاكاة على ذراع تابعة للقوات المسلحة الأنغولية، وتعديل Kp و Kd في الوقت الحقيقي استنادا إلى الحمولة المقدرة، مما أدى إلى استمرار ارتفاع عدد الأفراد الذين يبلغ عددهم 10.5 في المائة.

نظام الطاقة

وفي الشبكات الكهربائية، تستخدم مراقبة التوليد الآلي أجهزة التحكم في الاضطرابات التي تستخدمها أجهزة التحكم التابعة للأجهزة الحكومية الدولية، وذلك بزيادة تغلغل مصادر الطاقة المتجددة، وأصبحت ديناميات الشبكات أكثر صعوبة في التنبؤ بها، وقد استخدمت البحوث المنشورة في معاملات الشبكة الدولية للطاقة الذرية بشأن نظم الطاقة الكهربائية SAC في الوقت الذي استخدمت فيه الترددات لتعظيم المكاسب التي تحققت من مصادر متعددة من PIDs في استهلاك مجه الصغر، مما قلل من هذه الزيادة.

التحديات والتخفيف من حدة آثارها في استخدام أسلحة دمار مضادة للدبابات ذات القاعدة المنخفضة

ورغم الوعد، فإن النشر العملي للشبكة من أجل مواصلة تدريب أفراد الشرطة الدولية يواجه عقبات عديدة:

الكفاءة العينية

Many RL algorithms require millions of time steps to converge, which can be infeasible for expensive physical equipment. Solutions:] Use high-fidelity simulations, transfer learning (sim-to-real), or incorporate prior knowledge (e.g. initial gains from Ziegler-Nichols).

الاستقرار أثناء التعلم

وأثناء الاستكشاف، يمكن لوكيل من موظفي إدارة الشؤون القانونية أن يطبق مكاسب مزعزعة للاستقرار تتسبب في حدوث انحرافات أو حتى في ضرر في النظام. الحلول: ] تنفيذ طبقات الأمان التي تكسب تغيرات في كل خطوة، أو استخدام ناقدي السلامة القائمين على ليابونوف، أو استخدام أطر تقييدية (مثلاً، أساليب لاغرانغيان).

Reward Function Senitivity

ويمكن أن تؤدي المكافأة السيئة الشكل إلى سلوكيات تلبي المكافأة المحلية ولكنها غير مرغوب فيها عالميا (مثلاً، التذبذبات العالية التردد التي تقلل إلى أدنى حد من هذه الظواهر ولكنها تُشدد على المُلَكِّمين). الحلول: ] استخدام مكونات المكافأة المتعددة الأبعاد مع التطبيع الدقيق، وإجراء دراسات التقريب لفهم التأثير المكافئ.

التعريف والتكييف

An RL policy trained on a specific system may not generalize to other systems with different dynamics. Solutions:] Train on a distribution of system parameters (domainization), or use meta-learning so the agent can adapt quickly to new environments.

مقارنة مع أساليب الرقابة التأديبية الأخرى

RL is not the only paradigm for adaptive PID tuning. It is helpful to understand where RL shines and where alternatives may suffice:

  • (ه) يتطلب نموذجا مرجعيا ويصبح فعالا بالنسبة للنظم ذات الهيكل المعروف ولكن بارامترات غير مؤكدة.
  • Fuzzy Logic Tuning:] Uses heuristic rules, good for nonlinear systems but often requires expert knowledge to design the rule base. RL learns the rules automatically.
  • Self-Tuning Regulators (STR):] Online parameter estimation combined with control design, but typically assumes linear time-invariant dynamics. RL handles nonlinearities and time-variance more naturally.

وتتمثل الميزة الرئيسية للشبكة في قدرتها على تحقيق الحد الأمثل من مقاييس الأداء التعسفي دون وضع نماذج واضحة، مما يجعلها مثالية للنظم ذات الأهداف المعقدة والمتعددة الجوانب.

الاتجاهات المستقبلية واتجاهات البحوث

ويسير الميدان بسرعة، ويجري استكشاف عدة اتجاهات واعدة:

التعليم القائم على أساس نموذجي

(ب) عدم وجود نموذج للنموذج إلاّ هو تخلف العينات، ويتعلم القانون النموذجي نموذجاً دينامياً للمصنع ويستخدمه في محاكاة العديد من الآفاق المحتملة، ويحسن كثيراً كفاءة العينة، وفي مجال إدارة المعلومات الإنمائية، يمكن أن يتوقّع نموذج متعلّم أثر التغييرات في المكاسب، مما يتيح للعامل التخطيط في المستقبل، وهذا أمر له أهمية خاصة بالنسبة للنظم التي يكون فيها التفاعل في العالم الحقيقي مكلفاً.

PID Tuning

وكثيرا ما تنطوي النظم الحديثة على متحكمين متعددين متفاعلين في أجهزة PID (مثلا في شبكات منسقة للأسلحة الآلية أو الطاقة) ويمكن أن تلتحم الخوارزميات المتعددة العناصر في كل المعايير في آن واحد، وتُحاسب عن آثار التقريب، ويبين العمل المبكر أن التدريب المركزي على التنفيذ اللامركزي يمكن أن يحقق أداءا عالميا أعلى من أداء وكلاء القانون RL المستقلين.

التحكم الحرجي في السلامة مع ر ر ر ر ر

وفيما يتعلق بالتطبيقات الصناعية، فإن قيود السلامة هي في المقام الأول، فالباحثون يدمجون مهام الحواجز التي تعترض الرقابة (مركبات ثنائي الفينيل متعدد الكلور) وطرق ليابونوف في أطر القانون العام لضمان الاستقرار حتى أثناء التدريب، وهذه الأساليب تكفل ألا تنتهك المكاسب التكييفية أبداً القيود الصعبة مثل حدود المستثمر أو الحدود الفولطية.

نشر أجهزة إدج

ويشكل وضع سياسة تدريب على القانون الإقليمي بشأن المتحكمين في الميكرويين أو في إطاره تحدياً ناشئاً، إذ أن هياكل الشبكة الزهيدة الوزن (مثلاً، سياسات صغيرة الحجم، وسياسات كمية تتيح استخدام تكنولوجيا المعلومات في الوقت الحقيقي بتكلفة حاسبية منخفضة، كما أن الشركات مثل Edge Impulse هي شركات رائدة في هذا المجال، ويمكننا أن نتوقع أن تكون لها سيطرة على هذه الأجهزة.

خاتمة

ويوفر التعليم المعزز إطارا قويا لتحقيق الاستخدام الأمثل المستمر لبارامترات PID في النظم الدينامية، وباستبدال التطعيم اليدوي والمكاسب الثابتة بعامل تكيفي يتعلم من التجربة، يمكن لنظم الرقابة أن تحافظ على أداء الذروة في مواجهة الظروف المتغيرة والاضطرابات والخصائص غير المباشرة، وقد أظهرت نماذج حديثة من قبيل تصميمات مشاريع القوانين المحلية، ودليلا على النتائج التي تحققها بلدان العالم.

غير أن التحديات لا تزال قائمة: عدم كفاءة العينات وضمانات الاستقرار وتصميم وظائف المكافأة تتطلب اهتماماً دقيقاً، فالبحوث الجارية في مجال القانون النموذجي، والأساليب التي تضبط السلامة، والوعود بنشر المعلومات على الحافة لجعل استخدام أجهزة PID القائمة على القانون RL في أفضل مكان يمكن الوصول إليه ويمكن الاعتماد عليه، وبالنسبة للمهندسين الذين يسعون إلى تحديث نظم الرقابة، فإن إدماج القانون النموذجي في تدفق العمل في مجال الرعاية الصحية هو خطوة عملية نحو التشغيل الأذكى والأكثر مرونة.

For further reading, consider these foundational resources: OpenAI Spinning up in Deep RL and ] Reinforcement Learning: An Introduction] by Sutton and Barto.]