control-systems-and-automation
الاستفادة من التعلم العميق لتسريع نظام الحاسوب الآلي
Table of Contents
مقدمة: وجود رابطة التعلم العميق والرقابة على الوجه الأمثل
وقد كانت نظرية المراقبة المثلى منذ زمن بعيد حجر الزاوية في الهندسة الحديثة، حيث كانت توفر أطرا رياضية لتوجيه النظم الدينامية نحو السلوك المرغوب، مع التقليل إلى أدنى حد من التكلفة أو تحقيق أقصى قدر من الأداء، ومن التخطيط للمسارات الفضائية إلى التشغيل الآلي للعمليات الصناعية، كانت القاعدة القصوى للمراقبة قائمة على عدد لا يحصى من التطبيقات، غير أن الأساليب التقليدية - مثل البرمجة الدينامية، أو مبدأ الحد الأدنى من العوامل، أو العلاقات القائمة على التوسيع المباشر -
وتستكشف هذه المادة كيف أن تقنيات التعلم العميق تعيد تشكيل السيطرة المثلى، وتفصل المبادئ الأساسية والمزايا الرئيسية والتطبيقات العالمية الحقيقية والتحديات التي لا تزال قائمة، والهدف هو توفير استعراض شامل وموثوق للمهندسين والباحثين والممارسين المهتمين باستحداث شبكات عصبية لحل مشاكل السيطرة بمزيد من الكفاءة.
Understanding Optimal Control: A Brief Primer
وتعالج الرقابة المثلى مسألة إيجاد قانون للمراقبة يقلل إلى أدنى حد من معيار الأداء (أو يُحدّد أقصى) على أفق زمني، رهناً بديناميات النظام والقيود التي يفرضها.
Find control input u(t) that minimizes J = / (x(t f) + ⁇ L(x(t), u(t), t) dt, subject to dx/dt = f(x(t), u(t), t), with boundary and path constraints.
]
وهنا، (س) هو ناقل الدولة، و(ت) مدخل التحكم، و(ي) يعمل على التكلفة، وعادة ما يتطلب حل هذه المشكلة أساليب رقمية متكررة تنطوي على دفع النظام إلى الأمام في الوقت المناسب وحل المكافئات المتلازمة، المعروفة باسم طريقة " المطاردة " ، ولأجل النظم العالية الأبعاد، فإن لعنة البعدية تجعل البرمجة الدينامية غير عملية، بوصفها الفضاء الحكومي.
ويمكن للنهج التقليدية مثل التواطؤ المباشر أو إطلاق النار المتعدد أن تعالج أبعاداً معتدلة، ولكنها لا تزال تتطلب موارد حاسوبية كبيرة، مما يحد من استخدامها في التطبيقات التي يجب اتخاذ قرارات بشأنها في ملي ثانية، مثل القيادة المستقلة أو التلاعب الآلي.
لماذا السرعة في التحكم
وفي العديد من النظم الحالية، يجب أن تكون الفجوة بين قياس ومراقبة الدولة ضئيلة للغاية، فعلى سبيل المثال، يجب على المحك أن يعدل سرعة الدوارة عند ترددات تتجاوز 100 هرتز للحفاظ على الطيران المستقر، وأن حل مشكلة التحكم الأمثل من الصفر في كل خطوة زمنية أمر غير قابل للحل، بل إن المهندسين غالبا ما يجتازون الحلول القصوى أو يستخدمون نماذج مبسطة - على حد سواء تتيح التضحية المثلى أو القدرة على التكيف.
التعلم العميق في نوتشيل
(ب) التعلم العميق هو مجموعة فرعية من التعلم الآلات تستخدم شبكات الظواهر العصبية الاصطناعية ذات طبقات عديدة (الثقيلة) للعلاقات النموذجية المعقدة وغير الخطية، ونظراً لما يكفي من البيانات والموارد الحاسوبية، يمكن لشبكة عصبية عميقة أن تقارب أي وظيفة مستمرة إلى الدقة التعسفية - وهي ممتلكات تعرف باسم نظرية التقريبية العالمية، وفي سياق الرقابة، فإن المهمة التي ينبغي أن تُسمى " الإجراءات المثالية " .
ويشمل التدريب في هذه الشبكة عادة التعلم الخاضع للإشراف (استعمال البيانات المستمدة من المذيبات التقليدية) أو التعلم من التعزيزات (حيث تتعلم الشبكة بالتفاعل مع محاكاة النظام) وقد استخدم النهجان بنجاح، كل منهما له قوة خاصة به والمبادلات.
التعليم الإشرافي من أجل اعتماد السياسات
وفي إطار التعليم الذي يشرف عليه، يجمع المرء مجموعة كبيرة من البيانات من أزواج الإجراءات الحكومية عن طريق حل العديد من مشاكل المراقبة المثلى المفتوحة، ثم يتم تدريب الشبكة العصبية على التقليل إلى أدنى حد من خطأ التنبؤ، مما يحد بفعالية من المتحكم الأمثل، وعندما يتم تدريبه، يمكن للشبكة أن تنتج إجراءات رقابة شبه متكاملة لدول جديدة على الفور تقريبا، مما يجعلها مناسبة للنشر في الوقت الحقيقي، وهذه الطريقة فعالة بشكل خاص عندما تكون الديناميات معروفة جيداً وتكلفتها.
تعزيز التعلم من أجل البحث المباشر عن السياسات
ويتجاوز التعلُّم في مجال الإنفاذ الحاجة إلى بيانات حاسوبية مسبقة عن طريق قيام الوكيل باستكشاف حيز الدولة والتعلم من خلال المحاكمة والخطأ، وقد حققت المقاييس مثل شبكات الطاقة الكثيفة جداً، والتحسين الأمثل للسياسات، والاختلال المستمر في الأنشطة التحليلية التي يمكن أن تُفضي إلى تحقيق نتائج ملموسة في مهام الرقابة، من خلال استخدام التلاعبات القائمة على الاكتشافات في إطار استراتيجيات الاكتشافات الآلية.
How Deep Learning Accelerates Optimal Control Compututations
وآلية التعجيل الأساسية هي التقريب الوظيفي .() وتحتاج المذيبات التقليدية إلى تحقيق أقصى قدر ممكن من التسرع في كل مرة تقوم فيها شركة " جيكوب " بتقييم عمليات التفتيش على الخط أو إدماج المعادلات التفاضلية في الوقت المناسب، وتكتفي شبكة تدريبية على الظواهر العصبية، على النقيض، بتنفيذ تمريرة للأمام: سلسلة من المضاعفات المصففة، والأنشطة غير المباشرة.
وبالإضافة إلى السرعة الخام، يتيح التعلُّم العميق أيضاً السيطرة على التكيف والتنبؤ ]. وبدلاً من إعادة حساب مسار من الخدش عندما تتغير الظروف، يمكن للشبكة أن تعمم على الدول غير المُتوقَّعة، شريطة أن يكون مجال التدريب واسعاً بما فيه الكفاية، وهذه القدرة على التعميم هي ما يجعل التعلم العميق جذاباً بشكل خاص للنظم ذات الديناميات المتغيرة، مثل طائرة بلا طيار تحمل عبوات غير معروفة أو كائنات الآلية.
الحاسوب المباشر
ومن بين أوجه التمييز الحاسمة التي يقيم فيها الجهد الحاسوبي، حيث تُدرج الرقابة المثلى التقليدية في الحاسوب الثقيل على الإنترنت: فكل خطوة من خطوات المراقبة تتطلب حل برنامج غير خطي كبير محتمل، وتُحوّل التعلم العميق معظم خط الحاسوب الخارجي: التدريب على الشبكة مكثف حسابيا، ولكن الاختبار رخيص، وهذا الفارق مثالي للتطبيقات في الوقت الحقيقي حيث تكون الموارد الحاسوبية الإلكترونية محدودة ولكن التدريب خارج الخط يمكن أن يتم على مجموعات قوية.
وعلاوة على ذلك، يمكن، بمجرد تدريبها، نشر الشبكة نفسها على نظم مدمجة ذات قدرات متواضعة في مجال الذاكرة والمعالجة، وعلى سبيل المثال، يمكن لجهاز مراقبة الرحلات الجوية التابع لربّع المحار أن يعمل على متحكم في الميكرويين بأقل استهلاك للطاقة، ومع ذلك فإنه ينتج إجراءات تقارب السياسة المثلى.
أهم جوانب التعلم العميق - الرقابة على الوجه الأمثل
- Real-time performance:] Inference latency in the sub-millisecond range enables control cycles in the kilohertz domain.
- Scalability to high dimensions:] Neural networks can process high-dimensional state spaces (e.g., images from cameras, LiDAR point clouds) that would overwhelm traditional solvers.
- Adaptability and transfer learning:] Networks can be fine-tuned for new tasks or environments without retraining fromnch, reducing development time.
- Handling of nonlinearities:] Deep models excel at capturing complex, non-convex mappings that defy closed-form solutions.
- Reduced model dependency:] Model-free RL methods can learn opt control even when the underlying dynamics are imperfectly known, relying instead on data.
التطبيقات العالمية الحقيقية
وقد أسفر تصاعد التعلم العميق والتحكم الأمثل بالفعل عن نتائج مثيرة للإعجاب عبر مجالات متعددة، فيما يلي أمثلة بارزة عديدة.
المركبات المستقلة
ويجب أن تتخذ السيارات ذات القيادة قرارات منقسمة إلى ثانيتين في الوقت الذي تبحر فيه البيئات الدينامية، فالتحكم التوقعي التقليدي يعمل جيدا، ولكنه يمكن أن يكون ثقيلا من الناحية الحسابية عند استخدام نماذج عالية الصفوة، وقد درب الباحثون شبكات الجير على اتخاذ الإجراءات المثلى للحركة، وتحقيق أداء مماثل في جزء من التكلفة الحسابية، كما أن الشركات مثل وايمو وتيسلا تدمج التعلم العميق ليس فقط من أجل التحكم في المسارات.
فعلى سبيل المثال، أظهرت دراسة أجريت في عام 2020 من UC Berkeley] جهازاً للرقابة على أساس التعلم العميق يمكن أن يحل محل مذيب كامل تابع للحركة في مجال حفظ السيارات، مما يقلل من وقت الحساب بأكثر من 100 مرة مع الحفاظ على السلامة.
الأجهزة والتلاعب
وتستفيد المهام الجراحية من التحكم الأمثل في استخدام الأسلحة الآلية أو التقاطها أو القيام بمهام جراحية من أجل التقليل إلى أدنى حد من الطاقة والوقت، وقد طبقت خطة " ديب ري " لتعلم سياسات التلاعب الغنية بالاتصالات، مثل إدخال رزمة في حفرة أو فتح باب، ومن الأمثلة البارزة العمل الذي تقوم به OpenAI ] بشأن تدريب يد آلية على إعادة تشكيل الأجهزة.
وفي هذه السيناريوهات، تتعلم الشبكة العصبية أن تنبأ ليس فقط بعلامات مشتركة بل أيضا بمعرفة نقاط القوة وموجزاتها، في الوقت الحقيقي، وتأتي التسارع من تجاوز حسابات الديناميات العكسية المتكررة، ورسم خرائط مباشرة للملاحظات الحكومية الرفيعة الأبعاد (مثل الزوايا المشتركة، والتغذية المرتدة) إلى التحكم في النواتج.
نظم الطاقة وضغوطات الذكاء
(ب) الشبكات الكهربائية تزداد تعقيداً، حيث تُدخل المصادر المتجددة نظاماً للتشبث، وتستخدم الرقابة على الوجه الأمثل لموازنة العرض والطلب، وتنظيم الفولط، وتخزين الجدول الزمني، غير أن حل مشكلة تدفق الطاقة المثلى بالكامل هو إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي إي تي للشبكات للشبكات الكبيرة.
الفضاء الجوي والطائرات العمودية
ويحتاج المكثفات والمركبات الجوية الأخرى إلى حلقات مراقبة عالية التردد للحفاظ على الاستقرار، ويستخدم نموذج المراقبة التنبؤية عادة في 50 إلى 100 هرتز، بسبب الحدود الحاسوبية، وباستبدال المذيب بشبكة عصبية، حقق الباحثون معدلات رقابة تتجاوز 1 كيلوهرتز، وعلى سبيل المثال، قامت دراسة من ETH Zurich، بتدريب ناتج قوي من شبكة حكومية سريعة.
التحديات والحدود
وعلى الرغم من وعدها، فإن التعلم العميق في مجال السيطرة المثلى ليس حلاً للحلول، بل يجب التصدي للعديد من التحديات الهامة قبل الانتشار الواسع النطاق في النظم الحيوية للسلامة.
السلامة والسطو
(ب) يمكن أن تتصرف الشبكات العصبية دون مبرر خارج نطاق توزيع التدريب، وقليل من الاضطرابات في الدولة - سواء بسبب ضوضاء أجهزة الاستشعار أو مدخلات الخصم أو التغيرات البيئية غير المتوقعة - قد يتسبب في قيام الشبكة بعمل رقابة ينتهك القيود أو يزعزع استقرار النظام، وهذا الافتقار إلى ضمانات رسمية يشكل عائقاً رئيسياً أمام اعتماد تطبيقات مثل شبكات القيادة المستقلة أو الروبوتات الطبية(10).
القابلية للترجمة
فالضبط الأمثل التقليدي يوفر نظرة واضحة: فالحل يمكن أن يُعاد إلى وظيفة التكلفة، والقيود، والديناميات، والشبكات العميقة، على النقيض من ذلك، غير مكتملة، فهما لما تختاره الشبكة من عمل معين صعب، مما يعقِّد التشويه، والتصديق، والموافقة التنظيمية، والنُهج الهجينة التي تجمع بين النماذج الفيزيائية والعناصر المتعلِّقة، تهدف إلى الحفاظ على التفسير حيثما يكون أكثر أهمية.
متطلبات البيانات والتعميم
ويقتضي الإشراف على التعلم مجموعة بيانات تمثيلية كبيرة من الحلول المثلى، ويمكن أن يكون توليد هذه البيانات باهظ التكلفة من الناحية الحسابية، ولا يمكن للشبكة الناتجة إلا أن تؤدي أداء جيداً في الدول التي تشبه تلك الواردة في مجموعة التدريب، كما أن التعلّم من أجل تعزيز البيانات الجاهزة، بل قد يتطلب الملايين من التفاعلات مع محاكاة قد تكون بطيئة أو غير دقيقة، كما أن النظم التي تحافظ على معايير المحاكاة العشوائية لا تؤدي إلى تحسين أثناء التدريب.
التكلفة الحاسوبية للتدريب
وفي حين أن الاختبار رخيص، فإن التدريب على شبكات عميقة لمهام المراقبة يمكن أن يكون كثيفا للوقت وغيابا للموارد، وقد يتطلب التدريب على سياسة واحدة لنظام معقد أياما من وقت الاتحاد العالمي للأخشاب، وهذه التكلفة مقبولة بالنسبة للمنتجات المنتجة على نطاق واسع (مثلا، أجهزة التحكم المستقلة في المركبات) ولكنها قد تكون باهظة بالنسبة للنظم الجمركية، ونظم غير أن التعلم في مجال النقل والتعلم من الباطن يتيح سبلا لإعادة استخدام النماذج السابقة للتدريب.
الاتجاهات المستقبلية والنهج الهجينة
والطريق الأكثر واعدة إلى الأمام يكمن في الجمع بين قوّة النظرية التقليدية للتحكم الأمثل والتعلم العميق، بدلا من معاملتها على أنها حصرية على بعضها البعض، وتوضح عدة اتجاهات ناشئة هذا التوليفي.
الشبكة العصبية
وبدلاً من استخدام شبكة عصبية لتوليد عملية المراقبة مباشرة، يمكن للمرء أن يستخدم شبكة جديدة كنموذج ديناميكي تقريبي أو كمعجل للمذيب نفسه، مثلاً، يمكن أن يوفر نموذجاً متعلماً بديلاً دقيقاً وسريعاً لتقييم الديناميات الحقيقية، مما يمكّن من إدارة البرمجيات المتعددة الكلور من إدارة آفاق أكثر صرامة، ويقلل من سرعة التلقيح، ويؤثر على نحو فعال في التقارب بين المقاييس.
التعلم من أجل الترضية المقنعة
ومن العقبات الرئيسية فرض القيود (مثل تجنب العقبة والحدود المفروضة على العذاب) في سياسة عصبية، ويشمل العمل الأخير مهام الحاجز ] أو ] طبقات الإسقاط في هيكل الشبكة، بما يكفل أن تكون طرق التمثيل الرسمي للشبكة متوافقة دائما مع قيود السلامة المحددة.
التعليم في مجال تعزيز الأمن
ولا تعتبر الخوارزميات الحالية المتعلقة بسيادة القانون في كثير من الأحيان السلامة عقوبة غير مخففة، وستدمج الأساليب المقبلة القيود الصارمة في الإنفاذ أثناء الاستكشاف والارتقاء الأمثل، مما سيمكن من استخدام القانون التجاري في سيناريوهات ذات مقتنيات عالية.() وتكنولوجيات مثل ]] مُقيدة في عمليات قرار ماركوف و البحث الحقيقي غير القابل للتطبيقات:
التعلم من مرحلة التعليم من مرحلة إلى مرحلة التعليم من مرحلة الاستشعار إلى مرحلة المُضيّق
وبدلا من أن تكون هناك وحدات منفصلة للتصور وتقديرات الدولة والمراقبة، تهدف التعلم من نهاية إلى نهاية المطاف إلى رسم خرائط مباشرة لبيانات الاستشعار الخام إلى القيادات المنخفضة المستوى، وفي حين أن هذا النهج ينطوي على تحديات، فإنه يمكن أن يبسط هيكل النظام ويزيل الأخطاء المتفاقمة، وتدل التجارب الناجحة في سباق الطائرات بدون طيار والحركة المستقلة على أن التحكم النهائي يمكن أن يضاهي أداء النظم النموذجية أو يتجاوزه، ويوفر بيانات كافية وقيمتها.
خاتمة
فالتعليم العميق يؤدي إلى تحويل السيطرة المثلى من الانضباط المكثف من الناحية الخارجية إلى عامل تمكيني في الوقت الحقيقي للنظم المستقلة، ومن خلال زيادة التقريب بين المهام، يمكن للشبكات العصبية أن تستنسخ السياسات المثلى مع إدخال تحسينات سريعة كبيرة، وفتح إمكانيات في مجال الروبوتات والفضاء الجوي والطاقة وما بعده، ومع ذلك فإن الطريق إلى الاعتماد الكامل مهيأة مع التحديات: ضمانات السلامة، والتفسير، وكفاءة البيانات، تظل العقبات الحاسمة التي يمكن أن تُتَزُها.
لمزيد من القراءة، النظر في الكتاب المدرسي لـ "نظرية التحكم في الثدي: مقدمة" من دونالد كيرك أو مقالة الدراسة الاستقصائية "التعلم الجاد من أجل التحكم الأمثل" المنشور في مجلة نظم الرقابة التابعة للشبكة، وهذه الموارد توفر أسسا رياضية أعمق ومقارنات مفصلة للخوارزم.