Table of Contents
مقدمة: الازدحام الحضري والوعد بالمكافحة التكيفية
وقد أصبح ازدحام المرور تحدياً محدداً للحياة الحضرية الحديثة، ووفقاً لـ 2023] IRIX Global Traffic Scorecard]، فقد السائقون في الولايات المتحدة متوسط 51 ساعة في السنة للازدحام، مما كلف الاقتصاد أكثر من 81 مليار دولار، فبعد مضي الوقت، تنتج المركبات المتردية كميات غير متناسبة من الانبعاثات الضارة، وتدني نوعية الهواء، وتساهم في تطور الطلب التقليدي على الضوضاءل
فالتعلُّم في مجال الإنفاذ، وهو مجال فرعي للتعلم الآلي يُعلِّم العملاء على اتخاذ قرارات متعاقبة عن طريق المحاكمة والخطأ، يتيح حلاً قاهراً، بدلاً من الاعتماد على قواعد ثابتة أو معايير مدروسة يدوياً، تُراعى النظم القائمة على القانون التجاري باستمرار ظروف المرور، واختيار توقيتات الإشارة، والتعلم من النتائج لتحقيق أقصى قدر من القياسات مثل متوسط التأخير، وطول حركة المرور، ومن خلال التوثيق.
ما هو التعلّم في مجال تعزيز؟
وفي جوهرها، فإن التعلم في مجال التعزيز هو إطار لتعلم السلوك الأمثل من خلال التفاعل مع بيئة ما، وفي هذه الحالة، يتخذ المسؤول عن مراقبة حركة المرور إجراءات تغير حالة البيئة، وبعد كل إجراء، يتلقى الوكيل جائزة رقمية (سواء كانت أو سلبية) وينتقل إلى دولة جديدة، وعلى مدى العديد من الأحداث، يتعلم الوكيل رسماً للسياسة العامة من الولايات إلى إجراءات تعظيم المكافأة التراكمية.
Formally, RL is often modeled as a Markov Decision Process (MDP), defined by a set of states, actions, transition probabilities, and rewards. Key RL paradigms include:
- Model-free RL] (مثل التعلم الرباعي والشبكات العميقة): يتعلم الوكيل مباشرة وظيفة أو سياسة قيمة دون أن يُنمّذ صراحة ديناميات البيئة، وهذا النهج مناسب تماما لمجالات المرور التي يصعب فيها بناء نماذج محاكاة دقيقة.
- Model-based RL]: يتعلم الوكيل أولا نموذجا للبيئة (مثلا، كيف تتغير تدفقات المرور استجابة لتغيرات الإشارات) ثم يستخدم ذلك النموذج لتخطيط الإجراءات، ويمكن أن يكون ذلك أكثر كفاءة من حيث العينة، ولكنه يتطلب معالجة دقيقة لحالات عدم الدقة النموذجية.
- Policy gradient methods] (مثل PPO, A2C): These directly optimize the policy by adjusting action probabilities based on experienced rewards. They naturally handle continuous action spaces and are often used in complex multi-agent settings.
وقد كانت الزيادة في الشبكات العصبية المتاخمة لجرائم RL-combining neural networks with RL algorithms-has ذات تحول خاص، وقد تقارب الشبكات العصبية الحيز الحكومي العالي الديموقراطية، مثل تغذية الفيديو الخام من كاميرات المرور أو بيانات الاستشعار المجمعة من مئات أجهزة الكشف.
How Reinforcement Learning Optimizes Traffic Signal Timing
ويعمل نظام لمراقبة إشارات المرور على أساس RL في دورة مستمرة من ] [العمل ⁇ مكافأة على التعلم ].() وفي كل تقاطع، يرصد النظام ] [FLT:]]، الذي قد يشمل:
- عدد المركبات التي تنتظر في كل مسار (طول الطول)
- الزمن الذي انقضت منذ تغير المرحلة الأخيرة
- سرعة وشغل المركبات المتجهة
- طلبات عبور المشاة
- وقت الأنماط النهارية والتاريخية
واستناداً إلى هذه الحالة، يختار الوكيل إجراء : قد يختار تمديد المرحلة الخضراء الحالية، أو التحول إلى مرحلة مختلفة، أو إدخال فترة تطهير شاملة، أما الإشارة ] إلى ] إلى جانب نهج المكافأة النهائية، فتعاقب على فترات الانتظار، وعدد التوقف.
وعلى مدى آلاف من الحلقات المحاكاة أو الواقعية، يعدل وكيل الجمهورية معالمه الداخلية (مثلاً، أوزان شبكة عصبية) لتحقيق أقصى قدر ممكن من المكافأة التراكمية المتوقعة. ومن الناحية النظرية، لا يتعلم النظام مجرد جدول زمني ثابت بل قد يُعتمد على سياسة يعتمد عليها المحتوى : أثناء حدوث زيادة مفاجئة في حركة المرور من حدث مُخصص لا لـه،
تصميم الدولة في الممارسة العملية
وتتوقف نوعية عامل من عوامل القانون التجاري اعتماداً شديداً على الطريقة التي تمثل بها الدولة، ويجب إدراج مفاهيم منفصلة مثل " الاتجاهات " و " أوقات الانتظار " في سمات رقمية، وتشمل عمليات التنفيذ المتقدمة ] الشبكات العصبية لنموذج أعلى مستوى للتداخلات وربط الممرات، مما يتيح للعامل أن يبدي أسباباً بشأن العلاقات المكانية عبر شبكة من الولايات.
أماكن العمل: منفصلة ضد مستمرة
وقد استخدمت نظم المرور في مرحلة مبكرة إجراءات منفصلة - على سبيل المثال، اختيار أحد أربعة تسلسلات زمنية ممكنة، غير أن النهج الحديثة كثيرا ما تستخدم [(FLT:0]) أماكن عمل مستمرة ، حيث يؤدي العامل مباشرة إلى تحقيق مدة كل مرحلة، مما يوفر مراقبة أفضل ويمكن أن يتكيف مع التغيرات التبعية في عبء حركة المرور.
Multi-Agent and Hierarchical RL
ويحتاج توسيع نطاق القانون الإقليمي ليشمل الشبكات على نطاق المدينة إلى أكثر من وكلاء مستقلين في كل تقاطع، ويمكن أن يخلق العاملون غير المنسقون سياسات متضاربة - يمدّدون أحد العناصر بمرحلة خضراء بينما يخلق عامل في المرحلة النهائية عقبة أمام ذلك، وقد طور الباحثون ]] عوامل تعزيز متعددة الأطراف [محاربة العنف] أطراستخدامات في سياسات مخفية.
الفوائد الرئيسية للتعلم في مجال تعزيز إشارات المرور
وتتسم مزايا القانون الإقليمي على الرقابة التقليدية الثابتة الوقت أو المجهزة بكثافة، وقد تم التصديق عليها في كل من المحاكاة والمحاكمات الميدانية.
الاستجابة في الوقت المناسب وفي الوقت الحقيقي
وعلى عكس أجهزة التحكم السابقة التوقيت، فإن وكلاء القانون الإقليمي يتكيفون بشكل دينامي مع الظروف السائدة في الوقت الحقيقي، ويمكنهم الاستجابة للأحداث الخاصة، مثل الحفلات الموسيقية أو الحوادث أو التباطؤ المتصل بالطقس، دون تدخل يدوي، وفي مشروع تجريبي في Pittsburgh باستخدام نظام SURTRAC ، خفضت الرقابة على التكيف القائمة على RL بنسبة 25 في المائة والوقت.
انخفاض الاكتظاظ والتأخير
ونظراً لأن القانون RL يُمثل أفضل القياسات مثل التأخير الكلي وطول التساؤلات، فإنه يتفوق باستمرار على المنطق القائم على القواعد، وقد خلص استعراض شامل نشر في الجزء جيم من بحوث النقل إلى أن النظم القائمة على القانون RL حققت تحسناً متوسطياً بنسبة 18 في المائة في متوسط التخفيض في التأخير في 30 سيناريوهات محاكاة في العالم الحقيقي، وفي عمليات الانتشار في المدن مثل فترة الذروة في هانغزو.
جيم - المكاسب البيئية والاقتصادية
ويقل استهلاك الوقود وانبعاثاته، إذ تقدر وزارة الطاقة في الولايات المتحدة أن التحكم في الإشارات التكييفية يمكن أن يقلل استهلاك الوقود بنسبة تصل إلى 15 في المائة في الشبكات الحضرية الكثيفة، ويواصل هذا الأمر عن طريق زيادة الاستفادة المثلى من المكافآت المتصلة بالانبعاثات، فعلى سبيل المثال، يمكن تدريب عامل من عوامل RL على تقليل انبعاثات ثاني أكسيد الكربون والثديوكس المتراكمة عن طريق تفضيل توقيتات التي تقلل من حركة المرور على نحو توقف وبدء في العمل.
القابلية للتسويق والقابلية للتحويل
وبمجرد تدريب سياسة القانون الإقليمي على المحاكاة، يمكن في كثير من الأحيان أن تُعدَّل وتُنشر على مختلف القطاعات المماثلة مع الحد الأدنى من إعادة التشكيل، وهذه القدرة على التصعيد ميزة كبيرة على نظم التكيف المصممة يدويا والتي تتطلب معايرة واسعة لكل موقع، وعلاوة على ذلك، يمكن لنماذج القانون الإقليمي أن تدمج مصادر إضافية للبيانات، مثل مسارات المركبات ذات الصلة أو نظام تحديد المواقع الهاتفية المحمولة، لزيادة تعزيز الأداء دون وجود أجهزة مجهزة.
التحديات والحدود
ورغم وعدها، فإن نشر القانون الإقليمي لمراقبة إشارات المرور على نطاق واسع يواجه عقبات كبيرة.
الاحتياجات من البيانات والمصنوعات
وتتطلب عوامل RL ملاحظات عالية التردد وموثوقة، ومعظم المدن تفتقر إلى التغطية الشاملة لأجهزة الاستشعار؛ وقد تكون أجهزة كشف النوافذ متفرقة أو متقادمة، ويمكن أن تتأثر الكاميرات بالطقس أو الإضاءة، ويمكن أن يعوض التدريب المبسّط جزئيا، ولكن ]) تظل الفجوة بين الأطراف والقابلية للفهم تشكل تحديا.
السلامة والسطو
وترتب على إشارات المرور آثار على السلامة على الحياة، إذ أن هناك عامل من عناصر حركة المرور يقوم بعمل خاطئ - مثل إنهاء مرحلة المشي على المشاة قبل الأوان أو تغيير أحمر من أجل متناقضة - يمكن أن يسبب حوادث، وضمان السلامة أثناء التعلم والنشر أمر بالغ الأهمية.
- Safe RL]: إدراج القيود في عملية تحقيق الحد الأمثل (مثلاً، عبر أساليب لاغرانغيان) لضمان عدم انتهاك بعض العتبات (مثل الحد الأقصى للوقت الأحمر).
- Shadow-mode deployment]: Where the RL agent’s recommendations are first compared against a rule-based safe fallback before execution.
- Formal verification]: Using mathematical tools to prove that the learned policy will not produce unsafe states within a given environment model.
النفقات العامة للحساب والاتصال
وتحتاج نماذج القانون العام العميق، ولا سيما تلك التي تستخدم شبكات الظواهر العصبية التي لها ملايين البارامترات، إلى موارد محاسبية كبيرة لكل من التدريب والاختبار، وتُجري عملية استطلاع كل بضع ثوان في مئات من التقاطعات تتطلب أجهزة حافة ذات قدرة كافية على التجهيز، وبالإضافة إلى ذلك، يعتمد التنسيق المتعدد الوكلاء على الاتصالات المنخفضة الدقة بين المتحكمين، التي قد لا تكون متاحة في الهياكل الأساسية القديمة، وتُحدث الحلول القائمة على الكلاود درجة من التساهل والضعف في الشبكات.
الترجمة الشفوية والثقة
وكثيراً ما يُراقب مهندسو النقل وموظفو المدن نظماً ذات نطاق أسود من أجهزة الاستخبارات الجوية، فهماً لما اختاره وكيل من موظفي RL توقيتاً محدداً، ومع ذلك فإن الثقة ضرورية للموافقة عليها، فالبحث الأخير في ] يمكن تفسيره، ويهدف إلى إنتاج خرائط جانبية ممتدة أو تفسيرات مضادة للضغوط تبرز سمات المرور التي تؤثر على القرار.
المستقبل
ويتطور هذا المجال بسرعة، ويجري استكشاف عدة طرق واعدة للتغلب على القيود الحالية.
دمج المركبات في كل مركبة )V2X(
ويمكن للمركبات المرابطة أن تبث موقعها وسرعة وصولها في الوقت الحقيقي، ويمكن للعوامل ذات الصلة باستخدام هذه البيانات الجمردية لتوقع أنماط المرور قبل ثوان، مما يتيح توقيتاً استباقياً للإشارة التي تشكل مسارات فردية، وقد أظهر العمل المبكر من جامعة ميشيغان V2X التي تم اختبارها أن نسبة المدخلات من الأشعة دون الفوقية إلى 35% من البيانات المخففة من التأخير في التقاطع.
النموذج RL والهيجين
وكثيراً ما يتطلب تحرير نظام RL النقي ملايين التفاعلات قبل التقارب، فالنموذج القائم على القانون النموذجي، الذي يتعلم نموذجاً وبيئياً مبسطاً وخططاً داخله، يمكن أن يقلل بدرجة كبيرة من تعقيد العينات، حيث يمكن للهيكل الهجين الذي يجمع بين نموذج متعلم للتنبؤ وسياسة التنفيذ الخالية من النماذج أن يظهر أحدث النتائج في نقاط مرجعية مثل ) لطرق التدريب الحقيقية [FL:1].
Edge AI and Federated Learning
(أ) أن إجراء عملية استطلاعية على أجهزة الحافة (مثلاً، قرص فرنبيري أو طائرة تابعة لشبكة نفيسيدا ملحقة بكل خزانة حركة المرور) يزيلان من أعالَم السحاب ويقللان من درجة اللياقة، ويتيح التعلم الموحد للعوامل المتعددة الأطراف المؤثرة أن تقوم بالتعاون على نموذج مشترك دون إضفاء الطابع المركزي على بيانات الحركة الأولية، مع الحفاظ على الخصوصية، وهذا النهج جذاب بشكل خاص للمدن ذات سياسات صارمة لإدارة البيانات.
التعلم في مجال النقل والتعلم عن طريق الميثان
وبدلا من تدريب كل تقاطع من الخدش، يمكن للتعلم عن طريق النقل أن يعيد توجيه سياسة من تقاطع إلى آخر مع أنماط مماثلة من الهندسة والحركة، ويأخذ التعلم عن طريق الميثان هذا الأمر أكثر: إذ يتم تدريب الوكيل على عشرات من التقاطعات المحاكاة بحيث يمكن أن يتكيف مع تقاطع جديد مع بضع دقائق من البيانات الحية، مما يقلل بدرجة كبيرة من الوقت اللازم للتعيينات الجديدة.
نظم المراقبة والنظافة الإنسانية
ولتناول الشواغل المتعلقة بالسلامة، يمكن أن تدمج النظم المقبلة مشغلا بشريا يمكنه تجاوز إجراءات المسؤولية عن الحماية عند الضرورة، وستؤدي التفاعلات المتقدمة بين المستعملين إلى تصور الأسباب التي تفسر العميل (مثل تطور حركة المرور المتوقع في إطار إجراءات مختلفة) ويتيح للمهندسين وضع قيود غير متساهلة، ويمكن مع مرور الوقت، نظرا لأن النظام يثبت موثوقيته، تخفيض مستوى الرقابة اليدوية.
خاتمة
ويمثل التعلُّم من أجل تعزيز القدرات تحولاً في توقيت الإشارة إلى حركة المرور من الجداول الثابتة والقواعد الرجعية البسيطة إلى سياسات التكيف التي تُوجَّه البيانات وتحسن باستمرار، والأدلة المستمدة من عمليات المحاكاة والمشاريع التجريبية والنشر المبكر مُلحة: يمكن للشبكة أن تُحدِّد التأخيرات وتخفض الانبعاثات وتعزز الكفاءة العامة لشبكات النقل الحضري، ومع ذلك فإن الطريق إلى الاعتماد الواسع النطاق مُمهد بتفسير التحديات المحيطة بنوعية البيانات وسلامتهاًاًاً وقابليةًاًاًاًاًاًاًاًاً.
ومع تقدم البحوث - وبشكل خاص في التنسيق المتعدد العناصر، فإن التعلم القائم على النموذج، والاندماج مع المركبات ذات الصلة - يجري تخفيض باطراد، كما أن المدن التي تستثمر اليوم في البنية التحتية اللازمة للاستشعار، والقدرات الحاسوبية الحادة، والخبرة الفنية في مجال البحث والتطوير ستكون في موقع جيد لجني مكافأة التحكم في حركة المرور الذكية حقا، والرؤية التي تتدفق فيها حركة المرور بسلاسة على الرغم من تذبذب الطلب ليس هدفا بعيد المنال.