وتُعد عجلات الرد ذات أهمية حاسمة في مراقبة مواقف المركبات الفضائية، مما يوفر تغييرات دقيقة في التوجه دون استهلاك الوقود، وتعتمد نُهج الرقابة التقليدية على النماذج المتوازية والمقارنات المميِّزة المتناسبة، ولكن التعقيد المتزايد للبعثات الحديثة التي تُجرى من مراقبة الأرض المتباعدة إلى قياسات التداخل في الفضاء العميق، التي يمكن أن تتكيف مع ديناميات الاضطرابات غير المباشرة.

أساسيات مكافحة العجلات الرهينة

وعجلة تفاعل هي أداة لتبادل الزخم: فمع تتسارع عجلة القيادة، فإنها تمارس ضربة على جسم المركبة الفضائية، وتدور حول محور العجلات، وينظم النظام الحفاظ على الزخم المتكرر، ويعادل الانسداد الصافي الذي يُطبق على المركبة الفضائية آثار العجلات التي تصيب تسارعها، ومعظم تركيبات العجلات العجلات التي تستخدم ثلاث أوتار.

وتستخدم هياكل الرقابة الكلاسيكية عادة سلسلة من حلقتين: حلقة خارجية لتحديد المواقف (تستخدم أجهزة تتبع النجوم، أو أجهزة الاستشعار الشمسي، أو أجهزة قياس الجروسكوب) وحلقة داخلية لتنظيم سرعة العجلات، وكثيرا ما تستخدم الحلقة الداخلية جهازا لمراقبة PID يتولى قيادة الفولط المحركات على أساس الخطأ بين السرعة المرغوبة والفعلية للعجلات، وفي حين أن مراقبة PID بسيطة ومفهومة جيدا، فإن لها عيوب كبيرة:

  • إنها تفترض التسلسل، ومع ذلك فطيرة العجلات، وخلفية العجلات، والتشبع غير خطيّة بقوة.
  • ولا يمكنها التكيف مع التغيرات في الممتلكات الجماعية للمركبات الفضائية (مثلا بعد استنفاد الوقود أو نشر الحمولة).
  • وهو يقدم رفضا محدودا للاضطرابات الخارجية غير المعروفة (ضغط الإشعاع العازل، تدرج الجاذبية، الاضطرابات المغناطيسية).
  • ولا يستغل المعارف المتعلقة بالمجالات المتعلقة بالحركة أو القيود التي تواجه الملجأ في المستقبل، مما يؤدي في كثير من الأحيان إلى ارتداء غير ضروري واستهلاك طاقة عالية.

وهذه القيود تحفز البحث عن قوانين أكثر ذكاء في مجال الرقابة، والتعلم في مجال الآلات، وقدرتها على وضع خرائط معقدة ووضع سياسات مثلى من البيانات، هو مرشح طبيعي.

Machine Learning Paradigms in Reaction Wheel Control

كما أن التعليم المعزز والشبكات العصبية والتعلم العميق هي الفئات الثلاث الأكثر نشاطاً في مجال مراقبة المواقف، كما أن أساليب إضافية مثل العمليات الغوسية وأجهزة دعم ناقلات الأمراض تظهر أيضاً في الأدبيات ولكنها لم تشهد سوى تراثاً أقل في الرحلات الجوية.

تعزيز التعلم من أجل البحث عن السياسات على الوجه الأمثل

وفي القانون RL، يكون المراقب عاملا يتفاعل مع سرعة العجلات المتغيرة في بيئة المركبات الفضائية ويتلقى تعليقات في شكل إشارة مكافئة (مثلا، خطأ المواقف السلبي مربوط ناقصا مدة لجهد السيطرة) ويتعلم الوكيل سياسة تحدد (خطورة، سرعة العجلات، سرعة العجلات) على الإجراءات (قواعد التعبئة (قواعد الطول) لتعظيم المكافأة التراكمية (منشورت) (منت)

  • Model-free RL] (مثلاً، تحقيق الاستفادة المثلى من السياسات الافتراضية) يتعلم مباشرة من التجارب والأعجوبة دون الحاجة إلى نموذج تحليلي للمركبات الفضائية، وهذا جذاب بالنسبة للنظم التي يصعب فيها وضع النماذج الدقيقة، ولكن اشتراط البيانات المرتفع يشكل تحدياً.
  • Model-based RL] first learns a dynamics model from flight data, then uses the model to plan control actions. This reduces data hunger and can accelerate training in simulation.
  • Safety constraints ]: Standard RL does not guarantee bounded wheel speeds or avoid saturation. Recent advances in constrained policy optimization (e.g., Lagrangian methods) are being adapted for spacecraft, as described in NASA JPL's work .

الشبكات العصبية للنماذج الدينامية والمراقبة العكسية

وتُستخدم الشبكات العصبية في وظائف غير خطية تقريبية، وفي مراقبة عجلات الرد، بطريقتين رئيسيتين:

  • Forward modeling]: A neural network trained on telemetry data predicts the next state (attitude, wheel speed) given the current state and control action. This learned model can be used in a model predictive control (MPC) framework, where the opt sequence of volturalization is computed over a horizon by solving a optmerical optimization problem.
  • Inverse modeling (or direct torque estimation)]: A neural network takes desired torque as input and outputs necessary wheel acceleration commands, effectively learning the inverse dynamics of the reaction wheel assembly. This is especially useful when the system has uncertain friction or inertia variations.

A 2023 study in the ] Journal of Guidance, Control, and Dynamics] (]link) showed that a feedforward neural network trained on high-fidelity simulation data reduced wheel speed variation by 30% compared to a tuned PID controller during a typical Earth observation scenario.

التعلم العميق من أجل كشف الشذوذ والسيطرة على التغاضي

إن هياكل التعلم العميق - وخاصة أجهزة التلقائية وشبكات الذاكرة القصيرة الأجل الطويلة الأجل، والمتحولون - يجري نشرها لكشف الأخطاء الوشيكة في عجلات الرد، وبتعلم الأنماط العادية لعجلات العجلات، والسرعة، ودرجة الحرارة، يمكن أن تُظهر نماذج عميقة انحرافات تدل على حدوث تدهور أو فشل وشيك، ويمكن أن يؤدي الناتج إلى التحول إلى استراتيجية أكثر تحفظاً أو إعادة تشكيل لا رجعة فيها.

فعلى سبيل المثال، أثبت الباحثون في وكالة الفضاء الأوروبية (]ESA Clean Space) أن نظام كشف الأخطاء القائم على الترميز يمكن أن يحدد أوجه الاختلال في التوازن في العجلات حتى ثلاث مدارات قبل أن تصبح حاسمة، مما يتيح إجراء تعديلات استباقية في المواقف تمنع توقف البعثة.

ألف - مزايا مكافحة العجلات الرسوبية

ويتيح التحول من خوارزميات البنية الثابتة إلى السياسات العامة المتعلمة عدة فوائد قابلة للقياس تكون ملزمة لكل من عمليات الطبخ المنخفضة التكلفة والبعثات الرئيسية.

تعزيز القدرة على التكيف مع الديناميات غير المأهولة

ونادرا ما تتصرف المركبة الفضائية على نحو ما هو متوقع على الأرض، فالألواح الصمامات، والسيارات الشمسية، والهستيروس الحراري، والهيستيريز المغنطيسي، تؤدي إلى اضطرابات تحد من نماذج شبه قياسية بسيطة، ويمكن أن تعدل الخوارزميات المتعددة الكلور تلقائيا سلوكها استنادا إلى ملاحظات في الوقت الحقيقي، وعلى سبيل المثال، يمكن أن يصقل العاملون في مجال التعلم المعزز باستمرار سياستهم أثناء البعثة، وينفذون بفعالية التكيف على الإنترنت دون رصد.

تحسين كفاءة الطاقة والحد من الأعطال

التحكم في العجلات هو أحد المستهلكين الرئيسيين للطاقة الكهربائية الموجودة على متن الطائرة، ويميل المتحكمون التقليديون في أجهزة PID إلى تجاوز العجلات، مما يتسبب في سرعة التسارع والتباطؤ في استخدام الطاقة المستعملة ويعجلون بحملها.

سرقة جهاز الاستشعار ونسخة الطعام المفقودة مؤقتا

ويمكن تدريب الشبكات العصبية العميقة على بيانات أجهزة الاستشعار المزعجة بل ويمكنها أن تؤدي تقديراً ضمنياً، وتستغل المذاهب مثل هذه المركبات الروابط الزمنية للتصفير من الضوضاء على القياس، كما أن سياسة السحب التي يتم تدريبها على المحاكاة في إطار سيناريوهات التسرب من أجهزة الاستشعار يمكن أن تتعلم السواحل على الملاحظات السابقة، وتحافظ على استقرار المواقف لعدة ثوان دون تحديثات.

التحديات وأوجه التنفيذ

وعلى الرغم من الوعد، فإن إدماج القانون النموذجي في نظم المراقبة التي تُقدر على الطيران يواجه حواجز هندسية وتنظيمية كبيرة، ويجب التصدي لهذه التحديات قبل أن تصبح مراقبة عجلات الرد التي تحركها حركة تحرير الكونغو ممارسة معيارية.

سجّالة البيانات وقفزة من القاع إلى الصل

ومن الصعب جمع مجموعات كبيرة من البيانات الملصقة من عمليات العجلات الحقيقية للرد على المركبات الفضائية لأن قياسها عن بعد متباعد التكلفة ويحصل عليه، ولذلك فإن معظم نماذج حركة التحرير المتعددة الجنسيات مدربة على محاكاة عالية القيمة، ولكن الفجوة بين المحاكاة والواقع )مشكلة " من أجل الواقع " ( قد تؤدي إلى ضعف الأداء عندما يواجه النموذج ظروفاً غير متوقعة.

وقد استطلع العمل الأخير تعلم النقل: التحفيز في المحاكاة، ثم الضبط الدقيق على كمية صغيرة من بيانات الرحلات الجوية الحقيقية، غير أن حواسيب الطيران كثيرا ما تفتقر إلى قاعة رأس حاسوبية لإجراء تقييم دقيق أثناء البعثة، بحيث يجب تجميد النموذج قبل الإطلاق، والخيار هو استخدام نظام RL النموذجي مع تحديد النظام على الإنترنت، ولكن ذلك يزيد من تعقيده.

القيود الحاسوبية للمجهزين على متن السفينة

كما أن مجهزي الصف الفضائي - مثل الرادغا 750 أو الجيل الجديد من الـ 740-الطاقة الحسابية أقل بكثير من وحدات البارافينات المكلورة الأرضية أو وحدات الإزالة، والشبكات العصبية العميقة التي تبلغ ميزانيتها ملايين البارامترات، والتحدي يتمثل في تصميم بنية ذات حجم وزن خفيف يمكن أن تدار في الوقت الحقيقي (حلقة التحكم في العجلات 10) دون تجاوز حدود البرمجيات، وتقية، وتفكيكات مثل التحلل الكمي.

التحقق والتصديق

وتتطلب صناعة الفضاء ضمانات أمان يمكن التنبؤ بها لوظائف الرقابة الحرجة، فالجرائم الملغومة هي أساسا صناديق سوداء: إذ يُعرف سلوكها وليس مستمدا تحليليا، إذ إن تحديد أن جهاز مراقبة الشبكات العصبية لن يسبب أبدا عجلات للرد على المركبة الفضائية أو يقودها إلى نمط غير قابل للاسترداد، أمر بالغ الصعوبة، إذ توجد أدوات للتحقق الرسمي للشبكات العصبية (مثلا، (Murlexa, Relup).

ولم تُصدر الهيئات التنظيمية مثل ناسا ووكالة الفضاء الأوروبية بعد معايير رسمية للضوابط القائمة على القانون النموذجي في البعثات المأهولة أو ذات القيمة العالية، ومن المرجح أن يحدث القبول الإضافي أولا في حمولات ثانوية أو في مجموعات من الكيبسات منخفضة التكلفة، حيث يكون التسامح إزاء المخاطر أعلى، وبالنسبة للمركبات الفضائية المكتظة، وهو نهج هجين يلغي فيه جهاز مراقبة احتياطي كلاسيكي ناتج ML إذا تجاوز مسارات الأمان القابلة للاستمرار.

التفسير والتشخيص

وعندما ينتج متحكم معتمد على حركة تحرير الكونغو قيادة غير متوقعة، يتعين على المهندسين فهم السبب، إذ يمكن لأساليب المحاسبة القابلة للتفسير (SHAP, LIME, integrated gradients) أن تنسب القرارات إلى سمات المدخلات، ولكنها تضيف رأساً إضافياً حاسوبياً ولا يمكن الاعتماد عليه بعد في سياقات حرجة للسلامة، وإلى أن يتم تحليل الأسباب الجذرية بثقة، سيظل العديد من مخططي البعثات مستقلين تماماً.

المستقبل توجيهات وجبهة البحوث

ومن المرجح أن يشهد العقد المقبل ضخا تدريجيا ولكن مطردا لمعدلات الطول في مراقبة عجلات الرد، مدفوعة بتقدم في كل من الخوارزميات والمعدات.

الهيكل الهجيني للتحكم

ويتمثل النهج العملي الأكثر في إدماج القانون النموذجي في إطار الرقابة التقليدي، فعلى سبيل المثال، يمكن لمراقبي PID أن يحصل على مكاسب التكيف التي تُحسب من خلال شبكة عصبية صغيرة تُدرَّب للتقليل إلى أدنى حد من قياس الأداء، وكبديل لذلك، يمكن لجهاز مراقبة التنبؤ النموذجي أن يستخدم نموذجاً دينامياً مستفاداً من التنبؤات، مع الحفاظ على المذيب الأمثل من خلال القيود الصعبة.

التعلم المستمر

وقد تشمل مجهزو الفضاء في المستقبل معجلات مكرّسة لجرائم متعددة الأطراف تسمح لطبقة التحكم بالسير وتحديث نفسها أثناء البعثة، وقد تتيح برمجيات التعلم المستمر القائمة على توحيد الوزن الفائق أو الشبكات العصبية التدريجية للمراقب التكيف مع الاضطرابات الجديدة دون نسيان السلوكيات التي سبق تعلمها، وهذا مجال بحث نشط، ويتوقع أن يُجرى أول مظاهرة في المدار في بعثة من كومبيسات في غضون السنوات الخمس المقبلة.

التدريب على أساس المحاكاة والتوائم الرقمية

A High-fidelity digital twins of reaction wheel assemblies-incorporating thermal effects, micro-vibration, andميكانيكي wear-are being developed to supply virtually unlimited training data. Training can be performed entirely in simulation, then the policy is compiled into a light weight neural network for deployment. The U.S. Air Force Research Laboratory Reb Vehicle Directorate) has demonstrated this problem for

التكامل مع الرقابة الافتراضية النموذجية

وقد استخدمت بالفعل الرقابة النموذجية للتنبؤات على عدة مركبات فضائية لمناورات المواقف التي تتطلب معالجة مقيدة صريحة (مثلاً، القيود المفروضة على حماية الأدوات الحساسة) وتسمح الجمع بين نظام التخطيط المتعدد الوسائط ونموذج ديناميات متعلمة مغايرة بأن يكون الاستخدام الأمثل أكثر دقة وأن يعيد استخدام الحواسيب عبر مراحل زمنية، وتكمن التكلفة الحسابية للفيلق في الحاجز الرئيسي، ولكن الحلمات الحالية للرحلات الجوية هي التي تعمل على نظام المعلومات الوطني.

خاتمة

إن تعلم الآلات ليس حلاً وسطياً لتحكم عجلات التفاعل، ولكنه يوفر تحسينات ملموسة في القدرة على التكيف والكفاءة والتسامح إزاء الأخطاء التي تزداد الحاجة إليها بالنسبة للجيل القادم من المركبات الفضائية، وبما أن القدرات الحاسوبية على متن الطائرة ستنمو وتثبت من نضج منهجيات المحركات، فإننا نتوقع أن نرى التحكم في نطاقات السواتل العاملة بمساعدة من طراز ML في غضون السنوات الخمس إلى العشر القادمة، والسبب الرئيسي في النجاح يكمن في الاعتماد الإضافي: نشر نماذج للتحكم في مخاطر الضوء