robotics-and-intelligent-systems
معالجة البيانات المفقودة في المقرر تري ألغوريثم
Table of Contents
مقدمة
ومن ثم، فإن خوارزميات شجرة القرار تظل حجر الزاوية في التعلم الآلاتي لكل من التصنيف والانتكاس بسبب هيكلها غير الملائم، وإمكانية تفسيرها، وقدرتها على إقامة علاقات غير خطية نموذجية، غير أن مجموعات البيانات في العالم الحقيقي نادرا ما تكون واضحة؛ وكثيرا ما تتضمن قيما مفقودة ناجمة عن إخفاقات أجهزة الاستشعار، أو خطأ بشري، أو قضايا تكامل البيانات، أو عمليات إعادة التحيز في مجال البيانات، أو عدم اكتمال هذه النماذج.
فهم البيانات المفقودة
إن البيانات المفقودة ليست مشكلة موحدة، وتتوقف استراتيجية المناولة المناسبة على الآلية التي ولدت المفقودين، وقد صنف الإحصائيون البيانات المفقودة إلى ثلاثة أنواع متميزة، وكلها لها آثار مختلفة على التحليل.
مفقود تماما في راندوم (MCAR)
وفي إطار آلية الرصد والتحقق والتفتيش، فإن احتمال فقدان قيمة ما هو مستقل تماما عن البيانات الملاحظ منها وغير المراقَبة، فعلى سبيل المثال، يفشل جهاز مختبري في فترات عشوائية لا صلة له بالعينة قيد الاختبار، أو يغفل المدعى عليه عن طريق الخطأ سؤالا، أما " MCAR " فهو أسهل نوع لمعالجة البيانات التحليلية لأن البيانات الملاحظـة لا تزال عينة عشوائية تمثل مجموعة البيانات الكاملة المفقودة.
مفقودة في راندوم (MAR)
ويحدث هذا الوضع عندما يتوقف فقدان الدخل على المتغيرات الملاحظة وليس على القيم المفقودة نفسها، فعلى سبيل المثال، قد يكون الدخل في مجموعة بيانات تنطوي على مخاطر ائتمانية أكبر من احتمال فقدانه لمقدمي الطلبات الأصغر سنا (العمر الملاحظ) ولكن نظرا للسن، لا يعتمد الدخل المفقود على مستوى الدخل الفعلي، إذ أن العديد من أساليب السحب الموحدة يفترض أن تكون مميتة، كما أن التقنيات مثل الازدحام المتعدد أو تقدير أقصى الاحتمال لا تزال صالحة في هذا الافتراض.
مفقودة ليس في راندوم (MNAR)
وفي إطار برنامج " مانو " ، يرتبط احتمال فقدان القدرة بالقيمة غير الملاحظـة نفسها، ويكمن مثال كلاسيكي في الدراسات الاستقصائية للأجور: قد يرفض الأفراد ذوو الدخل المرتفع الكشف عن حصائلهم، مما يعني أن الفقد يرتبط ارتباطا مباشرا بالقيمة المفقودة (الدخل) وأن " MNAR " هو أكثر السيناريو تحديا لأن القيم المفقودة لا يمكن تقديرها بصورة موثوقة بدون معلومات خارجية أو أساليب نم خاصة (مثلا لاختيار نماذج الاختلاذكور).
تحديد أنماط البيانات المفقودة
وقبل اختيار طريقة مناولة، ينبغي للممارسين استكشاف نمط الفقد في مجموعات بياناتهم، وتشمل التشخيصات المشتركة ما يلي:
- Missingness heatmaps] -بصر نسبة القيم المفقودة لكل سمة وعينة.
- ]Little’s MCAR test] - a formal statistical test that indicates whether MCAR is plausible.
- Groupwise missingness statistics - compute the mean of observed features conditional on whether another feature is missing; large differences suggest MAR or MNAR.
ويرسي فهم الآلية الأساس لاختيار استراتيجية مناسبة للحساب أو النمذجة.
آثار البيانات المفقودة
ولا تزال هناك العديد من النهج الساذجة - مثل حذف القائمة (الإلغاء الفوري للجراح التي لها قيمة مفقودة) أو حذف الزوجات - تستخدم عمليا، ولكنها تأتي بتكاليف كبيرة:
- Reduced sample size] – – listwise deletion can discard a large fraction of the data, especially with many features, leading to high difference and low statistical power.
- Biased parameter estimates] - إذا لم يكن الاختفاء هو MCAR، فإن العينة المحتفظ بها لم تعد تمثل، وهذا التحيز يمتد مباشرة إلى شتات شجر القرار، مما يتسبب في عتبات غير صحيحة ونقاء العقد دون الأوقيانوغرافية.
- Loss of information] - features with missing values may be excluded from the divisionting logical altogether, wasting predictive signal that could have been used via surrogate splits or imputation.
- Inconsistent handling across trees] — ensemble methods like random forests may treat missing values differently in each base tree, yielding unstable predictions.
ويحسن العلاج المحسن للبيانات المفقودة الدقة والموثوقية، لا سيما في تطبيقات عالية الجودة مثل التشخيص الطبي، وتقييم المخاطر المالية، والصيانة المتوقعة.
أساليب الصنع التقليدية
إن الصنع - ملء القيم المفقودة بالقيم المقدرة - هو النهج الأكثر استخداماً، ويعتمد اختيار طريقة الادخار على نوع البيانات، وآلية الاختفاء، والميزانية الحسابية.
اختراع بسيط
وتستبدل أبسط التقنيات قيمة مفقودة بمتوسط أو طريقة القيم الملاحظـة لتلك السمة، وفي حين أن هذه الأساليب تتجاهل بسرعة الروابط بين السمات وتميل إلى تقليص التباين، والثقة النموذجية الاصطناعية، ولا يكون التلاعب باليد مناسبا إلا في إطار نظام تقييم الأداء وتقييم التنفيذ، ولخصائص ذات توزيعات قياسية تقريبا؛ فالتسرب الوسيط أقوى بالنسبة للمتفوقين.
بتر الأعضاء
(ب) نماذج التراجع التي تُستخدم في التنبؤ بالمتغيرات، والتي تنطوي على قيم مفقودة كوظيفة من السمات الكاملة الأخرى، ويتناسب التراجع الخطي مع القيود الملاحظة ثم يُستخدم للتنبؤ بالمتغيرات المفقودة، ويحافظ هذا على العلاقات بين المتغيرات، ويفترض التسلسل، ويمكن أن يؤدي إلى زيادة في الفائدة إذا استخدمت نفس البيانات في كل من الاختلاس والتدريب النموذجي، وتستخدم نسخاً أكثر تقدماً أساليب متداخلة مثل المواصفات المتسلسلة حتى التقاربة.
K —Nearest Neighbors (KNN) Imputation
وتجد عملية التحويل في شبكة KNN أن أكثر العينات اكتمالاً (بمسافة على السمات الملاحظه) ومتوسطات (أو تصوت الأغلبية من أجل) قيمها، وهي تستوعب بطبيعة الحال مستويات المعالين غير المترابطة وتعمل بشكل جيد مع أنواع البيانات المختلطة، والانتكاسات الرئيسية هي التكلفة الحسابية لمجموعات البيانات الكبيرة والحساسية لاختيار الكيلومترات ومقياس المسافة.
بتر متعدد
(أ) الازدواج في الازدحام (مثلاً، باستخدام نظام إدارة المواد الكيميائية أو نظام الخدمات الإدارية) يولد عدة بيانات كاملة عن طريق استخدام قيم من نموذج إحصائي يتضمّن عدم اليقين، ثم يُعدّ المحلل شجرة قرار لكل مجموعة بيانات مأخوذة ويجمع النتائج (مثلاً، عن طريق وجود احتمالات متوقعة أو باستخدام قواعد محاسبة متينة).
حدود التبريد المبسط
ولا توجد طريقة للتشغيل هي حلاً للملابس، إذ يمكن أن يؤدي التصريف المبسط إلى تشويه التوزيع المشترك للمعالم، مما يجعل من الصعب على أشجار القرار أن تجد انقسامات نظيفة، علاوة على أن الحيازة هي خطوة للتجهيز المسبق منفصلة عن خط الأشجار؛ ولا يعرف الخوارزمية الشجرية أن هناك قيمة قد استُخدمت، مما قد يؤدي إلى تقديرات أداء متفائلة للغاية إذا لم يتم التحقق من صحة الاختراقها على النحو المناسب في إطار آلية الاختراق.
متفجرات متتالية في أشجار القرار
وبدلاً من تجهيز البيانات مسبقاً، تعالج بعض خوارزميات شجرة القرار - وعلى الأخص مادة CART الأصلية (تجار التصفيق والتراجع) - القيم المفقودة محلياً باستخدام [(FLT:0]) الشقوق ، وهذه التقنية واضحة لأنها تستغل هيكل الأشجار نفسه لمعالجة الثغرات دون تعديل البيانات الأولية.
كيف يُستغربُ عملَ المنجلاتِ
وعند بناء شجرة، يختار الخوارزمية أفضل تقسيم في عقدة قائمة على جميع القيم غير المفقودة للميزة الأساسية )مثلا " الدخل ⁇ ٠٠٠ ٥٠ " (، ثم يبحث عن سمة بديلة أو أكثر تكون منقسمة، ويعرف الفارق بين الجنسين حسب سمة مختلفة )مثلا " مستوى التعليم = الخريج الجامعي " ( التي تقسم فيما بين الدخل والموجودين على أساس الاستحقاقات الثانوية.
المزايا والعجز
(أ) إذا كانت الشظايا البديلة تنطوي على ميزة كبيرة تتمثل في عدم اشتراط أي عملية نقل - فإن الشجرة تتعلم من جميع البيانات المتاحة دون أن تلفيق القيم، كما أنها تحافظ على العلاقات المشروطة التي تُستخلص أثناء بناء الأشجار، غير أن التقنية تتطلب وجود بعض السمات ذات الصلة لتكون بمثابة حزمة بديلة؛ وإذا لم تكن السمة المفقودة ذات قيمة قوية، فإن الشظايا البديلة تصبح ضعيفة، وقد تفقد الشجرات فيما يتعلق بالمواجر.
النُهج النموذجية القائمة على أساس نوعي ونُهج حديثة
وقد شهدت السنوات الأخيرة ارتفاع أطر التحوير التدريجي التي تدمج المعالجة المفقودة ذات القيمة العالية مباشرة في خوارزمية التعلم، والتي كثيرا ما تفوق أداء البرمجيات وتفتت في الأداء التوقعي.
XGBoost
]XGBoost] (Extreme Gradient Boosting) learns how to handle missing values during training by treating missingness as a sparse signal. At each split, the algorithm evaluates both a default direction for missing data (left or right child) and the opt split value on the observed entries.
LightGBM
]LightGBM] takes a different route: it treats zero and missing values as a single group (by default) and optimises the split direction for that group. During training, it learns whether missing samples belong to the left or right child of a split. Like XGBoost, it does not require imputation and handles sparse data efficiently.
قطة
() CatBoost] (Categorical Boosting) uses a slightly different mechanism: it treats missing values as a separate category and lets the tree decide when to split on that category. For numeric features, missing values are initially assigned a placeholder (e.g. −1) and the tree finds an optapor based on that treatment
تنفيذ معالجة البيانات المفقودة في الممارسة العملية
ويعتمد اختيار استراتيجية على مجموعة الأدوات وحجم البيانات ونمط الفقد، ويُضاف إلى ذلك تدفق عمل منظم يدمج التقنيات التي نوقشت.
- Assess missingness] – compute the percentage of missing values per feature and per sample. If any feature has >90% missing, consider drop it unless domain knowledge is strong. Visualise correlations between missingness indicators and observed features using a heatmap or a XXI2 test.
- (ب) Identify the mechanism ] – apply Little’s MCAR test if the sample is large enough. If MCAR is plausible, listwise deletion may be acceptable for small missingness (lt;5%). For MAR or MCAR with moderate missingness, imputation or model-based handling is safe.
- Select a method based on your framework]:
- ]If using sklearn decision trees (no builtin missing support), use an imputer (e.g., or within a [FLT:
- وإذا استخدم هذا الكم من الكميات/الرقابة، فلا يلزم التلاعب بالبيانات - بمجرد أن يُعبر البيانات بقيم ؛ وستعالجها الأطر، وهذا هو في كثير من الأحيان النهج الأبسط والأكثر فعالية.
- If using R’s , enable the parameter to active surrogate splits.
- Tune hyperparameters that affect missing handling] – for XGBoost, the and ] can influence missing‐value branch choices. For CatBoost, controls how missing numeric values are treated (as a class or imputed).
- Validate properly] - دائما ما يشمل معالجة البيانات المفقودة داخل حلقة التحلل المتقاطع (مثلا، التلاعب قبل التدريب/الاختبار لتجنب تسرب البيانات) ويقارن أداء مختلف الأساليب على نفس الطائفات لضمان الأهمية الإحصائية.
أفضل الممارسات والخيوط المشتركة
- لا تدحض المتغير المستهدف - إذ يوضع الهدف في سياق تحيز مشرف عليه إشارة التعلُّم، بل يستبعد أو يعامل فقدان الهدف كمشكلة نمذجة منفصلة (مثلاً، يعامل كفئة إضافية).
- (أ) استخدام المعارف المتعلقة بالمجالات في العديد من الميادين، يكون للاختفاء معنى، فعلى سبيل المثال، قد يشير اختبار المختبر المفقود إلى أن الطبيب لم يكن يشك في حالة، ويقدم معلومات مفيدة، وقد تتيح بعض عمليات تنفيذ الأشجار لك إنشاء سمة مؤشرية مفقودة تسمح صراحة بتجزئة الشجرة على أنها متغير ثنائي.
- Beware of high-dimensional sparse data] – if most features have frequent missing entries, imputation can become highly uncertain. In such cases, use tree-based methods with built-in handling (XGBoost or LightGBM) which treat missing as a separate direction.
- Ensemble of imputation models] - for critical applications, consider using multiple imputation and averaging decision trees across imputed datasets (i.e., multiple imputation + ensemble) This is computationally heavy but can improve robustness under MAR.
- Monitor deployment performance] - قد يتغير نمط الفقد بمرور الوقت (مفهوم الانجراف) - يتتبع باستمرار معدلات المفقودين ونماذج التراجع مع استراتيجيات مناولة مستكملة.
خاتمة
Missing data is an inevitable reality in machine learning, and decision tree algorithms are no exception. The appropriate handling strategy depends on the missingness mechanism, the chosen tooling, and the performance requirements. Basic imputation (mean, median, KNN, MICE) remains widely applicable but must be integrated carefully into the modeling pipeline to avoid leakage. Surrogate splits offer a principled, model‑based alternative, though their availability is limited to certainالمكتبات - وضعت الأطر الحديثة العهد - XGBoost, LightGBM, and CatBoost - معيارا جديدا بتعلم الاتجاهات المثلى في القيمة النهائية المفقودة، والتي غالبا ما تسفر عن دقة التنبؤات العليا دون أي تجهيز مسبق، وفي نهاية المطاف، فإن أفضل الممارسات هي إجراء تقييم منهجي لعدة أساليب على مجموعة من أدوات التصديق، باستخدام المعارف المحلية لتحسين الاختيار.
Further reading: ]Missing Data – Wikipedia] covers the statistical theory; ]scikit —learn imputation documentation] provides implementation details; and the XGBoost missing value tutor: