Table of Contents
مقدمة
وتشكل أشجار القرار حجر الزاوية في التعلم الآلي الخاضع للإشراف، وتوفر إطارا شفافا لمهام التصنيف والتراجع، فهي، من خلال تقسيم البيانات بصورة علاجية على أساس قيم خاصة، تخلق هيكلا شبيها بالتدفقات، يُعدّل بشكل وثيق عملية صنع القرار الإنساني، وقد جعلتها البساطة والتفسير طريقة للتحليل الاستطلاعيعابي، والتصنيف الائتماني، والتشخيص الطبي، والتجزئة العامة.
وتوفر هذه المادة غطسا عميقا في مزايا وقيود أشجار القرار، وتستكشف التقنيات اللازمة للتخفيف من مواطن ضعفها، وتقارنها بأساليب بديلة، وبحلول نهاية المطاف، ستكون لديك صورة واضحة عن متى تستخدم شجرة القرار، وعن كيفية تجنبها، وكيفية الجمع بينها وبين أدوات أخرى لتحليل البيانات بصورة قوية.
How Decision Trees Work
وعلى مستوى عال، تقسم شجرة القرار مجموعة بيانات إلى مجموعات فرعية تستند إلى أهم سمة في كل خطوة، ويختار الخوارزمية السمة والنقطة التي تقسم على أفضل وجه المتغير المستهدف، باستخدام معايير مثل ازدراء أوراق جيني، أو التلقيح (كسب المعلومات)، أو تخفيض الفرق في مهام التراجع، وكل عقد داخلي يمثل اختبارا على سمة، ولا يمثل كل فرع نتيجة عملية الفرز.
ونظراً لأن النموذج هو أساساً مجموعة من القواعد التي كانت في حالة وجودها، فمن السهل تفسيرها لأصحاب المصلحة غير التقنيين، وهذه الشفافية هي أحد الأسباب الرئيسية التي تجعل أشجار القرار شعبية رغم توافر نماذج أقوى من الثروات في مجال السود.
مزايا اتخاذ القرارات
1 - التفسير والشرح
ويمكن تصور شجرة القرار على أنها مخطط بسيط يجعلها أحد أكثر نماذج التعلم الآلات تفسيرا، ويمكن تتبع كل مسار من مسارات القرار من جذورها إلى ورقة، مما يوفر أساسا منطقيا واضحا لكل توقع، وهذا أمر لا غنى عنه في الصناعات المنظمة مثل التمويل والرعاية الصحية، حيث يطلب مراجعو الحسابات أو المرضى تفسيرات لذلك، فعلى سبيل المثال، يمكن لشجرة الموافقة على الائتمان أن تبين بوضوح أن مقدم الطلب قد حُرم بسبب انخفاض الدخل إلى جانب ارتفاع نسبة الدين إلى الدخل.
كما أن القدرة على الترجمة الشفوية تيسر عملية فرز النماذج، فإذا كانت الشجرة تُحدث توقعا خاطئا، فإن علماء البيانات يمكنهم فحص الانقسامات وتحديد مسائل جودة البيانات أو خيارات غير ملائمة.
2 - معالجة البيانات الرقمية والقائمة على الأدلة
وتساند أشجار القرار محلياً السمات العددية والقاطعة دون اشتراط التكسير أو التطبيع من طرف واحد، وهذا يبسط خط الأنابيب التمهيدي للمعالجة المسبقة مقارنة بالخريزميات مثل آلات ناقلات الدعم أو الشبكات العصبية، وبالنسبة للمتغيرات القاطعة التي لها مستويات كثيرة، يمكن للشجرة أن تعالجها تلقائياً عن طريق تقسيمها إلى فئة العضوية، وإن كانت بعض عمليات التنفيذ (مثلاً، CART) تتطلب تقسيماً.
3 - إعداد البيانات المتعلقة بالطرق الدنيا
وعلى عكس العديد من خوارزميات التعلم الآلاتي، لا تتطلب أشجار القرار زيادة السمات أو تركيزها أو تحولها، وغالبا ما يمكن معالجة القيم المفقودة عن طريق اقتسامات بديلة أو تجاهل الحالات المفقودة، وهذا الوطأة بالنسبة لقضايا جودة البيانات يجعل أشجار القرار خطوة أولى عملية في التحليل الاستكشافي، خاصة عندما تتعامل مع بيانات العالم الحقيقي الفوضوي.
4- العلاقات غير المستقلة بدون تغيير
ويمكن لأشجار القرار أن تلتقط تفاعلات معقدة وغير خطية بين السمات دون اشتراط شروط متعددة أو خدع مناديل الكين، فعلى سبيل المثال، يمكن أن تُمثل شجرة حداً من قرارات لا تتوقف فيه النتيجة على عتبة في متغير واحد إلا عندما يقع متغير آخر في نطاق معين، وهذه المرونة المتأصلة ميزة كبيرة على النماذج المتوازية التي تكافح مع مثل هذه التفاعلات ما لم يُعدّ تصميماً صريحاً.
5 - اختيار الأعضاء الذاتية
وفي كل قسم، يقوم الخوارزمية بتقييم جميع الملامح واختيار الملامح التي تعطي أفضل فصل، ونادرا ما تستخدم المعالم التي لا صلة لها، وتؤدي بفعالية اختيار الملامح المدمجة، مما يقلل من المخاطرة التي تُستغل وتبسط النموذج، لا سيما عند التعامل مع البيانات العالية الأبعاد حيثما توجد روابط راقية.
6 - الروبوتات التي تصيب المتفرجين والمرشحين غير المناسبين
ونظرا لأن التقسيمات تقوم على العتبات، فإن القيم المتطرفة في بيانات التدريب لا تؤثر بشكل غير متناسب على النموذج (مثل الأساليب غير القائمة على البعد مثل الجيران الكينيين) وبالمثل، فإن السمة غير ذات الصلة لن يتم اختيارها للتقسيم إلا إذا حدث أن ترابطت مع الهدف بالصدفة (في هذه الحالة يساعد الفرز).
حدود إجراءات اتخاذ القرارات
1 - المغالاة في الاستفادة
إن أشجار القرار مروعة لضخها عندما تنمو إلى عمق كامل، وشجرة تستمر في الانقسام حتى تتضمن كل ورقة واحدة منها، ستحفظ بيانات التدريب بشكل مثالي، ولكنها لا تعمم على أمثلة غير مرئية، وتزيد من قيمة الأشجار التي ترتفع فيها أشجار عميقة للغاية مع فروع كثيرة تُدفع بالضوضاء، وعلى سبيل المثال، فإن شجرة مدرَّبة على مجموعة بيانات صغيرة ذات سمات كثيرة قد تُقسِّم على متغير ضوئي عشوئي، مما يُس نمطاً لا يوجد في السكان.
ومن الضروري أن تكافح أساليب تنظيم مثل الحد من العمق الأقصى، ووضع عدد أدنى من العينات لكل ورقة، أو تجريب الشجرة بعد البناء.
2 - ارتفاع التباين وعدم الاستقرار
ويمكن أن تؤدي التغييرات الصغيرة في بيانات التدريب إلى هياكل شجر مختلفة اختلافا كبيرا، إذ يمكن لنقطة بيانات واحدة أضيفت أو أزيلت أن تغير الجذور، وأن تنحني لتغيير الشجرة بأكملها، وهذا عدم الاستقرار يجعل أشجار القرارات الفردية غير موثوقة بالنسبة للتطبيقات التي تتطلب التنبؤات المتسقة، مثل التكرير الائتماني حيث لا ينبغي أن تؤدي الاضطرابات الطفيفة في مجموعة التدريب إلى قواعد موافقة مختلفة اختلافا جذريا.
وتعالج هذه الطريقة، مثل الغابات العشوائية والارتفاع التدريجي، عن طريق التغليف على أشجار كثيرة، ولكن عدم الاستقرار الأساسي لشجرة واحدة لا يزال يشكل قيدا أساسيا.
3 - الالتفات نحو مستويات عديدة
وعند اختيار الانقسامات، تميل أشجار القرار إلى تفضيل السمات القاطعة التي لها قيم مختلفة كثيرة (مثلاً هويات العملاء، ورمز الزبدة) على السمات التي لها قيم قليلة، وذلك لأن سمة كثيرة من حيث المستوى تتيح فرصاً أكبر لإنشاء مجموعات فرعية نقية، حتى وإن لم تكن تلك التقسيمات ذات معنى، فعلى سبيل المثال، فإن تقسيمها على هوية العملاء يعطي ورقة نقية تماماً لكل زبون، ولكن هذا الانقسام لا يعم.
4 - قطع الأشجار وقطعها دون المسافات
ويستخدم الخوارزمية النموذجية لتعلم الأشجار نهجاً طماعياً وعالياً: ففي كل عقد، يختار أفضل تقسيم دون النظر في تقسيمات المستقبل، وفي حين أن ذلك يمكن أن يؤدي إلى أشجار دونية - أو أسوء قليلاً، قد يتيح تقسيماً أفضل بكثير فيما بعد، ولكن الخوارزمية الجشعة لا يمكن أن تتراجع، وهذا الحد يعني أن الشجرة النهائية قد لا تكون أصغر أو أكثر دقة.
فالتقنيات مثل الشبح أو زراعة شجرة ثم يمكن للصيد أن يعالج هذا جزئيا، ولكن لا يوجد ضمان للمثلية العالمية.
5- ضعف الأداء في البيانات الصغيرة أو العالية الحساسية
وفيما يتعلق بمجموعات البيانات الصغيرة، يمكن أن تصبح أشجار القرار حساسة جداً للضوضاء وتنتج نماذج غير مستقرة، ففي حالة البيانات العالية الأبعاد التي تنطوي على العديد من السمات غير ذات الصلة، قد يكافح الخوارزمية لإيجاد تقسيمات ذات معنى تؤدي إلى التقليل من شأن الضجيج أو الإفراط في التأقلم، وفي هذه السيناريوهات، يكون من الضروري في كثير من الأحيان الحد من البعد (مثلاً، تقييم الأداء العام) أو اختيار المميزات قبل العرض.
6 - صعوبة القدرة على إقامة علاقات خطية بسيطة
وفي حين أن أشجار القرار تتفوق على التفاعلات غير المباشرة، فإنها غير فعالة في إقامة علاقات خطية بسيطة مضافة، ولتقريب حدود القرار الخطي، يجب أن تخلق شجرة أجزاء ثابتة كثيرة من القطعة، مما يؤدي إلى شجرة عميقة ومعقدة يصعب تفسيرها، أما بالنسبة للمشاكل الخطية البحتة، أو التراجع السوقي أو الارتداد الخطي، فإن ذلك سيتجاوز شجرة اتخاذ القرارات بأقل من المعايير والتعميم.
معالجة القيود: التشغيل والتسويات
فالطريقة الرئيسية للحد من الإفراط في الاستفادة من أشجار القرار، وهناك نهجان رئيسيان هما: التجاوزات المسبقة (يسمى أيضاً التوقف المبكر) وما بعد التدقيق.
ما قبل التشغيل
وأثناء بناء الأشجار، يتوقف الخوارزمية عن الانقسام عندما تستوفى شروط معينة - مثل أقصى درجة من العمق، أو عينات دنيا لكل عقد داخلي، أو العدد الأقصى من عقدات الورق، وفي حين أن البسيط، فإن التبريد المسبق يمكن أن يكون عدوانيا جدا وأن يؤدي إلى نقص في الملاءمة.
ما بعد التشغيل
وتنمو الشجرة إلى عمق كامل ثم تُزال الفروع التي لا تقدم سوى القليل من التحسين الإحصائي، وتشمل الأساليب التي تُستخدم في تقييم مدى تعقيد التكاليف (المعروفة أيضاً باسم " ضعف الربط " )، حيث تُضاف عقوبة لكل عقد من معدّل أوراق الأوراق، وتخفض فيها الرنة، حيث تستخدم مجموعة من المصادقة لتقييم ما إذا كان رفع مستوى الأداء يحسن.
وتشمل أساليب أخرى لتسوية الوضع تحديد عتبة دنيا لتخفيض الازدحام (فقط إذا تجاوزت المكاسب قيمة معينة) واستخدام تقسيمات بديلة للبيانات المفقودة.
مقارنة مع النماذج الأخرى
متى تختار شجرة قرار على خوارزميات أخرى؟ الجدول الوارد أدناه يلخص المبادلات الرئيسية:
- vs. Linear Models (Logistic Regression, Linear SVM):] Decision trees handle non-linearities and interactions automatically, but linear models are more stable and efficient when the underlying relationships are additive and linear. For high‐dimensional sparse data (e.g., text), linear models often outperform trees.
- vs. k‐Nearest Neighbors (kNN):] Both are non-parametric and easy to understand. kNN works well with low —dimensional continuous data but degrades in high dimensions (curse of dimensionality) and requires careful scaling. Decision trees handle mixed data types better and are more interpretable.
- vs. Neural Networks:] Neural networks can learn extremely complex patterns but require large datasets, significant hyperparameter tuning, and lack interpretability. Decision trees are preferable when the data is small to medium-sized and when explanations matter more than raw predictive power.
- vs. Random Forests / Gradient Boosting:] These ensemble methods dramatically improve accuracy and stability at the cost of interpretability. For most practical applications, a single decision tree is used only for exploratory analysis or as a baseline; ensemble variants are preferred for production.
طرق الجمع: التغلب على ضعف شجرة واحدة
وللتغلب على عدم الاستقرار وتجاوز قيمة شجرة اتخاذ قرار واحدة، تجمع الأساليب بين الأشجار المتعددة، والأشهرين هما:
الغابات العشوائية
وتبني غابة عشوائية العديد من أشجار القرار على عينات مجهزة بالأحذية من البيانات وقطع غيار عشوائية من الملامح، ثم تُحدّد توقعاتها (للتراجع) أو تصوت الأغلبية (للتصنيف)، وهذا يقلل كثيرا من التباين مع الحفاظ على تحيز منخفض، وينتج نموذجا قويا يتجاوز في كثير من الأحيان شجرة واحدة، ويقلل من إمكانية تفسيرها - فالغابة هي أساسا صندوق أسود.
أجهزة التعبئة الرئيسية
ويبني النظام العالمي لرصد التنوع البيولوجي الأشجار بالتتابع، ويصحح كل شجرة جديدة أخطاء الشجرات السابقة، ويمكن لهذا النهج أن يحقق درجة من الدقة في البيانات المنظمة، ولكنه يتطلب تدقيقا دقيقا في معدل التعلم، وعمق الأشجار، والتسوية، وقد أصبحت الفوارق مثل XGBoost، واللايت، والكاتبوست معايير صناعية للبيانات الافتراضية.
الاعتبارات العملية لاستخدام إجراءات اتخاذ القرارات
- Data Size:] For datasets with fewer than a few hundred samples, decision trees are prone to overfitting. Consider using cross —validated pruning or shift to a simpler model (e.g., logistic regression).
- Feature Types:] While trees handle mixed types naturally, you should still analyze the data. Many highly categorical features (e.g., geographical location) should be pre-grouped or treated with caution. For highcardinality features, consider using target encoding before feeding into the tree.
- Imbalanced Classes:] Decision trees can be biased toward the majority class. Use class weights, stratified sampling techniques, or oversampling techniques to mitigate this.
- Missing Values:] Some implementations (like scikit —learn’s DecisionTreeClasifier) cannot handle missing values directly. You must impute them or use algorithms that support missing — — — — — — — — — — - -e.g., C4.5, CatBoost).
- Hyperparameter Tuning:] The most critical hyperparameters are maximum depth, min samples split, min samples leaf, and max features. Use grid search or random search with cross-validation to find the best trade-wateroff between bias and variation.
التطبيقات العالمية الحقيقية
وفي مجال الرعاية الصحية، يمكن أن توفر الأشجار التي تُتخذ القرارات مساراً واضحاً للتشخيص بالنسبة للطبيب، وفي مجال التمويل، تُفضَّل الأشجار التي تُستخدم في الإئتمان لأنها يمكن مراجعة العدل ولا تميز على أساس الخصائص المحمية (تقوم باختيار الملامح الدقيقة) وفي مجال التصنيع، تساعد أشجار القرار في تشخيص الأخطاء باتباع سلسلة من القراء المستشعرة.
فعلى سبيل المثال، هناك تطبيق واسع النطاق هو UCI بيانات أمراض القلب ]، حيث يمكن لنموذج شجر القرار البسيط أن يتوقّع وجود أمراض القلب بدقة معقولة وشفافية كاملة، ويستخدم العديد من كتب علوم البيانات هذه المجموعة من البيانات لإدخال أساليب قائمة على الأشجار.
خاتمة
وتشكل أشجار القرار أداة قيمة في ترسانة محلل البيانات، وتوفر الترجمة الشفوية غير المطابقة، وسهولة الاستخدام، والقدرة على إقامة علاقات معقدة غير خطية بدون تجهيزات مسبقة واسعة النطاق، بيد أن ضعفها - ولا سيما المغالاة في الملاءمة وعدم الاستقرار - يعني أن شجرة اتخاذ قرار واحدة نادرا ما تكون النموذج النهائي في خط أنابيب حديث، بل أن أشجار القرار تستخدم كأداة استكشافية، أو خط أساس، أو كحواجز لبناء طرق قوية للتعبئة مثل طرق الجمع.
استخدام أشجار القرار استخداما فعالا: تطبيق التمشيط أو أي تسوية أخرى، والتحقق من ذلك مع التقاطع، والنظر في الجمع بينها وبين تقنيات الجمع لنظم الإنتاج، وعندما يكون التفسير ذا أهمية قصوى، فإن الشجرة الوحيدة المجهزة جيدا يمكن أن تظل الخيار الصحيح - ولكنها مستعدة لقبول مقايضة محتملة في الدقة المتوقعة.
For further reading, consult the scikit-learn decision trees documentation] and the Class textbook The Elements of Statistical Learning] by Hastie, Tibshirani, and Friedman.