Table of Contents
مقدمة: اتجاهات القرار والحاجة إلى الشجاعة
وأشجار القرار هي واحدة من أكثر الخوارزميات التعليمية شيوعاً وأكثرها استخداماً في مجال التعلم الآلاتي، وهي تُعدّ القرارات النموذجية كهيكل شجرة، حيث تمثل العقائد الداخلية اختبارات على السمات، وتمثل الفروع نتائج تلك الاختبارات، وتمثّل عقدات المنشورات التنبؤات النهائية، وسواء كنت تصنف ما إذا كان البريد الإلكتروني مُبرحاً أو متوقعاً لأسعار المنازل، فإن أشجار القرار تتيح نهجاً يتسم بالشفافية ويُرت البشرية.
ويتمثل التحدي الأساسي في بناء شجرة القرار في اتخاذ قرار في مكان لتقاسم البيانات في كل عقد، ويجب أن تختار الخوارزمية السمة والقيمة المقسمة التي تفصل أفضل الفئات المستهدفة، وهذا هو المكان الذي يأتي فيه ترجمة ] إلى بيانات متجانسة، مقترنة من الناحية المعلوماتية، توفر خللاً في شكلاً من المعلومات.
ما هو "إنتروبي" ؟
وفي اللغة اليومية، يشير النسخ إلى العشوائية أو الفوضى، وفي سياق أشجار القرار، يصف الطبع مقدار عدم القدرة على التنبؤ في مجموعة بيانات تتعلق بالمتغير المستهدف، وإذا كانت جميع الأمثلة في العقد تنتمي إلى نفس الفئة، فإن العقد هو ] خضع للعقوبة ]، كما أن النسخة المدمجة لا تصل إلى أي صف.
وفيما يتعلق بمشكلة التصنيف الثنائي (مثلاً، الإيجابية ضد السلبي)، يُعرَّف النسخة على أنها:
Entropy = -p+ log2(p+) – p - log2(p−)]
حيث يكون عدد الصفحات + نسبة الأمثلة الإيجابية ونسبة الصف الأول - الصفحة +. وتستخدم قاعدة اللوغاريتم 2 لأن المعلومات التي تقاس بقطع صغيرة تقاس بثنائية وعندما يكون هناك أكثر من صفين، تعمم الصيغة على ما يلي:
Entropy = - Total pi log2(pi)] for all classes i.
وتتراوح القيمة الناتجة عن ذلك بين صفر (بشكل نقي) و2 (ك) لطبقات الكيلومترات (بضائع ماكسيموم)، وبالنسبة لحالة ثنائية، يبلغ الحد الأقصى للنسخة 1.0 عندما يكون وزنها صفراً = 0.5.
مخرج سريع
* النظر في مجموعة بيانات تضم ١٠ عينات مع ٥ عينات إيجابية و ٥ عيوب سلبية.
لماذا القاعدة 2؟
إن اختيار القاعدة ٢ متجذر في نظرية كلود شانون الإعلامية، والقليل هو وحدة المعلومات الأساسية التي تمثل خيارا ثنائيا، وباستخدام القاعدة ٢ يعني أن التجريب يعطي متوسط عدد القطع اللازمة لتدوين طبقة العينة العشوائية، وإذا كنت تعرف بالفعل التوزيع، فإن الحد الأدنى من النسخ يعني أن هناك حاجة إلى عدد أقل من القطع لإبلاغ النتيجة.
جيم - المعلومات المقدمة: كيف تُستخدم الأدلة
ولا يكفي حساب التلقيح الدقيق، والهدف هو ] الإقلال من ذلك بعد التقسيم، ويقيّد ربح المعلومات التخفيض المتوقع في النسخ الناتج عن تقسيم البيانات حسب سمة معينة، ويختار الميزة والقيمة المجزأة التي تحقق أعلى مكاسب المعلومات.
والصيغة التي تُستخدم لتحقيق مكاسب في المعلومات هي:
Information Gain = Entropy(parent) — overall ( ⁇ Si ⁇ / ⁇ S ⁇ ) * Entropy(Si)]
أما في الحالات التي تكون فيها مجموعة البيانات الأم، فإن شركة Si هي مجموعات الأطفال الفرعية بعد الانقسام، وتذكر عدد العينات، وهذا المبلغ متوسط مرجح لنظم الأطفال.
Example
تخيل عقدة أبوين تضم 30 عينة: 16 درجة ألف و 14 درجة باء. Entropy (parent) = - (16/30) لوجست (26/30) - (14/30) لوجست (2-14/30) حافز 0.996.
الآن النظر في تقسيم على الصورة العاشرة يخلق طفلين: الطفل 1 لديه 20 عينة (15 ألف، 5 باء) ⁇ entropy = 0.75 لوجست (2.75) 0.25 لوجستي (2.0.25) = 0.811؛ الطفل2 لديه 10 عينات (1 ألف، 9 باء) + 0.1 لوجست = 0.130(0.1) - 0.9 لوج (2.0.9) 0.469.
وإذا كان هناك تقسيم آخر يُفضي إلى ارتفاع مستوى الدخل، فإن هذا الانقسام يُفضل، ويقيّم الخوارزمية جميع السمات والعتبات المحتملة للانقسام لإيجاد الأفضل.
حدود مصادر المعلومات
وتميل المكاسب الإعلامية إلى تفضيل الملامح التي لها قيم مختلفة كثيرة (مثلاً عمود فريد من نوعه) لأن تقسيم هذه السمة يخلق العديد من الأطفال النقيين، وينتج عن ذلك ارتفاع في قيمة السلعة، مما يؤدي إلى زيادة في القيمة، ومن أجل التصدي لذلك، فإن المتغيرات مثل ]Gain Ratio (المستخدمة في الفئة جيم-4-5) تطبيع المعلومات المقسمة.
مقارنة الإنتروج مع طفولة جيني
إن ازدراء جيني هو معيار بديل لتقسيم العينات يستخدم في خوارزمية CART (تجار التجميل والتراجع) ويقيّم احتمال سوء تصنيف عينة مختارة عشوائيا إذا كانت تُسمّى عشوائيا وفقا للتوزيع الفصلي في العقد.
Gini = 1 - مجموع البيب2 ]
وبالنسبة لحالة ثنائية، فإن جيني = 2p+(1 - p+) (P)) (ماكسيموم جيني) تبلغ 0.5 (صفوف متوازنة) ورقم أدنى صفر (اللقب).
وكلاهما من الازدحام الجاهز وجيني هما من وظائف التقاء، مما يعني أنهما يتصرفان بنفس الطريقة في الممارسة العملية، وكثيرا ما يكون الاختيار بينهما هو الكفاءة الحسابية: فجيني لا تحتاج إلى قطع غيار، بحيث تكون أسرع قليلا، غير أن النسخة المصورة لها مبرر أقوى للمعلومات - النظرية، ويمكن أن تختار إما أن تختارا؛ والفوارق ذات طابع تجريبي ضئيلة.
Entropy in Regression Trees
كما يمكن لأشجار القرار أن تحل مشاكل التراجع (تعطيل القيم المستمرة) وفي التراجع، لا يكون المنهج مناسباً لأن الهدف ليس مجزأ، بل إن استخدام الخوارزمية ] تخفيض الاختلاف أو خطأ مربوط كمقياس للانقسام، بل إن الفكرة مماثلة: في كل حالة من الأحوال، تفرقنا لتقليل الفرق إلى أدنى حد.
وللتراجع، كثيرا ما تسمى الكمية ]mean squared error reduction] أو ] مجموع تخفيض الفرق ].() وهذا المبدأ هو نفس المبدأ تماما مثل كسب المعلومات: قياس مدى شدة (الحياة) الوالد، ثم متوسط وزن الأطفال، وتحقيق أقصى قدر من الفرق.
بناء خط مقرر كامل: من روت إلى ليف
والآن، بما أننا نفهم الكسب في المعلومات، فلنمشي في كيفية قيام خوارزمية نموذجية لتعلم شجرة القرار )مثل ID3، C4.5، أو CART( ببناء شجرة:
- Start with the entire dataset] at the root node.
- ] سدّي شدة ] الجذر باستخدام النسخة (للتصنيف) أو الفرق (للتراجع).
- For each feature], evaluate every possible split point (for numerical features, sort values and consider midpoints between consecutive distinct values; for categorical features, consider subsets or one-hot encoding).
- ]Calculate information gain] (أو نسبة كسب، تخفيض جيني، إلخ) لكل قسم.
- [أطلقوا النار على الفارق ] الذي يحقق أعلى المكاسب.
- Partition the data] and recursively repeat steps 2 -5 for each child node.
- Stopping criteria] prevent infinite growth: maximum depth, minimum samples per leaf, minimum impurity decrease, or when all samples in a node belong to one class.
- Prune] the tree (either pre-pruning via hyperparameters or post-pruning by cutting back branches that don’t improve performance on a validation set) to combat overfitting.
معالجة الصور المقطعية والرقمية
:: أعمال التقسيم القائمة على النسخ الإلكترونية لكلا النوعين من الملامح، ولكن النهج يختلف:
- Numerical features]: يصنف الخوارزم القيم الفريدة ويختبر كل عتبة ممكنة، ولكفاءة، لا ينظر إلا في كثير من الأحيان في العتبات بين القيم المتتالية التي تصنفها حيث تتغير العلامات المصنفة حسب الفئة.
- Categorical features]: For binary splits, the algorithm may consider grouping categories into two subsets. For multi-way splits (as in ID3), each category becomes a branch. However, multi-way divides fragment data quickly and are prone to overfitting, so most modern implementations use binorary features even for categary features.
معالجة القيم المفقودة
وكثيرا ما تتضمن مجموعات بيانات العالم الحقيقي قيما مفقودة، ويمكن لأشجار القرار أن تعالجها بطرق عدة:
- Surrogate splits]: When splitting on a feature, a supportive feature that best mimics the split is used for samples missing the primary feature.
- Fractional instances]: Assign a sample to multiple children with weights proportional to the probability of each child based on non-missing data.
- Simple imputation]: يستعاض عن القيم المفقودة بالأسلوب أو الوسيط قبل بناء الشجرة.
ولا تُعالج العديد من المكتبات، مثل التلقيم المحسوب، القيم المفقودة داخلياً وتتوقع أن تُستغل مسبقاً. غير أن الـ(XGBoost) واللايت جي بي إم (LiGBM) يتعلمان أفضل توجه للقيم المفقودة أثناء التدريب.
التغليف المفرط والتعبئة
وستحفظ شجرة القرار التي تنمو إلى أقصى درجة من العمق بيانات التدريب، بما في ذلك الضجيج، مما يؤدي إلى سوء التعميم، ويستمر الحد من النسخ حتى يصبح كل ورقة نقية، ولكن هذا الأداء الاختباري نادرا ما يعود بالفائدة، ويتحكم استراتيجيتان رئيسيتان في المبالغة:
ما قبل الدقائق (التوقف الفوري)
وقف نمو الأشجار قبل تجاوزه بتطبيق القيود: الحد الأقصى للعمق، يتطلب عدداً أدنى من العينات لكل ورقة، أو يتطلب الحد الأدنى من الشدة (مثلاً، يجب أن يكون الانخفاض الافتراضي 0.01) وهذه المقاييس الفوقية مصممة باستخدام التحلل المتناهيج.
ما بعد التبرّع (الاختبارات الشاملة)
ويقضي الفرز على الأشجار بالكامل، ثم يزيل الفروع التي تضيف قيمة ضئيلة، ويعتبر الخوارزمية مبادلا بين تعقيد الأشجار (عدد الأوراق) وخطأ التدريب، ويعاقب معيار التعقيد (ألفا) على أوراق إضافية، ويقدم [العامل المؤثر] تكاليف التجاوز عن طريق .
وتساعد التقنيات المستخدمة في الركض على ضمان أن تكون الشقوق التي تحركها البرمجيات غير متجذرة للغاية وأن تظل الشجرة قابلة للتفسير بينما تعمم بشكل جيد.
Entropy in Ensemble Methods
وفي حين أن شجرة اتخاذ قرار واحدة يمكن أن تكون غير مستقرة (يمكن أن تؤدي التغييرات في البيانات إلى شجرة مختلفة جدا)، فإن التصويب يظل مفهوما أساسيا في الأساليب المشتركة:
- Random Forests]: Build many trees using bootstrap samples and random feature subsets. Each tree typically uses entropy or Gini to split.
- Gradient Boosting]: الأشجار مبنية بالتتابع لتصحيح الأخطاء في الأشجار السابقة، ويستخدم النسخ كهدف (عن طريق فقدان المحاصيل) لتصنيف الغابات في المكتبات مثل XGBoost.
ويساعد فهم المنهج على تفسير سبب اختيار تقسيم معين في أي شجرة فردية، وهو أمر أساسي لضبط النماذج وتحليل الأهمية الخاصة.
الاعتبارات العملية عند استخدام نظام النسخ
أولا، أن يكون المنهج المقارن الذي يستخدم اللوغاريتمات بعناية - تجنبا لقطع غير محددة من الأخشاب )٠( بتحديد صفر من الشعارات )٠( كرقم ثان، على علم بأن الحسابات الجاهزة حساسة لاختلال التوازن في الصف؛ وأن العقد الذي يحتوي على ٩٩ في المائة من الصف الواحد و ١ في المائة من الصف الآخر له انقسام منخفض، ولكن لا يمكن أن يشير إلى انقسام جيد إذا كان لفئة الأقلية أهمية، وفي هذه الحالة، فإن فئات الترج أو تستخدم مقاييس البديلة )١( للتقييم )مثلا(.
كما أن أشجار القرار التي تحتوي على نسخ قابلة للذاكرة يمكن أن تكون كثيفة بالنسبة لمجموعات البيانات الكبيرة لأنها تقيّم جميع الملامح ونقاط الانقسام، وتستخدم المكتبات الخوارزميات مثل sort-and-scan] لمسح المعالم العددية في وقت O(n log n).
المراجع الخارجية للقراءة الأعمق:
- Decision tree learning on Wikipedia]
- Scikit-learn decision tree documentation]
- Directus: The open-source headless CMS] (for example of data management and decision support)
ما بعد التصنيف: الحصول على المعلومات والنسخ في اختيار الأعضاء التناسلية
ولا يستخدم نظام التسجيل داخل أشجار القرار فحسب - بل أيضاً يُستخدم تقنيات الاختيار. المعلومات المتبادلة ] فيما بين الملامح والأهداف ترتبط ارتباطاً مباشراً بمكسب المعلومات، ويمكنك أن تصنف الملامح من خلال معلوماتهم المتبادلة لتقليل البعد قبل تدريب نماذج أخرى، وهذا بديل غير خطي لتحليل العلاقة المتبادلة.
فعلى سبيل المثال، إذا كانت الميزة X ذات معلومات متبادلة عالية مع الهدف ياء، فإن معرفة X تقلل بدرجة كبيرة من عدم التيقن بشأن Y. وهذا هو بالضبط الانخفاض في النسخة التي تحقق عن طريق تقسيم المكتبات على X.
حدود إجراءات اتخاذ القرارات التي تستند إلى النسخ
على الرغم من قوتهم، فإن أشجار القرار التي بنيت مع المتدربين لديها بعض الانتكاسات:
- Instability]: يمكن أن تغيرات مجموعات البيانات الصغيرة أن تغير هيكل الأشجار تغييرا جذريا.
- Bias toward features with many levels]: Information gain favors high-cardinality features. Gain ratio or using only binary splits helps.
- Poor handling of additive structure: Trees are piecewise constant models, so they struggle to learn linear relationships.
- Greedy nature]: The algorithm makes locally optim splits, which may not be global opt.
وفي الممارسة العملية، فإن الجمع بين أشجار القرار القائمة على النسخ المضغوطة مع التناغم السليم بين مقياس ضغط الدم وطرق الجمع بينه، يولد نماذج قوية للعديد من مجموعات البيانات من الجداول.
الاستنتاج: بدء العمل كمؤسسة للمسربين ذوي النظر
ويوفر نظام النسخ المعلوماتي طريقة مبدئية ونظرية لتقييم نوعية تقسيم الأشجار عند بناء شجرة القرار، وبقيام الاضطرابات في مجموعة بيانات، وبهدف تخفيضها في كل خطوة، يمكننا بناء أشجار تقسم بشكل فعال ودقيق حيز السمات، وسواء كنت طالبا تعلم آلة التعلم أو نماذج نشر ممارسين، فإن فهمنا يعمق من إدراككم للكيفية التي تربط بها بين أشجار القرار " معلومات أوسع " .
وإذ تطبقون أشجار القرار، تذكروا أن التنقيب أداة - ليس غاية، إذ يصلحونه مع التثبت السليم، والارتقاء، وجمع التقنيات لفتح كامل إمكانياته، وإذا ما أدرتم خطوط أنابيب البيانات للتعلم الآلي، فإن أدوات مثل شركة " Directus " يمكن أن تساعدكم على جمع وتنظيم وخدمة مجموعات البيانات العالية الجودة التي تعتمد عليها أشجار القرار.