ولا تزال أشجار القرار واحدة من أكثر خوارزميات التعلم المترجم، التي تفضّل قدرتها على وضع نماذج معقدة للقرارات، مع تقديم تفسيرات واضحة تستند إلى القواعد، وعلى الرغم من نداءها، فإن شجرة القرار التي تتعلم كل دقة من البيانات التدريبية كثيرا ما تفشل في تعميم البيانات الجديدة غير المنظورة، وكثيرا ما تؤدي هذه الظاهرة إلى الحد الأدنى من الدقة عند العمل مع النماذج القائمة على الأشجار.

ويوفر هذا الدليل تمشياً مفصلاً في عملية تخطي شجرات القرار، من النظرية الأساسية إلى خطوات التنفيذ العملية، وسواء كنت تبني شجرة من الخدش أو تطويع نموذج في مكتبة مثل التعلم من الكتف، وفهم متى وكيف يمكن التلاعب بها أمر حاسم لتحقيق أداء موثوق به، وسنغطي كل من نماذج تقييم الإضراب قبل وقوع الحادث وبعده، وننتقل إلى نهج تقييم التقلبات في التكاليف (الطريقة الأكثر استخداما).

فهم عملية تنفيذ القرار

فالعمل على الحد من حجم شجرة القرار بقطع فروعها ذات القدرة المنخفضة على التنبؤ، والهدف هو تبسيط الشجرة بحيث لا تستوعب سوى أهم أنماط البيانات، مما يؤدي إلى تحسين قدرتها على تعميمها، وبدون الركض، شجرة تنمو إلى أقصى عمق لها، حيث تتضمن كل ورقة نموذجا تدريبيا واحدا أو عندما لا يكون هناك مزيد من التقسيم يمكن أن يكون فيه تمثيل مثاليا ولكن غير ملائم لمجموعة التدريب.

إن القتال الدائر يغلب على المحك عن طريق التحيز المتزايد عمدا )حيث أن النموذج الأبسط قد يفوت بعض الأنماط الخبيثة( بينما يتناقص الفرق، ويحقق الحد الأمثل أدنى خطأ في التعميم عن طريق التداول بين هذين المصدرين للخطأ، وهذا التحيز - التداول أمر أساسي لجميع التعلّم الآلات، ويعد الفرز أحد أكثر الطرق مباشرة لإدارة ذلك في النماذج القائمة على الأشجار.

لماذا (بروين) ؟

ويمكن أن تنمو شجرة القرار غير المبررة في عمقها، مما يخلق مئات من الشقوق على مجموعات البيانات المميزة بدرجة متوسطة، ويزيد كل فصل من تعقيد النموذج بتقسيم حيز السمات إلى مناطق أصغر، وفي حين أن هذا يسمح لل الشجرة بأن تلائم بيانات التدريب بشكل كامل تقريبا، فإنه يجعل النموذج شديد الحساسية للتقلبات الصغيرة في البيانات، والاعراض الكلاسيكية للارتباط الوثيق هي أن دقة الشجرة على مجموعة التدريب تكون أكثر صحة من الفجوة القائمة على المحتفظ بها.

كما أن القدرة على التنبؤ تعاني من الأشجار المفرطة في النمو، حيث يصعب تصور شجرة ذات مستويات وفروع كثيرة أو تفسيرها أو تبريرها لأصحاب المصلحة، وتنتج شجرة أكثر ترابطاً تحافظ على منطق القرار الأساسي بينما تتخلص من الفروع التي تقدم تحسينات هامشية، وبالنسبة للعديد من تطبيقات العالم الحقيقي، فإن الشجرة الأصغر والأقل دقة هي أكثر قيمة بكثير من شجرة ضخمة ذات صندوق أسود.

أنواع الرنة: ما قبل عملية الشراء ضد ما بعد التشغيل

وهناك استراتيجيتان عامتان لشق أشجار القرار: ما قبل التدقيق (يسمى أيضاً التوقف المبكر) وما بعد التكهن (يسمى أيضاً التلاعب أو التراجع) - إن فهم اختلافاتها أمر أساسي لاختيار النهج الصحيح لمشكلتكم.

  • Pre-pruning]: إن الشجرة تمنع من النمو إلى ما بعد نقطة معينة أثناء التدريب، وتشمل معايير التوقف المشتركة أقصى درجة، وعدداً أدنى من العينات اللازمة لتقاسم عقد داخلي، وعدداً أدنى من العينات في ورقة، أو انخفاض الحد الأدنى من الارتحال، إذ أن التبريد قبل أن يتجنب بناء شجرة كاملة، ولكن يمكن أن يكون في مرحلة مبكرة جداً.
  • Post-pruning]: الشجرة تنمو أولاً إلى حجمها الكامل (حتى تصبح جميع الأوراق صافية أو مستحيلة لتقاسمها) وبعد ذلك تُنقَف الفروع التي لا تحسن التعميم، وتزداد تكلفة التصويب بعد عملية التجميل (بما أن الشجرة الكاملة تُبنى أولاً) ولكنها تميل إلى تحقيق نتائج أفضل لأن قرارات الكسب المستديم.

وفي الممارسة العملية، فإن ما بعد عملية التأديب (لا سيما التقلبات في التكاليف) هو الأسلوب الأكثر شعبية لأنه أقل حساسية لعتبات التوقف التعسفية، وكثيرا ما يؤدي إلى تنازع أفضل في التحيز - الاختلاف، وتطبق العديد من المكتبات ما بعد التكهن بتمكينكم من وضع مفارقة معقدة تتحكم في كيفية قطع الفروع بصورة عدوانية.

The Mechanics of Post-Pruning: A Step-by-Step Guide

وتشمل عملية ما بعد التكرار عملية منهجية لزراعة شجرة كاملة وتقييم أدائها ثم إزالة الفروع بصورة انتقائية، وتوضح الخطوات التالية الإجراء المستخدم في معظم الخوارزميات بعد التكرار، مع التركيز بوجه خاص على عملية التجاوز في التكاليف، وسنفترض أن لديك مجموعة بيانات مسمّاة تقسم إلى مجموعات للتدريب والتثبت (أو تستخدم التجاوزات المتقاطعة).

الخطوة 1: نضج عملية اتخاذ القرار الكاملة

الخطوة الأولى هي تدريب شجرة القرار على بيانات التدريب دون أي قيود على العمق أو حجم الورق، والسماح للشجرة بأن تنمو حتى تصبح كل ورقة نقية )أو نقية قدر الإمكان( أو حتى لا يمكن لأي تقسيم آخر أن يقلل من مقياس الشدة )مثل شريان جيني أو مناجمها( وهذه الشجرة " التقريبية " ستحظى بالعديد من المعالم الداخلية وتركها، ومن المؤكد أنها ستتجاوز بيانات التدريب، ولكن هذا الإجراء مقبول.

وأثناء النمو، يتم اختيار كل تقسيم لتقليل الازدراء إلى أدنى حد، أما بالنسبة للتصنيف، فإن تدابير الشوائب المشتركة هي شدة وغضب جيني؛ أما بالنسبة للتراجع، فإن الحد من الفروق هو نموذجي، فالشجرة تواصل الانقسام إلى حين تلبي أحد الظروف المتوقفة (لا تحسن في الازدراء، وجميع العينات في العقد تنتمي إلى نفس الدرجة، أو أن العداد يحتوي على عدد أدنى من العينات التي سبقت هنا).

الخطوة 2: تقييم أداء الشجرة الكاملة

وبعد بناء الشجرة، تقييم أدائها على مجموعة من المصادقة )أو استخدام التوثيق المتناثر( - قياسات السجلات مثل الدقة )للتصنيف(، والخطأ المربع )للتراجع(، وعدد المعاهد أو الإجازات، وسوف يقارن هذا الخط الأساسي بالنسخ المجهزة بالأجهزة، وينبغي أن يكون نظام التثبت منفصلا عن القرارات المتعلقة بالتدريب على أداء التدريب، حيث أن ذلك سيؤدي إلى استمرار التجاوز.

ومن المفيد أيضا دراسة هيكل الشجرة: فغالبا ما يكون للأشجار الكبيرة فروع كثيرة تدعمها حفنة من الأمثلة التدريبية، وهذه الفروع هي مرشحات رئيسية للتشغيل لأنها يحتمل أن تكون ضوضاء، ويمكن أن يساعد تصور الشجرة )حتى على أنها تمثل نصا( على تحديد هذه الفروع الضعيفة.

الخطوة 3: تشغيل شجرة باستخدام سعر التكلفة - الاستهلاك

* إن طريقة التكافل في التكاليف (المعروفة أيضاً باسم " ضعف الروابط " ) هي الطريقة الموحدة لما بعد التكرار ألفا التي تستخدمها المكتبات مثل " الكسب " و " البساط " ، وهي تعمل من خلال فرض عقوبة على تعقيد الأشجار.

وتبدأ عملية الفرز بالشجرة الكاملة (ألفا = صفر) ثم تحدد " الرابط الأوفر ألفا " - العقد الداخلي الذي ينتج عنه إزالة أصغر زيادة في الجرعة (T) لكل ورقة، ويُجرى هذا العقد (المتجه إلى ورقة) وتسجل الشجرة الجديدة، وتُعاد العملية، وتُنتج سلسلة من المواد الفرعية (الزيادات المثلى) (كل خريف من هذه الزيادات).

ولاختيار أفضل ألفا (وبالتالي أفضل جزء فرعي)، فإن التقاطع أمر أساسي، وينشأ نفس المسار الممتد على بيانات التدريب، ثم يتم تقييم كل طرف فرعي من المرشحين على مجموعة من المصادقة، أما ألفا التي تنتج أدنى خطأ في التحقق فتصبح الشجرة المناظرة ذات النموذج النهائي، ويتوازن هذا النهج تلقائياً بين التعقيد في الأشجار والدقة المتوقعة.

نموذج التنفيذ العملي

In scikit-learn’s , you can access cost-complexity pruning via the ] parameter. The library provides the ] method that returns effective alphas and the corresponding impurities. you then train a tree with the chosen ] The full code is straightforT and well-document

الخطوة 4: تقييم شجرة الفراولة

بعد اختيار أفضل ألفا، تدريب الشجرة النهائية على مجموعة التدريب الكامل (أو القطار المدمج +فال إذا استخدمتم تقسيماً واحداً للتثبت) باستخدام ألفا، ثم تقييم أدائه على مجموعة اختبار منفصلة لم تستخدم قط في اتخاذ القرارات، وهذا التقييم النهائي يعطيك تقديراً غير متحيز لكيفية انتشار الشجرة المهددة في الإنتاج.

وتجدر الإشارة إلى أن عملية التفكك يمكن أن تستخدم أيضاً في إطار عملية التمهيد: ففي كل مرشح من مرشحي ألفا، يجري عملية تبادل بيانات عن البيانات التدريبية، ويحدث متوسط الخطأ في التحقق، ويقلل هذا النهج من الفرق في تقدير الخطأ، وكثيراً ما يؤدي إلى خيارات أكثر قوة في مجال الضبط.

التكاليف - التكلفة في التجزئة

ونظرا لأن عملية التراكم في التكاليف هي الطريقة السائدة بعد التكهن، فإنها تستحق نظرة أقرب، فالإناقة التي يميزها الخوارزمية تكمن في قدرتها على توليد سلسلة كاملة من الأشجار المتناثرة، من الشجرة القصوى إلى حد واحد، وكل شجرة في التسلسل تتطابق مع ألفا مختلفا، وتسمح لك بالتسلسل بفحص منحنى الخطأ مقابل التعقيد.

The key mathematical idea is the “weakest link”. At each step, the algorithm computes for every internal nodet the value g(t) = (R(t) − R(Tt increases ) /()

وهذه الطريقة لها أسس نظرية قوية، وهي تضمن أن تسلسل الهبات الفرعية هو الأمثل بمعنى أن تكون الطبقية التي تقلل من الألفا إلى أدنى حد من الحرف الألف ألفا (T) يمكن أن تُكتشف باتباع هذا المسار الأضعف، وفي الممارسة العملية، كثيرا ما يخطط الممارسون لخطأ في التحقق من الأخشاب (ألفا) لتحديد المنطقة التي يؤدي فيها الخطأ إلى زيادة.

تشوش ألفا مع الصليب

ومن الوسائل القوية لاختيار ألفا استخدام التقاطع في بيانات التدريب، إذ أن كل عجلات منها تُحسب الشجرة الكاملة ومسارها المُتدل، ثم تُقيِّم كل مجموعة فرعية على مجموعة السحب، ويُعتبر متوسط أخطاء المصادقة على جميع الملفات لكل قيمة من قيمة ألفا، ثم تُختار ألفا التي تقلل من متوسط الخطأ، ويُعتبر الخطأ الضارب الأكبر بين ألفا وبين الخطأ الواحد في معيار واحد من المعايير الدنيا.

وبعد اختيار ألفا، إعادة تدوير الشجرة على كامل التدريب المحدد مع ذلك ، وستكون الشجرة الناتجة عن ذلك النموذج النهائي، الذي يجري تنفيذه في العديد من مكتبات التعلم الإحصائي؛ وعلى سبيل المثال، تقدم مقدمة للتعلم الإحصائي ] معاملة ممتازة للتلاعب في التكاليف مع مراعاة الأمثلة في R.

تقييم الأشجار المشتقة

ويتجاوز تقييم شجرة مُجَرَّفة مجرد التحقق من دقة مجموعة اختبار، وينبغي أيضاً تقييم استقرارها وقابليتها للتفسير وأدائها عبر مجموعات فرعية مختلفة من البيانات، ويوصى بما يلي:

  • ]Compare against the full tree]: Report both the full tree’s and the pruned tree’s performance on the test set. The pruned tree should show a smaller gap between training and test accuracy (indicating reduced overfitting) If the pruned tree performs worse than the full tree on the test set, the pruning may have been too aggressive.
  • Use learning curves]: Plot training and validation error as a function of tree size or Á. A widening gap between the two curves signals overfitting; pruning should close that gap. By monitoring the shapes of these curves, you can identify the opt complexity range.
  • Measure complexity directly]: count the number of leaves and depth of the final tree. A well-pruned tree might have, for example, 20 leaves instead of 200, making it far easier to explain. Report these metrics alongside accuracy to give a complete picture.
  • Validate on multiple random splits]: Because pruning decisions are influenced by the training/validation split, try multiple random splits or repeated cross-validation. If the opt Á varies widely, the data may be too noisy, and you should consider other modeling approaches.

ترجمة :

ومن أكبر مزايا أشجار القرار التي تم تسويتها، التفسير، وبعد الركض، لا تتضمن الشجرة إلا شظايا تدعمها بيانات كافية تكون ذات معنى إحصائيا، ويمكنك تتبع أي توقع من جذورها إلى أوراقها كمجموعة بسيطة من القواعد إذا ما كانت قد وضعت، وهذه الشفافية قيمة في الصناعات المنظمة )الرعاية الصحية، التمويل( حيث يجب مراجعة القرارات النموذجية، كما أن الفرز يقلل من خطر إزالة الضوضاء من جذورها.

أفضل الممارسات للتشغيل الفعال

ولزيادة فوائد عملية الشراء إلى أقصى حد، تتبع هذه المبادئ التوجيهية القائمة على الأدلة:

  • Always use a separate validation set or cross-validation] when pruning. never use training set performance to decide how much to prune; that would lead to optimistic bias.
  • Experiment with both pre-pruning and post-pruning]. While post-pruning is generally superior, combining a gentle pre-pruning limit (e.g., minimum samples per leaf of 5-10 with subsequent-pruning can reduce training time without sacrificing quality.
  • Balance complexity and accuracy. والهدف ليس تحقيق أعلى درجة من الدقة في مجموعة التدريب، بل التقليل إلى أدنى حد من خطأ التعميم.
  • تجنب الإفراط في القفز ].
  • Usese domain knowledge when available]. If certain features are known to be irrelevant or unreliable, you can manually exclude them from the split candidates. but pruning will often remove splits on weak features automatically.
  • ] إصدار استراتيجية الفرز .() وفي نظم الإنتاج، يسجل ألفا المختارة، وعدد الأوراق، ونتائج السحب الشاملة، تساعد هذه الوثائق في دورات الرصد وإعادة التدريب النموذجية.

الرصيف المشترك في عملية صنع القرار

حتى الممارسين ذوي الخبرة يمكنهم أن يسقطوا في فخ عندما يرتدون، إدراكهم لهذه المجازف سيساعدكم على تجنبهم:

  • Pruning without cross-validation: Using a single validation set to guide pruning can lead to overfitting to that validation set (sometimes called “validation set overfitting”).
  • ] Ignoring the cost-complexity path]: القفز مباشرة إلى ألفا محددا دون فحص المسار الممتد كله يمكن أن يدفعك إلى تفويت مقياس فرعي أفضل.
  • Applying pruning to extremely small datasets]: When data is scarce, any split may be unreliable. Consider using pre-pruning (a shallow tree) instead of post-pruning, or use an alternative model that handles small samples better.
  • Using inappropriate impurity measures]: Gini and entropy usually give similar results, but for regression trees, variation reduction is standard. Mixing measures can lead to inconsistent pruning costs.
  • Forgetting to retrain after pruning]: After selecting Á via cross-validation, you must retrain the tree on the entire training dataset with that Á. Some practitioners mistakenly use the subtree from one cross-validation fold, which introduces bias.

ومن الخطأ البسيط الآخر معالجة الارتحال كحل واحد يناسب الجميع، وبالنسبة للبيانات أو المشاكل التي تنطوي على اختلالات شديدة، قد لا يكون من المناسب، وفي هذه الحالات، يمكن أن يؤدي تعديل الأوزان أو استخدام تدابير الارتباك الحساسة من حيث التكلفة قبل عملية الفرز إلى نتائج أفضل.() ويناقش الكتاب عناصر الإرشاد الإحصائي:

خاتمة

فالعمل على الركض هو أسلوب حيوي لبناء أشجار القرار التي تتميز بالطابع العام، إذ إن من خلال النمو الدقيق لشجرة كاملة، ثم إزالة فروع ضعيفة باستخدام عملية الضبط المضاعف للتكاليف، يمكن أن تحقق نموذجاً دقيقاً ومترجماً على حد سواء، كما أن عملية التدرج - النمو الكامل، وتقييم مسار تعقيد التكاليف، والتحقق من ذلك، والتصنيف المتقاطع، وإعادة تصنيف الأحداث إلى آخر أمر يمكن الاعتماد عليه.

إن فوائد الركض تتجاوز الدقة: فالأشجار الأصغر أسرع من تقييمها، وأسهل نشرها، وأكثر موثوقية في البيئات ذات الاتساع الكبير، علاوة على أن عملية التلاعب تدفعك إلى مواجهة المبادلات التحيزية - الغالية مباشرة، مما يزيد من فهمك لكيفية التصرفات النموذجية، ومع اكتساب الخبرة، ستطورون حدسا للمستوى الصحيح من الركض، ولكن تعتمدون دائما على بيانات المصادقة لتأكيد ما لديكم من خبرة.

تذكر أن الركض ليس نشاطاً غير مباشر، وعندما تستكمل بيانات التدريب أو تضيف سمات جديدة، قد يتغير الهيكل الأمثل للشجر، وتعيد تقييم وإعادة تقييم أشجار القرار بشكل دوري لضمان استمرار أدائها بشكل جيد، مع ما يصحبها من هندسة وضبط مقياس ضغط الدم، سيساعدك التقاط أقصى قيمة متوقعة من النماذج القائمة على الأشجار دون التضحية بالترجمة الشفوية.