مقدمة إلى شركة " صناعات القرار " وهندسة الرسوم

وأشجار القرار هي من بين أكثر الخوارزميات استخداما في التعلم الآلي الخاضع للإشراف نظراً إلى البساطة والتفسير والقدرة على معالجة كل من مهام التصنيف والتراجع، وهي تُعد قرارات نموذجية كهيكل شبيه بالشجر، حيث يختبر كل نقد داخلي سمة، ويمثل كل فرع نتيجة للاختبار، ويحتفظ كل عقد من أوراق الأوراق بقيمة متوقعة أو بعلامة راقية، وعلى الرغم من قوتها، فإن شجرات القرار حساسة للغاية بالنسبة لطريقة إعدادها.

إن هندسة المعالم هي عملية تحويل البيانات الخام إلى بيانات مفيدة تُحسن دقة النماذج، وهذا يعني في كثير من الأحيان إيجاد سمات تتلاءم مع طمع الخوارزمية، وتصريف الشقوق غير المتعمد، وفي هذه المادة، سنستكشف الميكانيكيين الداخليين لأشجار القرار، ونسير عبر التقنيات الأساسية لهندسة السمات، ونناقش طرقا متقدمة مثل الرش، وتصويب الفائق، ونماذج أداءية قوية يمكن أن تُنها.

How Decision Trees Work

ويُقَسِّم الخوارزمية، في كل خطوة، الحيز الخاص بالمناطق التي تقلل من الشدة (للتصنيف) أو الفرق (للتراجع)، ويختار الخوارزمية السمة والنقطة المنقسمة التي تعطي أفضل فصل وفقاً لمعيار مثل ازدراء جيني أو خطأ مربوط أو خطأ مربوط، ولا تزال هذه العملية الجشعة مستمرة حتى يتم استيفاء شرط التوقف، على سبيل المثال، إلى أقصى درجة من العمق، أو عينات الدنيا.

المفاهيم الرئيسية في الشرايين

وجوهر أي شجرة قرار يكمن في المنطق المفترق، وفيما يتعلق بأشجار التصنيف، تشمل تدابير الشدة المشتركة ما يلي:

  • Gini impurity] - وهو تدبير من كثرة ما يكون العنصر المختار عشوائياً ملصقاً بشكل غير صحيح إذا كان قد وُصف وفقاً لتوزيع العلامات في العقد.
  • Entropy] - استناداً إلى نظرية المعلومات، يصف عدم التيقن في العقد، ويستخدم كسب المعلومات (النسخة التمهيدية) لاختيار أفضل تقسيم.

وبالنسبة لأشجار التراجع، فإن المعيار النموذجي هو الحد من الفرق أو الخطأ المربع، وتحاول الشجرة إنشاء مواصفات للأطفال حيث تكون القيم المستهدفة متجانسة بقدر الإمكان.

ونظرا لأن أشجار القرار غير متكافئة ومرنة، فإنها يمكن أن تُقيم علاقات معقدة وغير خطية دون أن تتطلب توسيعا واضحا، غير أن هذه المرونة تجعلها أيضا عرضة للتفوق عندما تنمو الشجرة بشكل عميق جدا أو تحتوي البيانات على سمات مزعجة، حيث تصبح هندسة السمات وضبطها بعناية أمرا بالغ الأهمية.

دور الهندسة المخصَّصة في عمليات صنع القرار

وتسد هندسة المعالم الفجوة بين البيانات الخام وما يمكن أن تتعلمه شجرة القرار بصورة فعالة، وفي حين أن الأشجار قوية بالنسبة للمتفوقين ولا تتطلب تطبيع السمات لأغراض التقسيم، فإنها تستفيد استفادة كبيرة من سمات تجسد المعرفة ذات المغزى في مجالها، ويمكن أن تؤدي السمات المصممة بطريقة ضعيفة إلى تقسيمات دون المستوى الأمثل، وإلى زيادة عمق الأشجار، وإلى تخفيض التعريف.

وتساعد الملامح المصممة جيداً أشجار القرار:

  • البحث عن تقسيمات أنظف مبكراً، تقليل عمق الأشجار وتعقيدها.
  • تفاعلات بين المتغيرات التي قد تفوتها الشجرة بدون غصن عميق
  • معالجة البيانات المفقودة ببراعة عن طريق تصنيفها كفئة معلوماتية منفصلة أو عن طريق التلاعب الذي يحفظ التوزيع.
  • تحسين القدرة على الحصول على مدخلات غير ذات صلة أو مزعجة عن طريق تقليص مساحة البحث عن انقسامات.

المتغيرات الشكلية

ولا يمكن لأشجار القرار أن تعمل مباشرة مع النص أو العلامات القاطعة، وهما أكثر الاستراتيجيات شيوعاً هما:

  • One-hot encoding - يخلق أعمدة ثنائية لكل فئة، وهذا يعمل جيدا عندما يكون عدد الفئات صغيرا (مثلا < 20) والفئات غير مُحللة، ويمكن عندئذ أن تقسم الأشجار على فئات فردية.
  • Label encoding] - يُسند رموزاً لثوابت إلى فئات، وفي حين أن الأمر بسيط، فإنه يمكن أن ينطوي على علاقة عادية قد تضلل الشجرة، وبالنسبة للفئات الاسمية، فإن التشفير المفاجئ يكون أكثر أماناً عموماً.
  • Target encoding - يستعاض عن كل فئة بمتوسط المتغير المستهدف لتلك الفئة (مع سلاسة لتجنب الإفراط في التأقلم) ويمكن أن يكون ذلك قويا بالنسبة لملامح البطاقات العالية ولكن يجب أن يتم بعناية لمنع تسرب البيانات.

وعند معالجة السمات الكارثية العالية البطاقة (مثل رموز برنامج تعزيز القدرة على العمل بألاف المستويات)، يصبح التشفير غير عملي، وفي هذه الحالات، يمكن أن يحافظ على المعلومات دون أن ينفجر بعدا.

معالجة البيانات المفقودة

ويمكن لمعظم عمليات تنفيذ شجرات القرار أن تعالج القيم المفقودة داخلياً بتوجيه العينات إلى فرع الأغلبية، غير أن هذا السلوك غير الافتراضي غالباً ما يكون دون المستوى الأمثل، وتأتي نتائج أفضل من التلاعب الواضح الذي يتوافق مع هيكل البيانات.

  • Mean/median imputation] - simple and fast, but flattens variation and can split biass.
  • Mode imputation for categorical features] - preserves the most common category.
  • Rereating a “missing” indicator[ — a separate binary feature that signals whether the value was originally missing. This allows the tree to learn patterns around missingness itself.
  • KINNN أو تراجع الافتراض ] - أكثر تطوراً ولكن مكثفاً من الناحية الحسابية، يمكن أن يستحق ذلك عندما تكون آلية المفقودين مفيدة.

وبالنسبة لأشجار القرار، فإن نهج " مؤشر الاستبعاد " قوي بوجه خاص لأن الشجرة يمكن أن تقرر ما إذا كان فرع البيانات المفقود يتصرف بطريقة مختلفة عن القيم الملاحظــة.

جدول الرسومات والقرارات

ومن المفاهيم الخاطئة الشائعة أن أشجار القرار تتطلب رفع مستوى السمات، لأن التقسيمات تقوم على مقارنات العتبة، فإن حجم السمة لا يؤثر على المكسب جيني أو على المكسب العرضي فقط، وبالتالي فإن التطبيع أو التوحيد لا ضرورة له بالنسبة لأشجار القرار النقية، ولكن يصبح من المهم استخدام أساليب الجمع مثل XGBoost أو LightGBM بالاقتران مع تنظيم خطوط الأنابيب المسبقة عن بعد.

شركة " هندسة متقدمة " لمخططات

وبخلاف الترميز والتشغيل الأساسيين، يمكن لعدة تقنيات متقدمة أن تحسن بشكل ملحوظ أداء شجرة القرار.

إنشاء سلاسل تفاعلية

ومن الطبيعي أن تكون شجرة القرار قد تكون نموذجية للتفاعلات عن طريق خلق تقسيمات متتالية على مختلف السمات، مثلاً، قد تقسم شجرة على الدخل ثم تفصل بين العمر في كل فئة من فئات الدخل، غير أن النمو الطمعي في الشجرة قد يفتقد بعض التفاعلات إذا كانت تتطلب تفرعاً عميقاً، ومن خلال خلق سمات تفاعلية يدوياً مثل أو - يمكن أن تؤدي إلى تحسين عمق.

ويمكن خلق سمات تفاعلية على النحو التالي:

  • تركيبات متعددة التخصصات (نتائج سمتين)
  • خصائص النسب (مثل نسبة الدين إلى الدخل)
  • أعلام بوليان للأوضاع المشتركة (مثلاً " هو - يونغ - و - دخل عالي -)

التألق والتخثر

وفي حين يمكن لأشجار القرار أن تعالج السمات المستمرة محليا، فإن ربطها ببعضها البعض يمكن أن يساعد في إدارة البيانات المزعجة أو أن يسلط الضوء على العتبات غير الخطية، فعلى سبيل المثال، بدلا من استخدام السن الخام، مما يخلق روابط مثل " صفر-18 " و " 19-35 " و " 36-60 " ، يمكن أن يبسط الشجرة عندما لا تكون العلاقة احتكارية تماما، ويستخدم الحذر: فالتضاحية المعلومات، ولكن الحساسية الترابط يمكن أن تؤدي إلى الحد من تحسين القدرة على التكيف.

Domain-Specific Features

ولا تحل تقنية هندسية خاصة محل المعرفة في مجال المخدرات، ففي نموذج للكشف عن الغش، مثلا، يؤدي إيجاد سمات مثل " عدد المعاملات في الساعة الأخيرة " أو " متوسط حجم المعاملات مقارنة بخط الأساس المستخدم " إلى مكاسب أكبر من التحولات العامة، وينظر دائما في السياق التجاري أو العلمي عند تصميم الملامح.

التقنيات اللازمة لتحسين نتائج عملية اتخاذ القرارات

وحتى مع وجود سمات ممتازة، لا تزال شجرة القرار تبالغ في صلاحيتها أو تقلل من أدائها إذا لم تكن مقيدة على النحو المناسب، وتعالج التقنيات التالية كلا من النهج النموذجي واستراتيجيات التجميع.

اختيار الأعضاء

ومن الطبيعي أن تؤدي أشجار القرار اختيار الملامح فقط باستخدام سمات تقلل من الشدة، ولكن عندما توجد العديد من السمات غير ذات الصلة، قد تظل الشجرة تقسم عليها بالصدفة والملاءمة.

  • Filter methods] - correlation with target, chi-square test, mutual information.
  • Wrapper methods] — recursive feature elimination (RFE) that iteratively removes the least important features.
  • Embedded methods] — tree-based feature importance from a preliminary Random Forest or Extra Trees model.

ويؤدي القضاء على السمات المزعجة إلى تقليص مساحة البحث، مما يؤدي إلى أشجار أصغر وإلى تعميم أفضل.

الهروب

الركض هو الدفاع الرئيسي ضد الإفراط في استخدام أشجار القرار، وهناك نهجان رئيسيان:

  • Pre-pruning (early stop)] - وقف نمو الأشجار قبل أن يصبح معقداً جداً. Common hyperparameters: ], , , . Setting a small (e10).
  • Post-pruning (cost-complexity pruning)] - Grow a full tree and then trim back branches that contribute little to performance, using a complexity parameter (ccp alpha in scikit —learn) This method can yield opt opt tree sizes without manual depth limits.

وما بعد التدقيق هو عموماً أكثر توجهاً نحو البيانات ويمكن أن يجد أفضل تبادل بين التناسب والتعقيد.

Hyperparameter Tuning

فجرات اتخاذ القرارات تكشف عن عدة مقاييس ضغطية تتحكم في النمو والتعميم، ويمكن أن يحقق البحث المنهجي عن الشبكات أو البحث العشوائي عن البارامترات التالية مكاسب كبيرة:

  • max depth] - Controls maximum tree depth. Smaller values prevent overfitting.
  • min samples split] - الحد الأدنى من العينات اللازمة لتقاسم عقد داخلي.
  • min samples leaf] - Minimum samples required to be at a leaf node. Smooths the model by preventing leaves with very few samples.
  • min impurity decrease - Only split if the impurity decrease is above a threshold. similar to a complexity penalty.
  • criterion] - Choice between Gini and entropy for classification; MSE or MAE for regression.

عندما يلتحم، دائماً ما يستخدم التقاطع لتجنب الإفراط في الاستفادة من مجموعة المصادقة.

الطرائق المجمّعة

وتشكل أشجار القرار الوحيدة نماذج عالية التوافر، إذ إن الجمع بين العديد من الأشجار في مجموعة من الأشجار يقلل بشكل كبير من التباين مع الحفاظ على تحيز منخفض، وأكثر النهج شعبية هي:

  • Random Forests] – Build many trees on bootstrapped samples, each using a random subset of features. Final prediction is the majority vote (classification) or average (regression). Random Forests are robust, handle high-dimensional data well, and are less prone to overfitting than a single tree.
  • Gradient Boosting Machines (GBM)] - Trees are built sequentially, each correcting errors of the previous ensemble. Popular implementations include XGBoost, LightGBM, and CatBoost. GBMs often achieve state-of-art performance but require careful tulement ratio of learning rate, tree depth, tree depth,
  • Extra Trees (Extremely Randomized Trees)] - Similar to Random Forests but with even more randomness: split thresholds are chosen randomly instead of via impurity minimization. This can reduce variation further, though sometimes at the cost of a slight bias increase.

وبالنسبة لمعظم المشاكل العملية، بدءاً بخط أساس غابات الرندوم ثم محاولة إحداث تغيير في نوع الجنس، فإن كلا الإطارين متاحان في المكتبات الشعبية مثل التلقين الكيميائي، وشركة XGBoost، والشبكة العالمية للتنوع البيولوجي.

تدفق العمل العملي لمشاريع خط القرار

ولدعم الأفكار المذكورة أعلاه، يوجد هنا تدفق عملي للعمل على تطبيق أشجار القرار مع هندسة السمات:

  1. Exploratory Data Analysis (EDA)] - فهم أنواع البيانات والأنماط المفقودة والتوزيع والارتباطات.
  2. Basic feature engineering] – Encode categoricals, impute missing values with indicator flags, create simple domain features.
  3. Train a baseline single tree] – Evaluate performance and identify potential overfitting (large tree, perfect training accuracy).
  4. Add]
  5. Feature selection] - Use importance from a Random Forest or filter methods to reduce dimensionality.
  6. Hyperparameter tuning] — Perform grid search on the single tree (without ensemble) to understand opt depth and leaf sizes.
  7. Ensemble building] – Train a Random Forest or gradient boosting model. Tune ensemble-specific hyperparameters (number of trees, learning rate, subsample).
  8. Evaluation and interpretation] - Use feature importance plots, partial dependence plots, and tree visualization to validate that the model aligns with domain knowledge.

خاتمة

ولا تزال أشجار القرار تشكل حجر الزاوية في التعلم الآلاتي لأنها قابلة للتفسير، وتتطلب قدراً ضئيلاً من التجهيز المسبق للبيانات، ويمكنها أن تلتقط أنماطاً معقدة، غير أن أداءها يؤثر تأثيراً كبيراً على نوعية الملامح التي تغذيها، ومن خلال استخدام تقنيات هندسية خاصة من المزيجات المفص َّلة ومناولة البيانات المفقودة لإيجاد سمات تفاعلية وملامح فكرية - فإنكم تخول أشجار القرار لإيجاد تقسيمات أكثر نظافة.

وتأتي مكاسب أخرى من التمشيط الحكيم، والتنقية المفرطة، ولا سيما الأساليب التي تجمع مثل الغابات العشوائية والارتفاع التدريجي، وكثيرا ما يكون الجمع بين السمات المصممة جيدا والتنوع الجماعي هو الفرق بين نموذج متوسط الحجم ونموذج يؤدي بصورة موثوقة في الإنتاج.

وكما تطبق هذه التقنيات، تذكر أنه لا يمكن لأي كمية من الهندسة أن تحل محل نظرة على النطاقات، وتبدأ دائما بفهم عميق للبيانات والمشكلة، وتستكشف الوثائق الرسمية التي تتعلم عن وأشجار القرار ، ونموذج شامل لتضمينها مشاريع الهندسة ، ونموذجها المتطور