إن أشجار القرار لا تزال واحدة من أكثر خوارزميات التعلم الآلى تفسيراً واتساعياً لكل من التصنيف والتراجع، كما أن هيكلها الهرمي القائم على القواعد يعكس عملية صنع القرار، مما يجعلها خياراً أكثر دقة بالنسبة للمحللين وعلماء البيانات، ولكن نادراً ما يكون أداء أي نموذج للشجرات، أو أي نوع من أنواع الدقة العشوائية، أو نماذج مجهزة حسب نوعها، مصممة بشكل حاسم.

لماذا مسائل التجهيز الأولي لمخططات القرار

وعلى عكس نماذج عديدة أخرى للتعلم الآلي (مثلاً، التراجع الخطي، والشبكات العصبية)، فإن أشجار القرار قوية نسبياً لبعض القصور في البيانات، فعلى سبيل المثال، يمكنها التعامل مع العلاقات غير الخطية دون هندسة واضحة، وهي متحفزة على التحولات في السمات الأحادية، ومع ذلك، فإن المعالجة المسبقة ما زالت ضرورية لعدة أسباب:

  • Handling Inconsistent Data:] Missing values, typos, or mislabeled categories can cause the tree to make splits that do not reflect true patterns, leading to biased or inaccurate models.
  • Reducing Complexity:] Irrelevant or redundant features introduce noise, increase tree depth, and raise the risk of overfitting. Selective pre processing curtails this complexity.
  • Improving Interpretability:] Clean, well-encoded data yields trees with meaningful splits that domain experts can readily understand and validate.
  • Enabling Ensemble Methods:] Techniques like random forests and gradient boosting are even more sensitive to data quality because they aggregate many trees. Pre processing ensures that each tree in the ensemble learns from high-quality signals.

فالتجهيز الفعلي لأشجار القرار يُحقق توازنا بين الحفاظ على الهيكل الأصيل للبيانات وإزالة العقبات التي من شأنها أن تضلل معيار التقسيم (مثلا، شدة جيني أو طفرة)، وتورد الفروع التالية بالتفصيل أكثر التقنيات تأثيرا، التي يُطلب من الأساس إلى المتقدم.

معالجة البيانات المفقودة: أكثر من مجرد البتر

فالبيانات المفقودة مبنية على بيانات العالم الحقيقي، ويمكن لأشجار القرار أن تعالج جزئياً القيم المفقودة - وبعض التنفيذات )مثلاً في مجال التعلم المجم َّع( يمكن أن تقسم العينات مع القيم المفقودة باستخدام " تقسيمات الغطاس " ، غير أن الاعتماد فقط على هذه الآلية القائمة هو دون المستوى الأمثل، لا سيما عندما تكون نسبة المفقودين مرتفعة أو عندما تكون البيانات المفقودة مفيدة.

تحديد آليات المفقودين

قبل اختيار طريقة، فهم سبب فقدان البيانات:

  • Missing Completely at Random (MCAR): ] The missingness has no relationship with any other variable. Deleting these records is safe but wasteful.
  • Missing at Random (MAR): ] The missingness depends on other observed variables (e.g., women are more likely to abandon a weight question). Imputation that uses those other variables works well.
  • Missing Not at Random (MNAR):] The missingness depends on the unobserved value itself (e.g., people with very high income refuse to report income). This is tricky; consider using a “missing indicator” column to flag such cases.

تقنيات الصنع

() تبسيط عملية الزرع (المتوسط، الوسيط، الطريقة) هو سريع ولكنه كثيرا ما يُحدث تحيزاً من خلال تجاهل العلاقات بين الملامح، وبالنسبة لأشجار القرار، يتمثل نهج أفضل في استخدام بنية الشجرة: يمكنك تدريب شجرة أولية للتنبؤ بالقيم المفقودة لسم معين باستخدام سمات كاملة أخرى، وهذا هو أساساً أسلوب قوي آخر هو [LFT].

] For large missingness (e.g., ⁇ 50% of a feature): Consider drop the feature entirely. If the feature is critical, create a separate “missing” category for categoricalتغيير or flag missingness as a binary indicator for numeric features. Many decision tree implementations treat these indicators naturally, allowing the tree purchasen itself is predictive.

Recommended Library: ] ]pandas for basic imputation, scikit-learn's simplepleImputer and Iterative Imputer for more advanced strategies.

Encoding Categorical Variables: Preserving Order without Bias

وتحتاج أشجار القرار إلى مدخلات رقمية، فالتدبير يحوّل الفئات إلى أرقام، ولكن اختيار طريقة التزيين يؤثر تأثيرا قويا على سلوك الشجر المفترق، والمفتاح هو تجنب إدخال علاقات اصطناعية غير موجودة.

Nominal vs. Ordinal Categories

  • Ordinal categories] have a natural order (e.g., education level: high school < bachelor’s < master’s). Use Label Encoding] (assign integers 0,1,2,...) and the tree will naturally pick up order-based splits if the order aligns with the target mapping respect the integer.
  • Nominal categories] (مثل اللون: الأحمر، الأخضر، الأزرق) ليس له أي ترتيب جوهري.

التوسيع المتقدم لمخططات القرار

وقد قامت بعض عمليات التنفيذ )مثل شركة لايت جي بي إم وكاتبوست( بصنع مناولة شاملة، وعلى سبيل المثال، استخدمتات مرخصة باستخدام الهدف الذي يقلل من الملاءمة المفرطة، وإذا ما كنت تبني شجرة من الخدش أو تستخدم التلقيم المدخن، فربما تحتاج إلى التزيين يدويا، وتقيم دائما الأداء بخيارات مختلفة في الترميز؛ وأحياناً طرقاً بسيطة في شكل بطاقة واحدة تُحد من أشكالها.

جدول الرسوم: عندما يتعلق الأمر وعندما لا يكون

وأشجار القرار غير متماثلة في التحولات الاحتكارية (التضخم، واللوغاريتم، وما إلى ذلك) لأنها تقسم على عتبات تتعلق بالتوزيع الداخلي للمميز، وتنتج سمة ممتدة إلى [0] نفس الانقسامات التي تُقَدَّم إلى [100] - الشجرة تُعدِّل العتبة ببساطة، لذا، فإن التوسع غير ضروري عموماً بالنسبة لتصورات القائمة على اتخاذ قرار واحد.

  • Ensemble methods like gradient boosting may use regularization that benefits from scaled features (e.g., XGBoost’s `max delta step ' parameter).
  • Compbining with other algorithms (e.g., using PCA to reduce dimensionality before a decision tree) requires scaling to prevent features with larger magnitudes from dominating principal components.
  • Visualization and interpretability:] Scaling can make split thresholds easier to discuss across features measured in different units.

وإذا اخترتم المقياس، أو استخدام Min-Max scaling] (إلى [0] أو [1]] أو Standardization (ZINScore) وكلا العمل؛ وتحافظ بدلة ميكروف على نطاق السمات، بينما يقل تأثير التوحيد القياسي في المعالم الخارجية.

معالجة المعالم: دع شجرة القرن (معظمها)

فأشجار القرار مقاومة بشكل ملحوظ للآفاق، لأن الانقسامات تقوم على إحصاءات النظام، ولا تؤثر قيمة واحدة قصوى إلا على الفرع الذي يحتوي عليه، وعلى خلاف النماذج السطرية، فإن المتفوقين لا يسحبون النموذج بأكمله، ولكن يمكن أن يسببوا مشاكل:

  • Excessive tree depth:] A tree might create many splits to isolate a few outlier points, leading to overfitting.
  • Noisy splits:] Outliers can create false regions that don’t generalize, especially if combined with missing data.

وتتمثل أفضل الممارسات في cap or winsorize] extreme values at a reasonable percentile (e.g.st and 99th percentiles)() وكبديل لذلك، تحول المعالم باستخدام الشعار أو تحويل البوكس إلى الحد من الكظر، ولكن ملاحظة أن وجود الشجر يعني التحول إلى تغيير حدود القرار ما لم تبعد أيضاً عن أوضاع الأشجار المعتدلة.

اختيار الخصائص: أقل هو أكثر

وتؤدي أشجار القرار تلقائياً نوعاً من اختيار المعالم باختيارها تقسيماً يزيد من مكاسب المعلومات إلى أقصى حد، ومع ذلك، فإن من بين هذه السمات الكثير من السمات غير ذات الصلة يمكن أن ينتقص من الأداء:

  • Noise dilution:] The tree may accidentally split on a noisy feature that appears to have high information gain due to chance, especially with small datasets.
  • Increased computational cost:] More features mean more candidate splits, slowing training.
  • Overfitting:] The tree can become unnecessarily complex.

(ه) استخدام تصفية الأساليب ] (مثل ربطها بالهدف، اختبار سعة النطاق للملامح القاطعة، والمعلومات المتبادلة) لفحص الملامح الرئيسية مسبقاً. ] ومن ثم فإن أساليب الحرق (مثل إزالة السمات الرجعية) هي أكثر دقة وإن كانت باهظة التكلفة.

التقنيات المتقدمة في مجال التجهيز الأولي

التوحيد والتدنيس

ومن الطبيعي أن تكون أشجار القرار متماسكة في نقاط انقسام، ولكن ]الجبهة التحريرية: صفر[[ ]تضفي على السمات المستمرة ][ ]FLT:1][ إلى عدد صغير من الصفات )مثلاً، استخدام نظام متكافئ أو متكافئ من حيث التردد( يمكن أحياناً أن يحسن من إمكانية الترجمة الشفوية ويقلل من الإفراط في الاستحقاق، خاصة عندما لا تكون العلاقة بين السمة والهدف محسوبة.

إنشاء سلاسل تفاعلية

وقد تلتقط أشجار القرار التفاعلات ضمنياً من خلال التقسيمات الهرمية (مثلاً، الانقسام الأول على السن، ثم على الدخل) ولكن إذا كان التفاعل متوقعاً للغاية وينطوي على سمة ذات فروق منخفضة، قد تحتاج الشجرة إلى الكثير من الشقوق لالتقاطها، مما يخلق بوضوح سمة جديدة تجمع بين متغيرين (مثلاً، " الدخل " ) يمكن أن يجعل الشجرة أكثر فعالية، غير أن يزيد هذا التفاعل أكثر من حيث يمكن أن يزيد من حيث يمكن أن يكون أكثر من حيث الشكل.

بيانات متوازنة

وعندما تكون الفئات المستهدفة غير متوازنة بدرجة كبيرة (مثل الكشف عن الغش مع احتيال بنسبة 1 في المائة)، تصبح أشجار القرار منحازة نحو فئة الأغلبية.

  • Resampling:] Undersample the majority class or oversample the minority class using ] SMOTE [Synthetic Minority Oversampling Technique). SMOTE creates synthetic examples by interpolating between knearest neighbourss conlltic hureve points.
  • Costsensitive learning: ] Many tree implementations allow assigning different misclassification costs per class (e.g., `class weight='balanced' in scikit —learn). This adjusts the impurity criterion to penalize mistakes on the minority class more heavily.
  • Ensemble with balanced bootstrapping:] For random forests, use balanced bootstrap samples where each tree is trained on a balanced subset.

ترجمة النص والتاريخ

Text data:] Convert to bag‐ofwords or TF-IDF vectors. Decision trees (especially deep ones) can still work with high-dimensional sparse text features, but consider reducing dimensionality via topic modeling or keyword extraction.

Date/time data:] Extract cyclic features ( hours of day, day of week, month) and treat them as ordinal or nominal. For trends, generate time since a reference point. Decision trees can capture seasonality and trends well if the derived features are meaningful.

تدفق العمل العملي لبيانات معالجات ما قبل المعالجة

ويكفل تدفق العمل المنهجي الاتساق ويتجنب تسرب البيانات (يستخدم عن غير قصد المعلومات المستهدفة أثناء عملية التجهيز الأولي، مما يبطل التقييم).

  1. Split data early:] Separate into training, validation, and test sets before any pre processing that uses target information (e.g., target encoding, SMOTE).
  2. Handle missing values] on training set using appropriate imputation. Store imputation parameters (e.g., median values) to apply to validation/test sets.
  3. Encode categoricalتغييرات based on training set categories. For label encoding, preserve mapping; for one —hot, handle unknown categories in test set by grouping them.
  4. Treat outliers (capping) using percentiles computed on training data.
  5. Apply feature scaling] if needed (e.g., for ensemble or dimensionality reduction).
  6. Feature selection] using training set only. If using feature importances from a tree, ensure the tree is trained on the training set.
  7. Resampling for imbalance] on the training set (oversample minority) after splitting, to avoid leaking synthetic points into the validation set.
  8. Build the decision tree] with appropriate hyperparameters (e.g., `max depth ', `min samples leaf`, `min impurity decrease ' ).
  9. Evaluate] on unseen test set to assess generalization.

وينطبق هذا التدفق على الأشجار الوحيدة والتجمعات المزروعة والمزدحمة، وبالنسبة للتجمعات، النظر في إضافة خطوة هامة إلى خطوة اختيار السمات بعد عملية أولية، ثم إعادة البناء.

الشلالات المشتركة وكيفية تجنبها

  • Data leakage from imputation:] never compute mean/median on the entire dataset before splitting.
  • One —hot encoding causing sparsity:] For high —cardinality categoricals, consider hashing or target encoding to keep feature count manageable.
  • ] Ignoring domain knowledge:] Pre processing should’t be strictly automated. For example, in medical data, a missing laboratory value might mean “test not ordered” rather than “unknown.” Create a flag.
  • Over-fitting on small datasets:] Use simpler pre processing (drop features with many missing values, use basic imputation) and heavy pruning.
  • Assuming scaling is always unnecessary:] While true for a single tree, gradient‐boosted trees (e.g., XGBoost) can benefit from scaled features when using regularization parameters.

خاتمة

إن تجهيز البيانات مسبقا ليس مهمة واحدة من نوعها؛ فأفضل التقنيات تتوقف على الخصائص المحددة لمجموعات بياناتكم وعلى متغيرات شجر القرار التي تختارونها، غير أن المبادئ تظل ثابتة: فهي تهدف إلى توفير بيانات نظيفة ومحسنة التنظيم تحافظ على أنماط ذات معنى مع إزالة الضوضاء، والبدء في التعامل القوي مع القيم المفقودة، والتدقيق في تحديد المتغيرات القاطعية، واختيار المميزات المدروسة، ستؤدي إلى تحقيق أكبر التحسينات.

تذكر أن التجهيز المسبق مكرر، وبعد تدريب نموذج أولي، تفحص عمق الأشجار الناتج، والسمات المستخدمة في التقسيم، وتوزيع التنبؤات - لفهم ما قد لا تزال هناك بيانات، واستخدام الخبرة في المجال للتحقق من أن الانقسامات منطقية، وباستثمار الوقت في التجهيز المسبق السليم، تبني أشجار قرارات لا تكون دقيقة فحسب بل قابلة للتفسير والقوية، مما يجعلها أصولا قيمة في أي مجموعة أدوات علمية للبيانات.