Table of Contents
فالفصل هو حجر الزاوية في تحليل البيانات، مما يتيح للمنظمات اكتشاف الأنماط، وإضفاء الطابع الشخصي على التجارب، ودفع القرارات، وكثيرا ما تعتمد النهج التقليدية على أساليب مشرف عليها مثل أشجار القرار أو الطرق غير الخاضعة للرقابة مثل التجمُّع، ولكن لكل منها بقع عمياء، وتحتاج أشجار القرار إلى هدف محدد مسبقا ويمكن أن تفوت الهياكل الخفية في البيانات، وتكتشف التجمعات الطبيعية دون أن تقدم قواعد للكشف عن أسباب وجود نماذج متفرقة.
فهم اتجاهات القرار
وتخضع أشجار القرار لإشراف نماذج تعليمية تتوقّع متغيراً مستهدفاً عن طريق تقسيم البيانات على نحو متكرر عن قيم السمات، ويخلق كل فصل عقداً يطرح سؤالاً بنعم/لا، على سبيل المثال، " هل سن الثلاثين؟ " - وينتهي المسار من جذور إلى أوراق في التنبؤ، ويختار الخوارزميات تقسيماً تزيد من مكاسب المعلومات (أو تقلل التخلف) في كل خطوة.
وأشجار القرار شعبية إلى حد كبير لأنها قابلة للتفسير، ويمكن تصور الشجرة الناتجة عنها على أنها مجموعة من القواعد إذا ما أمكن لخبراء المجال أن يفهموا وتثبتوا، فهي بحاجة إلى الحد الأدنى من تجهيز البيانات (لا حاجة إلى رفعها) ويمكن أن تعالج الملامح العددية والقاطعة على حد سواء، غير أن لديها قيودا، وأشجار القرار عرضة للتجاوز، لا سيما إذا ما نمت في عمق دون تشفير، كما أنها تفضّل الأنماط غير التمييزية على الصعيد العالمي، التي كثيرا ما تكشف عن وجود هياكل محلية.
Understanding Clustering Algorithms
ولا تخضع الخوارزميات التجميعية للرقابة: فهي بيانات تقسيمية إلى مجموعات تستند إلى التشابه دون أي نتيجة تحمل علامات محددة، وكل نقطة تنتمي إلى مجموعة من هذه النقاط في المجموعة نفسها تشبه بعضها البعض فيما يتعلق بنقاط في مجموعات أخرى، ويتوقف تعريف " الترميز " على الكثافة الخوارزمية، وتستخدم الكائنات الحية المتطورة من مختلف المجموعات.
ويمكن أن يكشف عن أجزاء من المحلل البشري لم يكن قد نظر فيها قط، ولكنه لا يوفر قواعد واضحة للسبب في تخصيص نقطة لإحدى المجموعات، كما أن المجموعات حساسة للبدء في العمل، والارتقاء، والمقاييس الفائقة الأهمية، والأهم من ذلك أن التكتل وحده لا يوفر نموذجاً يمكن أن يصنف نقاط بيانات جديدة دون إعادة إدارة نقاط التكتل الجديدة.
لماذا "الكوبين" ؟
وتعالج أشجار القرار المتجمعة مع التجميع مواطن الضعف في كل طريقة، ويعمل تدفق العمل المشترك على مرحلتين:
- Clustering Phase:] Apply an unsupervised algorithm to discover the natural groups in the data. This step does not require any labels and reveals segments that may correspond to client types, disease subtypes, or behavioral cohorts.
- Supervised Phase:] Use the cluster assignments as a new target variable. Train a decision tree to predict which cluster a data point belong to based on its feature values. The resulting tree can be used to classify new data into the same discovered segments, without re-clustering.
وهذا التآزر يعطيك أفضل العالمين: فالشجرة توفر نموذجاً مفسراً يستند إلى القواعد يمكن نشره في الإنتاج، وتستمد المجموعات نفسها من البيانات بدلاً من فرضها بواسطة علامة، كما تساعدك الشجرة على فهم أهم السمات في التمييز بين المجموعات، وتقدم معلومات عن ما يحدد كل جزء.
منهجية الخطوة خطوة خطوة خطوة إلى الأمام
الخطوة 1: إعداد البيانات واستكشافها
البدء في استكشاف البيانات بصورة شاملة - استخدام الإحصاءات الموجزة، والرسوم البيانية، وقطع الطوابق لفهم التوزيع، والربط، والقيم المفقودة - تنظيف البيانات: معالجة القيم المفقودة (البسيطة أو الانزالية)، وإزالة الازدواج، ومعالجة المعالم الخارجية بحذر، والارتقاء بالمستوى المميزي للمجموعات هو أمر هام بالنسبة للزيادات الموزعة من بعد مثل حركة " K-Means " ، وتوحيد السمات الرقمية التي تسهم جميعها على قدم المساواة.
الخطوة 2: تطبيق نظام " الغوريثم " الجماعي
)أ( اختيار خوارزمية تستند إلى حجم البيانات وهيكلها: بالنسبة للمجموعات النظيفة والمجدية، تعمل الشبكة بكفاءة على مجموعات بيانات كبيرة، وبالنسبة للأشكال غير القانونية أو الكثافة المختلفة، فإن الشبكة الأوروبية للتعاون التقني أو المنظمة الأوروبية للطاقة الذرية، تحدد عدد المجموعات )للمناطق الكيمياء( باستخدام طريقة النوافذ، أو درجات الارتداد، أو المعرفة بالمنطقة.
الخطوة 3: بيانات تحديد الهوية مع تكليفات المجموعات
إنشاء عمود جديد في مجموعة بياناتكم: " المجموع - 8 " ، يصبح هذا المتغير المستهدف لشجرة اتخاذ القرار، ودمج بطاقات المجموعات في الملامح الأصلية المحددة (الملامح غير المصفّاة جيدة بالنسبة للشجرة، ويمكنك استخدام إما مقيسة أو غير مقيدة)، وستتعلم الشجرة رسم الخرائط من الملامح الأصلية إلى المجموعات.
الخطوة 4: تدريب مجموعة لابلات محددة على اتخاذ قرار
(ب) نقل بياناتكم إلى مجموعات التدريب والاختبار (مثل 80/20) - يمكن أن يكون تدريب مصنف شجر القرار (مثلاً، السمات المميزة للتعلم الاختياري [(FLT:0]) باستخدام السمات الأصلية كأجهزة التنبؤ وعلامات المجموعة كهدف، ووضع مقاييس ضغطية مناسبة: الحد من عمق الأشجار لتجنب الإفراط في الصلاحية (مثلاً، الخلط بين الأوراق المالية والوزنتين)
الخطوة 5: تفسير ورؤية شجرة
وتفحص قواعد القرار المتعلمة، وتطبع أو ترسم الشجرة لترى الشقوق وعلامات الأوراق، وتقابل كل ورقة جزء )مجموعة( وتخبرك الشجرة أيضاً بما هو أهم من سمات لتمييز المجموعات، فعلى سبيل المثال، فإن قاعدة مثل " إذا كان العمر " ٤٠ ودخل متغير " المجموعة باء " تعطي وصفاً قابلاً للقراءة للإنسان للجزء، وهذه ميزة أساسية:
الخطوة 6: نشر شجرة البيانات الجديدة
ويمكن لشجرة القرار، بعد تدريبها، أن تصنف أي نقطة بيانات جديدة غير منظورة إلى إحدى المجموعات الأصلية دون إعادة ترتيب المجموعات، وهذا أمر حاسم بالنسبة للتطبيقات في الوقت الحقيقي مثل التوصيات الشخصية أو التدليس، ويمكن تسلسل نموذج الشجرة وإدماجه في خط الإنتاج، وتقييم الأداء على مر الزمن: إذا ما تحول توزيع البيانات، قد تحتاج إلى إعادة إدارة التكتلات وإعادة تدوير الشجرة دوريا.
الاعتبارات العملية
اختيار الغوريثم المجمّع
ويتوقف نجاح النهج المشترك اعتمادا كبيرا على نوعية المجموعات، وتفترض منطقة كي - ماي أن تكون متقلبة، وتكتلات مترونية، وتعمل على أفضل وجه مع سمات مستمرة، وبالنسبة للبيانات القاطعة، تنظر في K-Modes أو نهج قائم على التفريق، وتعتمد شبكة ديبوكتان على المعالم الخارجية، وتجد مجموعات غير متجانسة، وتحتاج إلى دروس دقيقة في مجال المقارنات.
تحديد العدد الأمثل للمجموعات
ومع وجود منطقة " كي - مينز " ، فإن طريقة النبيل تقطع خطى غير مقصود )مسافات مربعة( مقابل كيلو متر مربع( .وتقترح نقطة " اليلوب " كغم جيد، ولكنها ليست واضحة دائما، ويستخدم متوسطات درجات الحرير كمواد مماثلة لمجموعتها الخاصة مقارنة بمجموعات أخرى؛ ويدل ارتفاعها على الفصل الأفضل.
الموازنة بين الاستحقاق والقابلية للتنبؤ
وقد تكون شجرة القرار التي تستنسخ المجموعات بالضبط عميقة ومعقدة للغاية، ولإمكانية الترجمة الشفوية، تُشغّل الشجرة: عمق محدود إلى ٤-٦ مستويات، أو تستخدم عملية التداخل بين التكاليف، وتكون المقايضة مقبولة طالما أن الشجرة المشوهة لا تزال تحقق دقة مقبولة في مجموعة الاختبارات، وإذا انخفضت الدقة بدرجة مفرطة، فربما تنظر في ما إذا كانت المجموعات تنتج عن تداخل بسيط؛ وإذا لم يكن الأمر كذلك، فإن التكتلات التكتلات.
معالجة مجموعات البيانات الكبيرة
ويمكن أن يكون التدريب على التكتلات والأشجار مكلفاً حسابياً على ملايين الصفوف، وبالنسبة للمثليين K-Means، فإن استخدام البيانات المتوسطة المدى من طراز Mini-Batch K-Means من أجل السرعة، والشبكة أبطأ من البيانات الضخمة؛ والنظر في إمكانية استخدام مجموعة من نماذج التدريب على مجموعات المنتجات الزراعية، وبالنسبة لأشجار القرار، فإن تنفيذ نظام " Scikit-learn " يمكن أن يُه بشكل معقول، ولكن بالنسبة للبيانات الضخمة، والنظر في استخدام طريقة تجميعها كأسلوب بديل.
التطبيقات العالمية الحقيقية
فصل العملاء في التسويق
ويريد المسوقون تجميع العملاء في قطاعات قائمة على السلوك والديمغرافي وتاريخ الشراء، ويمكن أن تكشف مجموعات غير مشرفة عن أجزاء مثل " العملاء المخلصين ذوي القيمة العالية " و " الباحثين عن كشف " و " المستخدمين الجدد " ، ثم يمكن استخدام شجرة القرار التي يتم تدريبها على بطاقات المجموعات لتصنيف كل زبون في جزء تلقائيا، مما يتيح القيام بحملات شخصية.
كشف الشذوذ في أمن الفضاء الإلكتروني
ويمكن أن تكشف بيانات حركة المرور في الشبكات عن أنماط حركة المرور العادية وعزل المجموعات غير العادية )المناطق الأقل كثافة أو نقاط أقصر( وبعد تسمية المجموعات، يمكن لشجرة القرار أن تتعلم التمييز الطبيعي عن حركة المرور الشاذة، ويمكن ترجمة قواعد الشجرة إلى قواعد حائط حرائق أو قواعد نظام المعلومات المتكامل، وعلى سبيل المثال يمكن أن تقول ورقة " بروتوكول حرفي = الفينول الخماسي الكلور وطول الحزم " )١٥٠٠( ومفهومة تماما.
الصمود الطبي
وفي مجال الرعاية الصحية، يمكن تجميع المرضى على أساس الأعراض ونتائج المختبرات والبيانات الوراثية لتحديد النماذج الفرعية للأمراض، ويمكن عندئذ أن تتنبأ شجرة القرار التي يتم تدريبها على المهام الجماعية بنموذج فرعي جديد للمرضى من سمات قياسية عند الاستيعاب، كما أن تقسيم الأشجار يوفر للمستوصفين معايير تشخيصية: " إذا كان السكر في الدم " 126 و " المجموعة الثانية من مجموعة " (الديب 2) " .
فوائد النهج الموحد
- Enhanced segmentation accuracy:] The clustering step captures natural, often non-linear patterns that a single decision tree might miss. The tree then verifies and formalizes these patterns, ensuring that the segments are reproducible and distinct.
- Interpretability and transparency:] Decision trees provide explicit if-then rules that explain why a data point belong to a segment. This is invaluable for regulatory requirements (e.g., to explain credit risk decisions) and for building trust with stakeholders.
- Deployability:] Once trained, the decision tree can classify new data points immediatelyly and without re-running clustering. This makes the combined approach suitable for real-time systems.
- Feature insight:] The tree’s feature importances and split points reveal which attributes are most responsible for separating clusters. This can guide further data collection, feature engineering, or business strategy.
- Scalability:] The work flow can be parallelized and scaled. Mini-Batch K-Means and decision tree training scale well to large datasets, provided cluster assignments are computed on a representative sample if needed.
- Robustness to concept drift:] When the underlying data distribution changes, the tree can be retrained quickly on new cluster labels (if re-clustering is feasible) or periodically recalibrated.
خاتمة
(أ) تجميع أشجار القرار مع خوارزميات التجميع هي استراتيجية عملية وقوية للتجزؤ تُسد الفجوة بين استكشاف غير مشرف والتنبؤات المشرف عليها، وتُعزز الهيكل الطبيعي الذي يكتشفه التجميع والطابع المترجم لجرائم اتخاذ القرارات، وتُعد المنهجية على نحو مباشر: تجميع البيانات، وتدريب شجرة للتنبؤ بعلامات المجموعات، ثم استخدام طريقة الاختيار الجامدة.