Table of Contents
فهم اتجاهات القرار في مجال التعلم المتطور في مجال الآلات
وتمثل أشجار القرار أحد أكثر الخوارزميات سهولة المنال والترجمة في مجموعة أدوات التعلم الآلي، حيث يعكس هيكلها عمليات صنع القرار الإنساني، مما يجعلها ذات قيمة خاصة بالنسبة للتطبيقات التي تتسم فيها الشفافية النموذجية بالأولوية، وفي جوهرها، تُخصص حيز لتقسيم الأشجار في المناطق باستخدام سلسلة من الانقسامات الثنائية، مع اختيار كل جزء منها لتحقيق أقصى قدر من المكاسب أو التقليل من الازدحام في تلك العقد.
ولا تزال عملية التقسيم التصحيحية مستمرة حتى يتم استيفاء معيار التوقف، مثل بلوغ أقصى درجة من العمق، أو تحقيق عدد أدنى من العينات لكل ورقة، أو مواجهة عقد لم يعد فيه المزيد من التقسيمات يحسن نوعية التنبؤ، وهذا النهج الطمعي الذي يتجه إلى نماذج يمكن تصورها وفهمها من جانب أصحاب المصلحة ذوي الخلفيات التقنية المحدودة، وهو ميزة متميزة في الصناعات المنظمة مثل الرعاية الصحية والمالية.
وعلى الرغم من البساطة المفاهيمية لأشجار القرار، فإنها تظهر تناقضات مفاجئة، فهي تعالج كلا من السمات العددية والفصيحة، بطبيعة الحال، وتحتاج إلى حد أدنى من التجهيز الأولي للبيانات، ويمكن أن تُضفي طابعا نموذجيا على العلاقات غير الخطية دون هندسة خاصة واضحة، وقد صممت هذه الخصائص مكانها كبنة أساسية للبناء في تدفقات العمل في مجال علوم البيانات، سواء كنموذجين قائمين على أساس واحد أو كعنصر في هياكل أكثر تعقيدا.
التحديات التي تواجه القدرة على التكيف في بيئات البيانات الضخمة
ومع تراكم المنظمات للأدوية والفولطية للبيانات، أصبحت الخصائص الحاسوبية للتدريب على شجرات القرار بالغة الأهمية، وقد صُممت الخوارزميات المعيارية، بما فيها ID3 وC4.5 وCART، من أجل مجموعات بيانات تناسب الذاكرة، وفي سياقات البيانات الكبيرة، ظهرت عدة تحديات محددة يمكن أن تتدهور الأداء وتحد من الانطباق.
Computational Complexity of Split Finding
وفي كل عقد من هذه الاجتماعات، يجب أن يقيّم الخوارزمية كل سمة من سمات جميع نقاط تقسيم المرشحين، ويتطلب ذلك، بالنسبة للملامح المستمرة، فرز البيانات والنظر في كل قيمة فريدة كعتبة محتملة، وتعقد هذه الجداول الزمنية على أنها علامة O(m) n) على كل رمز، حيث يكون عدد الملامح، والعدد غير الملاحظ للعينات التي تصل إلى تلك العقد، وفي الأشجار العميقة التي تم تدريبها على مجموعات البيانات الضخمة، تصبح هذه العلاقة الرباعية الاختناق كبيرة.
الذاكرة و I/O Constraints
ويتطلب تدريب شجرة القرار الحصول عشوائيا على بيانات التدريب في كل عقد من الزوايا لتقييم التقسيمات، وعندما تتجاوز البيانات البيانات المتاحة عن تقييم حركة السجلات والمحفوظات، يجب أن تعتمد الخوارزمية على التخزين القائم على الأقراص، مع إدخال رؤوس كبيرة من الدول الصلبة، وحتى مع وجود قوالب حديثة ثابتة، فإن عدم ملاءمة بيانات القراءة من الأقراص لكل تقييم منقسام يزيد من وقت التدريب بدرجة كبيرة، ويزيد الضغط الافتراضي من الحاجة إلى الحفاظ على هيكل الأشجار نفسه، الذي يمكن أن ينمو فيه.
الإفراط في الملاءمة والتعميم
وكثيرا ما تتضمن بيئات البيانات الضخمة إشارات وضوضاء على نطاق واسع، حيث أن أشجار القرار عرضة للتجاوز لأنها يمكن أن تخلق انقسامات شديدة التحديد تلتقط أجهزة الإيديوسينكوز في بيانات التدريب بدلا من الأنماط العامة، وفي مجموعات البيانات الكبيرة، يمكن أن يبني النموذج آلاف العقدات، وكلها تمثل شريحة ضيقة من البيانات، مما يؤدي إلى ارتفاع تنبؤات التباين، وتساعد تقنيات الفرز في تخفيف هذا الخطر ولكن تتطلب إضافة مضاعفة.
البيانات المتوازنة والعالية الديموقراطية
وتشمل العديد من تطبيقات البيانات الضخمة مجموعات بيانات ذات اختلال درجي متطرف أو آلاف الملامح، وتميل أشجار القرار التي يتم تدريبها على البيانات غير المتوازنة إلى تفضيل فئات الأغلبية، مما يؤدي إلى تدنية الشدة العامة في الوقت الذي يتجاهل فيه أداء الأقليات، وتزيد فيه الأماكن ذات السمات العالية الأبعاد من العبء المحسوب لأن الخوارزمية يجب أن تقيِّم المزيد من المقسمات في كل عقد، وقد تكون العديد من السمات غير ذات أهمية، مما يضيف ضوضاءة إلى عملية الاختيار.
النهج التقنية المتبعة في عملية توسيع نطاق عمليات اتخاذ القرارات
وقد وضع الباحثون والممارسون استراتيجيات متعددة للتصدي لهذه التحديات المتعلقة بالتعقيد، وتتراوح هذه النهج بين التعديلات الافتراضية إلى تحقيق أقصى قدر من الكفاءة على مستوى الهياكل الأساسية، وكل منها مبادلات خاصة به من حيث الدقة والقابلية للتفسير والاحتياجات من الموارد.
أخذ العينات والاختلاط
ومن بين أبسط التقنيات وأكثرها فعالية، تدريب أشجار القرار على مجموعات فرعية تمثيلية من مجموعة البيانات الكاملة، وحافظ عينات الرناد على توزيع البيانات الذي يقوم عليه، مع الحد بشدة من الاحتياجات الحاسوبية، ويمضي أخذ العينات المستقرة إلى أبعد من ذلك بضمان تمثيل كل فئة أو فئة فرعية تمثيلاً متناسباً في العينة، مع الحفاظ على الأداء النموذجي على فئات الأقليات، ويختار الاعتبار الرئيسي عند استخدام العينات حجماً كافياً دون تضحية.
البحث عن سبليت تقريبا
بدلاً من تقييم كل نقطة انقسام محتملة للسمات المستمرة، تستخدم الخوارزميات التقريبية مقاييسه أو ملخصات كمية لتحديد عتبات المرشحين الواعدة.
التدريب الموازي والمنتشر
على مستوى العقد، يمكن حساب التقييمات الفردية المقسمة بشكل مستقل عبر الملامح، وعلى مستوى الأشجار، تجمع الطرق مثل الغابات العشوائية تُدرب أشجاراً متعددة في موازاة، ولا تطبق الأطر الحاسوبية الموزعة هذه الأنماط بتقسيم البيانات عبر عُدد العمال وتجميع الإحصاءات المقسمة، على سبيل المثال، تستخدم إحصاءات أباتشي سبارك ملغمة حسب الخطة،
التعلم على أساس التكافل وعلى الإنترنت
وفي السيناريوهات التي تصل فيها البيانات باستمرار، لا يمكن عمليا إعادة توجيه أشجار القرارات من الصفر في كل تحديث، إذ أن خوارزميات شجرة القرار على الإنترنت، مثل الأشجار المتحركة، وتجهيز البيانات بصورة تدريجية، وتستخدم اختبارات إحصائية لتحديد متى رأى العقد بيانات كافية لاتخاذ قرار منقسم على الثقة، وتحديث هيكل الأشجار بصورة دينامية، وهذا النهج له قيمة خاصة في تيار تطبيقات مفهومية عائمة الزمن دون أن يكيف مع النماذج القائمة على التنظيف.
استراتيجيات التشغيل والتوحيد
إن مراقبة تعقيد الأشجار أمر أساسي بالنسبة للتقسيم والتعميم، إذ أن التكهن السابق يتوقف عن نمو الأشجار في وقت مبكر عن طريق الحد من العمق، أو الحد الأدنى من العينات لكل ورقة، أو الحد الأقصى لعدد الشجائر، ثم ينمو الأشجار الكاملة، ثم يزيل الفروع التي توفر الحد الأدنى من التحسين على بيانات المصادقة، كما أن أساليب التثبيت، بما في ذلك الحد الأدنى من العتبات الافتراضية، والتعقيد في التكاليف، توفر سبلا منهجية للموازنة بين حجم الأشجار وبين الأداء التنبؤي.
التحليل المقارن: اتجاهات القرار مقابل الطرائق المشتركة
وفي حين أن أشجار القرار الوحيدة توفر إمكانية الترجمة الشفوية، فإن أداءها المتوقع ومدى قابليتها للتصعيد غالبا ما يكونان قصيرين مقارنة بتجمع الأساليب في بيئات البيانات الكبيرة، ففهم هذه المفاضلات يساعد الممارسين على اختيار النهج الصحيح في حالة استخدامهم المحددة.
الغابات العشوائية للبارالية والاستقرار
وتدرب الغابات العشوائية أشجارا متعددة لاتخاذ القرارات على عينات مجهزة بالأحذية من البيانات ومجموعات فرعية عشوائية من الملامح، ثم تُعدّل توقعاتها، وهذا التوازي المتأصل يجعل الغابات العشوائية قابلة للتصعيد بدرجة كبيرة لأن الأشجار الفردية يمكن تدريبها بشكل مستقل عبر مجموعة، كما أن النهج التجميعي يقلل من التباين ويحسن التعميم مقارنة بالأشجار الوحيدة، وبالنسبة للعديد من مهام التصنيف والتراجع، فإن الغابات العشوائية توفر أساسا قويا يتطلب الحد الأدنى من التناسب مع ارتفاع الارتفاعي.
التأشيرة السريعة من أجل تحقيق الاستخدام الأمثل
وتتكون الأشجار الموازية من الأشجار المتطورة، مع تصحيح كل شجرة جديدة لأخطاء تلك الأشجار السابقة، كما أن أطرا مثل XGBoost، واللايت جي بي إم، وكاتبوست أصبحت معايير صناعية لمهام البيانات المنظمة، وهي تتضمن تصورات متطورة تشمل أنماط الوصول إلى المعلومات المتعلقة بالمناخ، والحسابات غير الأساسية، وتسريع وتيرة تطبيق نظام الأفضليات المعمم.
شجرة واحدة مقابل مجموعات في الإنتاج
وفي نظم البيانات الضخمة، نادرا ما تنشر أشجار القرارات الوحيدة كنموذج نهائي، وتكمن قيمتها الرئيسية في التحليل الاستطلاعي، واختيار المعالم، ووضع خطوط أساس يمكن تفسيرها، وبالنسبة للتنبؤات العالية المتناول التي تتطلب الدقة والنواتج، فإنها تهيمن على بعضها البعض، وكون عدم التناسب مع نطاقات الأساليب المجمعة متمشية مع عدد الأشجار، ولكن هذا الرؤوس الإضافية مقبولة في معظم التطبيقات الأساسية القائمة على دفعات والرسومات.
الأدوات والأطر اللازمة لاتخاذ القرارات المتعلقة بالبيانات الضخمة
ويتوقف التطبيق العملي لأشجار القرار على النطاق العملي اعتمادا كبيرا على الأدوات والأطر المتاحة، وقد نضج النظام الإيكولوجي بدرجة كبيرة، حيث توفر خيارات متعددة مختلفا من حيث الأداء، وسهولة الاستخدام، وقدرات التكامل.
Apache Spark MLlib
(سبارك ميلب) يقدم عمليات تنفيذ موزعة لأشجار القرار والغابات العشوائية، ودفع مستويات أعلى للبيانات المخزنة في أكاديم البيانات أو السجلات والمحفوظات، ويستخدم خوارزمياته القائمة على الأشجار استراتيجية اتصال قائمة على الخطة تقلل من تقلص البيانات عبر العوارض، وأجهزة التنظيف في البيئات التي توزع فيها البيانات بالفعل عبر مجموعة، والتي تتطلب تكاملا مع خطوط الأنابيب الأوسع لتجهيز البيانات.
XGBoost with Distributed Backends
(إكس جي بوزت) بدأ كإطار متنقل واحد و قام لاحقاً بتوزيع الدعم التدريبي من خلال دعمه المحلي الموزع، (داسك) و (إدماج (سبارك)
LightGBM for High-Dimensional Data
(لايت جي بي إم) يقدم عيّنات ذات قاعدة واحدة و(إف إل) حصرية، و(إف إل) لتسريع التدريب على مجموعات البيانات العالية الأبعاد، و(جي إس) يحتفظ بأوضاع ذات درجات عالية، بينما يقوموا بالعينات العشوائية مع درجات صغيرة، مع التركيز على أفضل نماذج التدريب المُفيدة
قطة للخصائص المقطعية
(كاتبوست) يقدم الدعم المحلي للملامح القاطعة بدون تشفير صريح باستخدام هيكل شجرات القرار المتباين الذي يقلل من الملاءمة، ويعالج التسرّب المُنبّئ في عملية التخرج، وهو مسألة مشتركة مع بيانات قاطعة، ويوفّر تنفيذ وحدة تحليل البيانات العالمية في (كاتبوست) سرعات كبيرة لمشاكل واسعة النطاق.
خدمات إدارة كلوريد - باد
ويقدم مقدمو السحاب الرئيسيون خدمات مُدارة تُعَدِّد فيها الهياكل الأساسية بشكل مُعقَّد مع توفير التدريب النموذجي القابل للاتساع على أساس الأشجار، أمازوون ساج ماكر، وغوغل فيرتكس آي، وشركة Azure Machine للتعلم، كل الدعم الموزع على مجموعات الأشجار مع التوسع الآلي، وهذه الخدمات تعالج تقسيم البيانات، والتسامح إزاء توفير الموارد، مما يتيح لعلماء البيانات التركيز على نماذج الإنتاج بدلا من إدارة المجموعات.
توصيات عملية لنشر الإنتاج
إن اختيار النهج الصحيح لرفع أشجار القرار يتوقف على الخصائص المحددة لبياناتكم وبنيتهم التحتية ومتطلبات الأداء، ويمكن للمبادئ التوجيهية التالية أن تساعد على تخطي هذه القرارات في بيئات الإنتاج.
When to use single Decision Trees
وتتناسب أشجار القرارات الوحيدة مع سرعة وضع البطاقات، وهندسة السمات، والتطبيقات التي يكون فيها التفسير النموذجي إلزامياً بسبب المتطلبات التنظيمية أو شروط الامتثال، وهي تستخدم أيضاً كخطوط أساس فعالة لتقييم النُهج الأكثر تعقيداً، وفي سياقات البيانات الكبيرة، تقيد الأشجار الوحيدة على مجموعات البيانات التي يكمل فيها التدريب في إطار نوافذ زمنية مقبولة، أي أقل من 10 ملايين صف أو 100 سمة.
متى تستخدم أساليب الجمع
وبالنسبة لمعظم تطبيقات البيانات الكبيرة، فإن الأساليب التجميعية هي الخيار العملي، فالغابات العشوائية توفر أفضل توازن للأداء، وإمكانية التصعيد، وسهولة النشر عندما تكون موازية البيانات واضحة، وتعطي الأشجار المعززة قدرا أكبر من الدقة للعديد من مشاكل البيانات المنظمة، ولكنها تتطلب قدرا أكبر من الدقة في التخطيط للربط بالنظم الأساسية، ولا تعتبر البدء بالغابات العشوائية بمثابة خط أساس، والانتقال إلى تعزيز التدرج إلا إذا كان تحسين الدقة يبرر التعقيد الإضافي.
اعتبارات الهياكل الأساسية
الاستثمار في الهياكل الأساسية التي تدعم موقع البيانات، وتدنية حركة البيانات أثناء التدريب، وينبغي أن تخزن نظم الملفات الموزعة مثل إدارة الدعم الميداني أو مخازن الأجسام السحابية بيانات التدريب في أشكال مثل باركيت أو أو أو أورك التي تدعم الوصول إلى الأعمدة وتعيد الدفع، وأن توفر الذاكرة الكافية لإبقاء مجموعات بيانات العمل في إدارة السجلات والمحفوظات، باستخدام تقنيات مثل رسم خرائط الذاكرة عندما لا يمكن إدخالها في جميع أشكال البيانات، وأن يرصد وظائف التدريب لاستخدام الموارد، ويتوسع نطاقها.
الرصد والصيانة
وتتطلب نماذج الإنتاج الرصد المستمر للحفاظ على الأداء، وتتبع التنبؤات العائمة، والتغييرات في الأهمية، وتحولات توزيع البيانات مع مرور الوقت، وخطوط إعادة التدريب الآلي التي تتضمن بيانات جديدة، مع التحقق من الجودة النموذجية مقابل مجموعات الرؤوس، وتنفيذ أطر اختبار A/B لمقارنة النسخ النموذجية في الإنتاج، وضمان أن تؤدي تحديثات هذه البيانات إلى تحسينات قابلة للقياس في الدقة أو في حالة الطوارئ.
خاتمة
ولا تزال أشجار القرار أداة أساسية في التعلم الآلاتي، التي تقدر قدرتها على الترجمة الشفوية وسهولة استخدامها، غير أن القيود المفروضة على إمكانية تصعيدها تتطلب تخفيفا دقيقا من خلال أخذ العينات، والتصوير التقريبي، والحساب الموازي، واستراتيجيات التعلم التدريجي، ويتوقف الاختيار بين الأشجار الواحدة والأساليب الجماعية على الاحتياجات المحددة للتطبيق، مع تعزيز الغابات العشوائية والدرجات عموما على مستوى الأداء الأعلى.
وقد أدى تطور أطر الحاسوب الموزعة إلى جعل التعلم القائم على الأشجار عملية بالنسبة لمجموعات البيانات ذات الحجم الهائل، حيث أن المكتبات مثل أباتشي سبارك ميلب، وشركة XGBoost، وشركة LightGBM، وشركة كاتبوست، تتضمن نماذج أمثل من مواضيع البحث قبل عقد من الزمن، وهي الآن سمات قياسية، حيث أن أحجام البيانات ما زالت تنمو، وتظهر أنماط مهندسة جديدة، مبادئ الفرز الكفاء، وحصر الآلات.
والمنظمات التي تستثمر في فهم هذه المبادلات وبناء موقع الهياكل الأساسية المناسب نفسها لاستخراج أكبر قدر من القيمة من أصول بياناتها، وسواء استخدمت كنموذج قائم بذاته يمكن تفسيره أو كعنصر في مجموعات قوية، فإن أشجار القرار ستواصل القيام بدور حيوي في مجال التعلم الآلي، متطورة لتلبية متطلبات مجموعات البيانات التي تزداد اتساعا.