ويعد تقييم أداء نماذج التعلم العميق أمرا أساسيا لفهم فعاليتها وموثوقيتها، وتوفر الأساليب الكمية مقاييس موضوعية تساعد على مقارنة النماذج وتعظيم أدائها لمهام محددة.

مقاييس الأداء المشتركة

وتستخدم عدة مقاييس لتقييم نماذج التعلم العميق، لا سيما في مهام التصنيف والتراجع، وتُحدِّد هذه القياسات كمّا مدى توقع أو ملاءمة نموذج للبيانات.

مقاييس التقييم للتصنيف

بالنسبة لمهام التصنيف، القياسات المشتركة تتضمن الدقة، الدقة، التذكر، وسجل F1 هذه القياسات تقيّم مختلف جوانب القدرة التنبؤية للنموذج

Accuracy

وتقيس الاستحقاق نسبة التنبؤات الصحيحة من مجموع التوقعات، ومن المفيد جداً أن تكون الفصول متوازنة.

الدقة والتقدير

وتشير الدقة إلى نسبة التنبؤات الإيجابية الحقيقية بين جميع التنبؤات الإيجابية، في حين تشير إلى أن نسبة الإيجابيات الفعلية التي تم تحديدها بشكل صحيح.

F1 Score

ويجمع مؤشر F1 الدقة ويُذكر إلى قياس واحد، ويوفر تدبيرا متوازنا، لا سيما عندما تكون الفصول غير متوازنة.

قياسات التقييم للانحسار

ويجري تقييم نماذج التراجع باستخدام القياسات التي تقيس الفرق بين القيم المتوقعة والقيم الفعلية، وتشمل القياسات المشتركة الرعب المطلق، والخطأ المائي، والمسرح المائي.

الرعب المطلق

ويحسب مؤشر الإنجاز الكلي متوسط الفرق المطلق بين القيم المتوقعة والقيم الحقيقية، مع الإشارة إلى متوسط الخطأ في التنبؤ.

Mean Squared Error (MSE)

ويقيِّم نظام تقييم المخاطر المؤسسية متوسط الفرق المربع، ويعاقب على الأخطاء الأكبر حجماً من قانون المنافسة النباتية.

R-squared

وتشير الأرقام المصفّاة إلى نسبة الفرق في البيانات التي يشرحها النموذج، حيث تقارب القيم إلى واحد من القيم التي تمثل أفضل ملاءمة.

تقنيات تبادل البيانات

وتساعد أساليب التفكك عبر الحدود، مثل السحب عبر الكيلومترات، على تقييم القدرة على تعميم النماذج عن طريق تقسيم البيانات إلى التدريب والاختبارات، على عدة مرات.

ويقلل هذا النهج من المبالغة في الاستفادة ويوفر تقديراً أكثر موثوقية للأداء النموذجي عبر مجموعات فرعية مختلفة من البيانات.