الطرائق الكمية لتقييم الجائزة النموذجية لللب: القياسات والحسابات
Table of Contents
ويعد تقييم دقة نماذج تجهيز اللغات الطبيعية أمراً أساسياً لفهم أدائها، وتوفر الأساليب الكمية تدابير موضوعية لتقييم مدى أداء هذه النماذج لمختلف المهام، وتستكشف هذه المادة مقاييس وحسابات مشتركة تستخدم في تقييم الدقة النموذجية للشبكة.
مقاييس التقييم المشتركة
وتستخدم عدة مقاييس لقياس أداء نماذج برامج العمل الوطنية كمياً، ويعتمد اختيار القياس على المهمة المحددة، مثل التصنيف أو الترجمة أو الرد على الأسئلة، وتشمل القياسات الأكثر استخداماً الدقة والدقة والتذكر وسجلات F1 وسجلات BLEU.
الاستحقاق وحسابه
ويقيّم الاستحقاق نسبة التنبؤات الصحيحة التي يُقدّمها النموذج، ويُحسب بتقسيم عدد التنبؤات الصحيحة حسب العدد الإجمالي للتنبؤات.
Accuracy = (عدد الفرضيات الصحيحة)/(الاختصاصات الإجمالية) ]
الدقة، والرش، والكشافة
ويشير الدقة إلى نسبة التنبؤات الإيجابية الحقيقية بين جميع التنبؤات الإيجابية، ويقيّم نسبة الإيجابيات الحقيقية التي تم تحديدها بين جميع الإيجابيات الفعلية، ويجمع مؤشر F1 الدقة بين الدقة والتذكر في قياس واحد، ويوفر تدبيرا متوازنا.
Precision = True Positives / (True Positives + False Positives)]
Recall = True Positives / (True Positives + False Negatives)]
F1 Score = 2 * (Precision * Recall) / (Precision + Recall)]
BLEU Score for Machine Translation
ويقيِّم سجل بيانات الاتحاد الأوروبي جودة النصوص المترجمة آلياً بمقارنة النص بترجمة مرجعية واحدة أو أكثر، ويحسب التداخل بين الغرامات غير المنسَّقة والنصوص المرجعية، ويعاقب على الترجمة القصيرة للغاية.
وتتراوح نتائج البولي أورو بين صفر و1، مع ارتفاع درجات الترجمة إلى جودة أفضل، وتشمل الحسابات درجات دقيقة لمختلف الطولات غير الغرامية وعقوبة الإرضاء.
موجز
وتعد مقاييس التقييم الكمي حيوية لتقييم الأداء النموذجي للشراكات غير المشروعة، ففهم كيفية حساب هذه القياسات وتفسيرها يساعد على تحسين دقة النماذج وموثوقيتها عبر مختلف التطبيقات.