(أ) مؤشر BLEU (مخطط التقييم المزدوج) هو قياس يستخدم لتقييم جودة ناتج الترجمة الآلية عن طريق مقارنة ذلك بترجمة مرجعية واحدة أو أكثر، ويوفر هذا الدليل عملية تدريجية لحساب نتائج التناوب على استخدام الحاسوب.

Understanding BLEU Score

ويتخذ مجلس الاتحاد الأوروبي تدابير بشأن مدى تطابق الترجمة التحريرية المولدة من آلات مع المراجع البشرية، وهو ينظر في تداخل الغرامات بين المرشحين والترجمة المرجعية، إلى جانب فرض عقوبة على درجة الذروة لتثبيط الترجمات القصيرة للغاية.

الخطوة 1: إعداد البيانات

جمع ترجمة المرشحين وترجمة مرجعية واحدة أو أكثر، وضمان أن تكون جميع النصوص مرمزة باستمرار، وأن تقسم الأحكام إلى كلمات أو وحدات كلمات فرعية.

الخطوة 2: حساب الدقة بالأشعة غير الدقيقة

بالنسبة لكل مقياس من الأرقام (من 1 إلى 4) يحسب عدد النسخ غير المطبعية في ترجمة المرشحين التي تظهر أيضا في الترجمة المرجعية، ويحسب هذا العدد بمجموع عدد الغرامات غير المرقمة في المرشح للحصول على درجات دقيقة لكل مستوى من الرتبة غير المدمجة.

الخطوة 3: تطبيق عقوبة الدفن

وتعاقب عقوبة الإرضاء على الترجمة التي تكون أقصر من الإشارة، وتحسبها على أنها:

BP = 1 إذا طول المرشح > المرجعية؛ وإلا، BP = e{(1 - الطول المرجعي/طول المرشح)}.

الخطوة 4: خلاصة نهائية

تركيب الدقة بالأشعة دون الجامحة باستخدام متوسط الأرضي وتضاعف بعقوبة الإرضاء:

BLEU = BP * exp(average of log appcisions for n=1 to 4).

عدد إضافي من

  • استخدام ترجمات مرجعية متعددة من أجل تحسين التقييم.
  • ضمان الاتساق في التكسيد عبر جميع النصوص.
  • استخدام الأدوات أو المكتبات الموجودة لحسابها، مثل NLTK أو SacreBLEU.