وتمثل الترجمة المصنوعة من الآلات تكنولوجيا رئيسية في تجهيز اللغات الطبيعية، مما يتيح تحويل النص تلقائيا من لغة إلى أخرى، كما أن تقييم جودة هذه الترجمات ضروري لتحسين النظم وضمان النواتج الموثوقة، وتستخدم مقاييس وحسابات مختلفة لتقييم أداء تكنولوجيا المعلومات، مع كل منها بمزاياها وحدودها.

مقاييس التقييم المشتركة

وتستخدم عدة مقاييس لقياس نوعية نواتج الترجمة الآلية، وتشمل أكثرها اعتماداً BLEU و METEOR و TER.() وتقارن هذه القياسات الترجمة المولدة من آلات إلى ترجمة المراجع البشرية لقياس التشابه والدقة كمياً.

الحسابات والمنهجيات

ويستخدم كل متر أساليب حساب مختلفة، فعلى سبيل المثال، يستخدم الاتحاد الأوروبي الدقة بالأشعة دون الغرامية لتقييم عدد التسلسلات المتقاربة للكلمات في الترجمة الآلية التي تتطابق مع تلك التي تترجمها الترجمة المرجعية، وينظر في مسألة الترادف والوقف، ويوفر مقارنة أكثر مرونة. ويقيّم البرنامج عدد المحررات اللازمة لتغيير الترجمة الآلية إلى الإشارة، مما يعكس الجهد اللازم للتصويب.

الاعتبارات الهندسية

ويشمل تنفيذ التقييم الفعال اختيار القياسات المناسبة استنادا إلى سياق الترجمة التحريرية، كما يتطلب تحقيق التوازن بين الكفاءة الحسابية والدقة، ويمكن أن يوفر الجمع بين القياسات المتعددة تقييما أكثر شمولا، بالإضافة إلى فهم القيود التي تحد من كل قياس يساعد في تفسير النتائج بدقة.

جوانب التقييم الإضافية

  • Human judgment:] Essential for nuanced quality assessment.
  • Domain-specific metrics:] Tailored to specific industries or content types.
  • Real-world testing:] Evaluating translation performance in practical applications.