Table of Contents
نمره ارزیابی دقیق (Bchingual Assessment Understudy) یک متریک است که برای ارزیابی کیفیت خروجی ترجمه ماشین با مقایسه آن با یک یا چند ترجمه مرجع استفاده می شود.این راهنما یک فرایند گام به گام برای محاسبه نمرات BLEU به طور موثر فراهم می کند.
درک BLEU
اندازه گیری نمره BLEU که چگونه یک ترجمه ماشینی با ارجاعات انسانی مطابقت دارد، همپوشانی n-grams بین کاندید و ترجمه های مرجع را در نظر می گیرد، همراه با یک مجازات بازگشت برای دلسرد کردن ترجمه های کوتاه مدت.
مرحله 1: آماده سازی داده ها
ترجمه کاندید و یک یا چند ترجمه مرجع را جمع آوری کنید.اطمینان حاصل کنید که تمام متون به طور مداوم توکنیزه می شوند، جملات را به کلمات یا واحدهای فرعی تقسیم کنید.
مرحله دوم: Calculate N-gram Precision
برای هر اندازه n-gram (معمولا 1 تا 4)، تعداد n-gramها را در ترجمه کاندید که در ترجمه مرجع نیز ظاهر می شود، شمارش کنید.این تعداد را با تعداد کل n-grams در کاندید برای به دست آوردن نمرات دقیق برای هر سطح n-gram تقسیم کنید.
مرحله 3: مجازات برنی را اعمال کنید
مجازات بازگشت (BP) ترجمه هایی را که کوتاه تر از مرجع هستند، مجازات می کند.
BP = 1 اگر طول کاندید و اندازه؛ طول مرجع؛ در غیر این صورت، BP = e^{(1 - طول مرجع / مدت کاندید)
مرحله 4: امتیاز نهایی را تکمیل کنید
دقت های n-gram را با استفاده از معانی هندسی ترکیب کرده و با مجازات بازگشت تکثیر ضرب کنید:
BLEU = BP * انقضای (به طور متوسط دقت های ثبت نام برای n=1 تا 4).
نکات اضافی
- از ترجمه های مرجع چندگانه برای ارزیابی بهتر استفاده کنید.
- اطمینان از توکن سازی مداوم در تمام متون
- از ابزارهای موجود یا کتابخانه های محاسبه مانند NLTK یا SacreBLEU استفاده کنید.