תרגום מכונה (MT) הוא טכנולוגיה מרכזית בעיבוד שפה טבעית, המאפשרת המרה אוטומטית של טקסט משפה אחת לאחרת. הערכת איכות התרגומים האלה חיונית לשיפור המערכות ולהבטיח תפוקה אמינה. מדדים שונים חישובים משמשים כדי להעריך ביצועי MT, כל אחד עם היתרונות שלה ומגבלות שלה.

הערכה משותפת

כמה מדדים משמשים למדידת איכות התפוקה של תרגום מכונה.המצוע ביותר כוללים BLEU, METEOR, ו- TER. המדדים האלה משווים תרגומים ממוחשבים לתרגומים של התייחסות אנושית כדי לכמת דמיון ודיוק.

שקיפות ושיטות

כל מדד משתמש בשיטות חישוב שונות. BLEU, למשל, משתמש דיוק N-gram כדי להעריך כמה רצפים בולטים של מילים בתרגום המכונה להתאים את אלה בתרגומים ההתייחסות. METEOR רואה נרדפת ו-Modering, מתן השוואה גמישה יותר. TER מודד את מספר הערוך הדרוש כדי לשנות את התרגום להקשר, תוך כדי לשקף את המאמץ הנדרש לתיקון.

שיקולים הנדסיים

יישום הערכה יעילה כרוך בבחירת מדדים מתאימים המבוססים על ההקשר התרגום.זה דורש גם איזון יעילות חישובית עם דיוק.שלב מדדים מרובים יכול לספק הערכה מקיפה יותר.בנוסף, הבנת המגבלות של כל מדד עוזר לפרש תוצאות במדויק.

הערכה נוספת Aspects

  • (ב) ,0) שיפוט: התגלות 1: הכרחי להערכה איכותית.
  • (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
  • בדיקה אחרונה ב-13 ביולי 2008. ^ FLT:0.2017 ,001 ,Edowing Translation Performance in Practical Applications.