Расчет показателей Bleu для оценки машинного перевода: пошаговое руководство
Оценка BLEU (Bilingual Evaluation Understudy) - это метрика, используемая для оценки качества результатов машинного перевода путем сравнения его с одним или несколькими эталонными переводами. Это руководство обеспечивает пошаговый процесс для эффективного расчета баллов BLEU.
Понять показатель BLEU
Оценка BLEU измеряет, насколько близко машинный перевод соответствует человеческим ссылкам. Он рассматривает перекрытие n-грамм между кандидатом и справочными переводами, а также штраф за краткость, чтобы препятствовать чрезмерно коротким переводам.
Шаг 1: Подготовьте данные
Соберите перевод кандидата и один или несколько ссылочных переводов. Убедитесь, что все тексты токенизируются последовательно, разделяя предложения на слова или подсловные единицы.
Шаг 2: Вычислите точность N-грамм
Для каждого размера n-грамм (обычно от 1 до 4) подсчитайте количество n-грамм в переводе-кандидате, которое также появляется в справочных переводах. Разделите это количество на общее количество n-грамм в кандидате для получения точных баллов для каждого уровня n-грамм.
Шаг 3: Применить срочное наказание
Кратковременный штраф (BP) наказывает переводы, которые короче ссылки.
BP = 1, если длина кандидата > длина отсчета; в противном случае BP = e^{(1 - длина отсчета / длина кандидата)}.
Шаг 4: Вычислить окончательный балл BLEU
Сочетайте n-граммовую точность с помощью геометрического среднего и умножьте на штраф краткости:
BLEU = BP * exp (среднее значение точности журнала для n=1-4).
Дополнительные советы
- Используйте несколько переводов ссылок для лучшей оценки.
- Обеспечить последовательную токенизацию во всех текстах.
- Используйте существующие инструменты или библиотеки для вычислений, такие как NLTK или SacreBLEU.