Table of Contents
기계 번역 (MT)은 자연 언어 처리의 핵심 기술이며, 하나의 언어에서 다른 텍스트의 자동 변환을 가능하게합니다. 이러한 번역의 품질을 평가하는 것은 시스템 개선에 필수적이며 신뢰할 수있는 출력을 보장합니다. 다양한 미터 및 계산은 MT 성능 평가에 사용됩니다. 각각 자체 장점과 제한이 있습니다.
일반적인 평가 미터
몇몇 미터는 기계 번역 산출의 질을 측정하기 위하여 이용됩니다. 가장 넓게 채택된 것은 BLEU, METEOR 및 TER를 포함합니다. 이 미터는 유사성과 정확도를 quantify 인간적인 참고 번역에 기계 생성한 번역을 비교합니다.
계산 및 방법론
각 미터는 다른 계산 방법을 사용합니다. BLEU는 예를 들어, 참조 번역에서 기계 번역에 대한 단어의 많은 연속 순서가 어떻게 많은 측정하는 n 그램 정밀도를 사용합니다. METEOR는 문법과 줄기를 고려하여보다 유연한 비교를 제공합니다. TER는 참조로 기계 번역을 변경하는 데 필요한 편집 수를 측정하고, 수정에 필요한 노력을 반영합니다.
공학 고려
효과적인 평가를 실시하는 것은 번역 상황에 따라 적절한 메트릭을 선택해야합니다. 또한 정확성과 비교 효율을 밸런싱해야합니다. 여러 메트릭을 결합하면 더 포괄적 인 평가를 제공 할 수 있습니다. 또한 각 메트릭의 제한을 이해하는 것은 정확하게 결과를 해석하는 데 도움이됩니다.
추가 평가 Aspects
- 인간의 판단: nuanced 품질 평가에 대한 필수.
- Domain-specific metrics: 특정 산업 또는 콘텐츠 유형에 맞게 지정되었습니다.
- Real-world Testing: 실제 응용 프로그램에 번역 성능을 평가합니다.