OOV (OOV) 단어는 자연 언어 처리에서 일반적인 도전입니다. 언어 모델은 종종 훈련 중에 볼 수없는 단어를 만나고, 성능에 영향을 줄 수 있습니다. 이 문서는이 문제를 효과적으로 해결하는 데 사용되는 실용적인 알고리즘에 대해 논의합니다.

서브워드 토큰화

하위 탭 토큰화는 prefixes, suffixes, 또는 문자 순서와 같은 작은 단위로 단어를 깰 수 있습니다. 이 접근법은 알려진 하위 탭 구성 요소로 decomposing하여 모델이 아닌 단어를 처리 할 수 있습니다. 인기있는 알고리즘은 Byte 쌍 인코딩 (BPE) 및 WordPiece를 포함합니다.

문자 레벨 모델

문자 레벨 모델은 단어보다는 개별 문자에 직접 작동. 이 방법은 문자 순서 분석으로 새로운 단어를 처리하는 모델이 가능하게합니다. 계산적으로 집중하지만, OOV 문제에 대한 견고성을 제공합니다.

약력 기술에 대한 평가

OOV 단어는 OOV 단어를 위해 OOV 단어를 생성하는 단어를 사용하여 단어를 읽는 벡터를 estimating하는 것입니다. 기술에는 OOV 단어를 위한 백리스 embeddings를 생성하기 위하여 subword 단위의 averaging embedding가 포함됩니다.

관련 기사

이 알고리즘을 구현하는 것은 언어 모델의 능력을 향상시켜서 구급차 단어를 효과적으로 처리할 수 있습니다. 대문자를 삽입하는 하위 탭 토큰화를 결합하면 실제 애플리케이션에서 가장 좋은 결과를 얻을 수 있습니다.