Table of Contents
Named Entity Recognition (NER)는 텍스트 내에서 식별 및 분류 능력을 포함하는 자연 언어 처리의 핵심 작업입니다. 기계 학습에 앞서도, 몇몇 일반적인 pitfalls는 NER 시스템의 정확도를 방해합니다. 수학 접근법 적용은 이러한 문제를 효과적으로 해결할 수 있습니다.
NER의 일반적인 Pitfalls
한 가지 빈번한 문제는 주변 상황으로 인해 인덕적 인 상황의 미분화입니다. 예를 들어, "Apple"라는 단어는 회사 또는 과일을 참조 할 수 있으며 상황에 따라 다릅니다. 또 다른 문제는 약어 또는 mnots와 같은 다양한 형식과 엔티티티티의 인식입니다. 또한 모델은 종종 교육 데이터에 존재하지 않는 불임성 또는 새로운 용어로 투쟁합니다.
NER를 개선하는 수학 접근법
Mathematical 기술은 텍스트의 더 강력한 표현을 제공함으로써 NER 정확도를 향상시킬 수 있습니다. 단어 벡터 인코딩 semantic 정보와 같은 방법을 침식, 모델은 주변 상황에 따라 다른 유형과 구별 할 수 있습니다. 숨겨진 Markov 모델 (HMMs) 및 조건 임의 필드 (CRFs)과 같은 Probabilistic 모델은 조직 경계 검출 및 분류를 개선하기 위해 통계적 의존성을 사용합니다.
교정을 위한 전략
- Contextual Embeddings: 컨텍스트 인식 표현을 통합하는 BERT와 같은 모델 사용.
- 특징 엔지니어링: 주파수, 공동 정확도, 위치 정보와 같은 수학 기능을 통합합니다.
- Probabilistic Model: 더 나은 엔티티티티 경계를 위한 이웃 토큰 간의 모델 의존성을 적용하는 CRFs를 적용한다.
- Data Augmentation: 다양한 엔티티티 형식으로 모델을 노출하고 엔티티티티 이슈를 감소시키기 위해 합성 데이터를 생성한다.