外部の語彙(OOV)は、自然言語処理(NLP)システムにおける課題を提起しています。これらは、NLPアプリケーションの精度と堅牢性に影響を与えることができるトレーニング中にモデルが遭遇していない言葉です。この問題に対処するために様々な技術が開発され、システムが新しいまたはまれな言葉を効果的に処理することができます。

OOV Wordsの処理のためのテクニック

NLPシステムでOOVの単語を管理するためにいくつかのメソッドが使われます。これらには、サブワードトークン化、文字レベルモデル、および戦略の埋め込みが含まれます。各アプローチは、モデルが理解し、処理できる方法で、未だの単語を表すことを目指しています。

サブワードトークン化

サブワードトークン化は、プレフィックス、サフィックス、またはキャラクターシーケンスなどの小数単位に単語を分割します。バイトペアエンコーディング(BPE)やWordPieceなどのテクニックは人気があります。 それらは、既知のサブワードユニットを組み合わせて新しい単語を処理するモデルを可能にし、OOVの問題を軽減します。

刺身の刺身

メソッドを埋め込み、ベクトル表現を単語に割り当てます。OOV の単語では、n グラムの文字に基づいて埋め込むか、BERT のようなコンテキストベースの埋め込みを使うことができます。これらの戦略は、未読な単語の意味をキャプチャするのに役立ちます。

強靭性のための計算

計算は、与えられたコンテキスト内でOOVの言葉の尤度を推定することを含みます。 確率的モデルとスムースな手法は、Laplaceスムースなどの、予後のない言葉に確率を割り当てるために使用されます。 これらの計算は、新しい語彙を予測し理解するシステム能力を向上させます。