Wörter, die außerhalb des Vokabulars (Out-of-Vokabulary, OOV) stehen, stellen eine Herausforderung in Systemen zur Verarbeitung natürlicher Sprache (Natural Language Processing, NLP) dar, d. h. Wörter, denen das Modell während des Trainings nicht begegnet ist und die die Genauigkeit und Robustheit von NLP-Anwendungen beeinträchtigen können.

Techniken zum Umgang mit OOV-Wörtern

Es werden verschiedene Methoden verwendet, um OOV-Wörter in NLP-Systemen zu verwalten, darunter Subwort-Tokenisierung, Zeichen-Level-Modelle und Einbettungsstrategien. Jeder Ansatz zielt darauf ab, unsichtbare Wörter so darzustellen, dass das Modell sie verstehen und verarbeiten kann.

Subword Tokenization

Die Subword-Tokenisierung unterteilt Wörter in kleinere Einheiten wie Präfixe, Suffixe oder Zeichenfolgen. Techniken wie Byte Pair Encoding (BPE) und WordPiece sind beliebt. Sie ermöglichen es Modellen, neue Wörter zu verarbeiten, indem sie bekannte Subword-Einheiten kombinieren und so das OOV-Problem reduzieren.

Einbettungsstrategien

Bei OOV-Wörtern können Modelle Einbettungen basierend auf Zeichen-n-Gramm erzeugen oder kontextbasierte Einbettungen wie BERT verwenden. Diese Strategien helfen, die Bedeutung von unsichtbaren Wörtern zu erfassen.

Berechnungen für Robustheit

Berechnungen umfassen die Schätzung der Wahrscheinlichkeit von OOV-Wörtern in einem gegebenen Kontext. Probabilistische Modelle und Glättungstechniken, wie Laplace-Glättung, werden verwendet, um unsichtbaren Wörtern Wahrscheinlichkeiten zuzuweisen. Diese Berechnungen verbessern die Fähigkeit des Systems, neue Vokabeln vorherzusagen und zu verstehen.