Wörter außerhalb des Vokabulars (Out-of-Vokabulary, OOV) stellen eine große Herausforderung in Systemen zur Verarbeitung natürlicher Sprache dar, die in den Systemschulungsdaten nicht vorhanden sind, was zu einer geringeren Genauigkeit bei Aufgaben wie Übersetzung, Stimmungsanalyse und Spracherkennung führen kann.

Ansätze zum Umgang mit OOV-Wörtern

Zur Lösung des Problems von OOV-Wörtern in NLP-Systemen werden verschiedene Methoden verwendet, die darauf abzielen, entweder Darstellungen für unsichtbare Wörter vorherzusagen oder zu generieren oder die Auswirkungen unbekannter Vokabeln auf die Ausgabe des Systems zu verringern.

Gemeinsame Strategien

  • Unterwort-Tokenisierung: Wörter in kleinere Einheiten wie Morpheme oder Silben zu zerlegen, erlaubt dem System, Teile von unsichtbaren Wörtern zu erkennen.
  • Charakter-Level-Modelle: Mit Zeichen anstelle von Wörtern kann das System jedes bekannte oder unbekannte Wort verarbeiten.
  • Embedding Approximation: Estimating vector representations for OOV words based on similar known words.
  • Kontextuelle Hinweise: Nutzung von umgebenden Wörtern, um die Bedeutung oder Rolle eines unbekannten Wortes abzuleiten.

Vorteile und Einschränkungen

Subword- und zeichenbasierte Methoden verbessern die Fähigkeit des Systems, neue Wörter zu verarbeiten und die Out-of-Vokabular-Rate zu reduzieren. Sie können jedoch die Rechenkomplexität erhöhen und manchmal zu weniger präzisen Darstellungen führen. Kontextbezogene Ansätze können ein besseres Verständnis liefern, hängen jedoch stark vom umgebenden Text ab und können mit mehrdeutigen Wörtern kämpfen.