Le parole "fuori-vocabolario" (OOV) rappresentano una sfida nei sistemi di elaborazione del linguaggio naturale (NLP), che sono parole che il modello non ha incontrato durante la formazione, che possono influenzare l'accuratezza e la robustezza delle applicazioni NLP.

Tecniche per la gestione delle parole OOV

Diversi metodi sono utilizzati per gestire le parole OOV nei sistemi NLP, tra cui la tokenizzazione delle sottoparole, i modelli a livello di carattere e le strategie di incorporazione.

Tokenizzazione sottoparola

La tokenizzazione subword rompe le parole in unità più piccole come prefissi, suffissi o sequenze di caratteri. Tecniche come Byte Pair Encoding (BPE) e WordPiece sono popolari.

Strategie per l'embedaggio

Per le parole OOV, i modelli possono generare embeddings basati su n-grammi di carattere o utilizzare incorporazioni basate sul contesto come BERT. Queste strategie aiutano a catturare il significato delle parole invisibili.

Calcoli per la Robustezza

I calcoli comportano la stima della probabilità di parole OOV all'interno di un determinato contesto. I modelli probabilistici e le tecniche di lisciatura, come ad esempio la levigatura Laplace, sono utilizzati per assegnare probabilità a parole invisibili.