Những từ vượt quá thị trường (OOV) gây ra một thách thức trong việc xử lý ngôn ngữ tự nhiên (NLP). Đây là những từ mà mô hình chưa gặp trong quá trình đào tạo, có thể ảnh hưởng độ chính xác và mạnh của ứng dụng NLP. Nhiều kỹ thuật đã được phát triển để giải quyết vấn đề này, hệ thống bảo đảm có thể xử lý những từ mới hoặc hiếm.

Kỹ thuật để đọc các từ OOV

Một số phương pháp được dùng để quản lý các từ OOV trong hệ thống NLP. Những từ này bao gồm các biểu tượng con, các mô hình nhân vật, và các chiến lược nhập vai. mỗi phương pháp để đại diện cho các từ vô hình theo cách mà mô hình có thể hiểu và xử lý.

Sự giảm dần

Việc ký hiệu phụ chia từ thành đơn vị nhỏ hơn như tiền tố, hậu tố, hay chuỗi ký tự. Công nghệ như bộ mã Byte Piir (BE) và WordPiece rất phổ biến. Họ cho phép mô hình xử lý từ mới bằng cách kết hợp các đơn vị chữ con, giảm vấn đề OOV.

Các chiến thuật nhúng

Các phương pháp nhúng gán véc- tơ đại diện cho từ. Đối với từ OOV, mô hình có thể tạo ra các đường nhúng dựa trên chữ n-gram hay dùng các đường nhúng dựa trên ngữ cảnh như ORT. Những phương pháp này giúp đỡ để nắm bắt ý nghĩa của từ không nhìn thấy.

Tính toán cho sự thay đổi

Tính toán bao gồm ước lượng khả năng của từ OOV trong một bối cảnh cho phép. Mô hình xác suất và kỹ thuật làm mịn, chẳng hạn như Laplace, được dùng để xác định xác suất cho từ vô hình. Những tính toán này cải thiện khả năng dự đoán và hiểu từ vựng mới của hệ thống.