Các từ không có trong ngôn ngữ tự nhiên là một thách thức thường gặp trong việc xử lý ngôn ngữ tự nhiên. Mô hình ngôn ngữ thường gặp từ mà họ chưa thấy trong quá trình đào tạo, có thể ảnh hưởng đến hiệu suất của chúng. Bài này thảo luận về các thuật toán thực tế được dùng để giải quyết vấn đề này một cách hữu hiệu.

Sự giảm dần

Việc ký hiệu con sẽ chia từ thành đơn vị nhỏ hơn, như tiền tố, hậu tố, hay chuỗi ký tự. Cách tiếp cận này cho phép mô hình xử lý từ không nhìn thấy bằng cách phân tách chúng thành thành thành thành thành phần con được biết. Thuật toán phổ biến bao gồm Bộ mã Theote Pair (BPE) và WordPiece.

Mô hình độ phân giải

Mô hình cấp tính trực tiếp hoạt động trên các ký tự riêng lẻ hơn là từ ngữ. phương pháp này cho phép mô hình xử lý từ mới bằng cách phân tích các chuỗi ký tự của nó. mặc dù tính toán kỹ lưỡng, nó cung cấp sự mạnh mẽ để chống lại các vấn đề OOV.

Công nghệ nhúng

Tính toán nhúng bao gồm ước lượng véc- tơ cho các từ vô hình dựa trên thành phần con hoặc từ tương tự. Kỹ thuật bao gồm các cụm từ liên kết giữa các đơn vị chữ con hoặc sử dụng từ suy luận dựa trên ngữ cảnh để tạo ra các sự kết hợp hợp hợp lý cho các từ OOV.

Kết luận

Thao tác các thuật toán này tăng cường khả năng của các mô hình ngôn ngữ để xử lý hiệu quả các từ ngoài luồng. Kết hợp các từ consciction với việc ước lượng phân loại thường mang lại kết quả tốt nhất trong ứng dụng thực tế.