مدیریت کلمات (OOV) یک چالش مشترک در پردازش زبان طبیعی است. مدل های زبان اغلب با کلماتی که در طول آموزش دیده اند مواجه می شوند که می تواند بر عملکرد آنها تأثیر بگذارد.این مقاله الگوریتم های عملی مورد استفاده برای حل این مسئله را به طور موثر مورد بحث قرار می دهد.

برچسب های برچسب گذاری

توکن سازی زیر کلمه کلمات را به واحدهای کوچکتر مانند پیشوندها، suffixes یا توالی های کاراکتر می شکند.این رویکرد به مدل ها اجازه می دهد تا کلمات ناشناخته را با حذف آنها به اجزای زیر کلمه شناخته شده پردازش کنند. الگوریتم های محبوب شامل Byte Pair Encode (BPE) و WordPiece هستند.

مدل های شخصیتی-Level Models

مدل های سطح شخصیت به طور مستقیم بر روی شخصیت های فردی کار می کنند نه کلمات.این روش مدل را قادر می سازد تا با تجزیه و تحلیل توالی شخصیت آن، هر چند که به طور محاسباتی فشرده است، آن را قوی در برابر مسائل OOV فراهم می کند.

تکنیک های بهینه سازی

تقریبی قفسه شامل برآورد بردار برای کلمات دیده نشده بر اساس اجزای زیر کلمه یا کلمات مشابه شناخته شده است. تکنیک ها شامل به طور متوسط جاسازی واحدهای زیر کلمه یا استفاده از استنتاج مبتنی بر متن برای ایجاد جاسازی های قابل قبول برای کلمات OOV است.

نتیجه گیری

پیاده سازی این الگوریتم ها توانایی مدل های زبان را برای پردازش کلمات غیر کلامی به طور موثر افزایش می دهد. ترکیب توکن زیر کلمه با تقریبی جاسازی اغلب بهترین نتایج را در برنامه های کاربردی عملی به دست می آورد.