आउट-ऑफ-वोकैबुलरी (OOV) शब्दों को संभालने से प्राकृतिक भाषा प्रसंस्करण में एक आम चुनौती है। भाषा मॉडल अक्सर उन शब्दों का सामना करते हैं जिन्हें उन्होंने प्रशिक्षण के दौरान नहीं देखा है, जो उनके प्रदर्शन को प्रभावित कर सकते हैं। यह लेख इस मुद्दे को प्रभावी ढंग से संबोधित करने के लिए इस्तेमाल किए जाने वाले व्यावहारिक एल्गोरिदम पर चर्चा करता है।

सबवर्ड Tokenization

Subword tokenization शब्दों को छोटी इकाइयों में तोड़ देता है, जैसे कि उपसर्ग, प्रत्यय, या चरित्र अनुक्रम। यह दृष्टिकोण मॉडल को बिना किसी शब्द को ज्ञात उपशब्द घटकों में विघटित करके अनदेखा शब्दों को संसाधित करने की अनुमति देता है। लोकप्रिय एल्गोरिदम में बाइट जोड़ी एन्कोडिंग (BPE) और WordPiece शामिल हैं।

वर्ण-स्तर मॉडल

वर्ण-स्तर के मॉडल सीधे शब्दों के बजाय व्यक्तिगत वर्णों पर काम करते हैं। यह विधि मॉडल को अपने चरित्र अनुक्रम का विश्लेषण करके किसी नए शब्द को संभालने में सक्षम बनाती है। हालांकि गणनात्मक रूप से गहन, यह OOV मुद्दों के खिलाफ मजबूती प्रदान करता है।

एम्बॉसिमेशन तकनीक को एम्बेड करना

अनुमान लगाने के बाद, उनके उपशब्द घटकों या इसी तरह के ज्ञात शब्दों के आधार पर अनदेखी शब्दों के लिए वेक्टर को अनुमान लगाना शामिल है। तकनीकों में सबवर्ड इकाइयों के औसतन एम्बेडिंग शामिल हैं या संदर्भ आधारित अनुमान का उपयोग करके ओयूवी शब्दों के लिए plausible एम्बेडिंग उत्पन्न करने के लिए शामिल हैं।

निष्कर्ष

इन एल्गोरिदम को लागू करने से भाषा मॉडल की क्षमता को बढ़ाता है ताकि वे प्रभावी ढंग से शब्दावली शब्दों को संसाधित कर सकें।