आउट-ऑफ-वोकैबुलरी (OOV) शब्द प्राकृतिक भाषा प्रसंस्करण (NLP) प्रणालियों में एक चुनौती का सामना करते हैं। ये शब्द हैं कि मॉडल का सामना प्रशिक्षण के दौरान नहीं किया गया है, जो एनएलपी अनुप्रयोगों की सटीकता और मजबूती को प्रभावित कर सकता है। इस मुद्दे को संबोधित करने के लिए विभिन्न तकनीकों को विकसित किया गया है, यह सुनिश्चित करने के लिए कि सिस्टम प्रभावी ढंग से नए या दुर्लभ शब्दों को संभाल सकते हैं।

OV Words को संभालने की तकनीक

कई तरीकों का उपयोग एनएलपी सिस्टम में OOV शब्दों का प्रबंधन करने के लिए किया जाता है। इनमें उपशब्द टोकनाइजेशन, चरित्र-स्तर के मॉडल और एम्बेडिंग रणनीति शामिल हैं। प्रत्येक दृष्टिकोण का उद्देश्य किसी तरह से अनदेखे शब्दों का प्रतिनिधित्व करना है कि मॉडल समझ सकता है और प्रक्रिया कर सकता है।

सबवर्ड Tokenization

Subword tokenization शब्दों को छोटी इकाइयों जैसे कि उपसर्ग, प्रत्यय, या चरित्र अनुक्रमों में तोड़ देता है। बाइट जोड़ी एन्कोडिंग (BPE) और वर्डपीस जैसी तकनीक लोकप्रिय हैं। वे मॉडल को ज्ञात उपशब्द इकाइयों के संयोजन से नए शब्दों को संभालने की अनुमति देते हैं, जिससे OOV समस्या को कम किया जा सकता है।

रणनीतियाँ एम्बेड करना

एम्बेडिंग विधियां शब्दों को वेक्टर प्रतिनिधित्व देते हैं। OOV शब्दों के लिए, मॉडल चरित्र n-grams के आधार पर एम्बेडिंग उत्पन्न कर सकते हैं या BERT जैसे संदर्भ आधारित एम्बेडिंग का उपयोग कर सकते हैं। ये रणनीति बिना किसी शब्द के अर्थ को कैप्चर करने में मदद करती हैं।

रॉबस्टनेस के लिए गणना

गणना में दिए गए संदर्भ में OV शब्दों की संभावना को आकलन करना शामिल है। Probabilistic मॉडल और Smoothing तकनीक, जैसे लाप्लेस स्मूथिंग, का उपयोग बिना शब्दों के संभावित शब्दों को असाइन करने के लिए किया जाता है। ये गणना प्रणाली की क्षमता को बेहतर बनाने के लिए नए शब्दावली की भविष्यवाणी और समझने की क्षमता को बेहतर बनाती है।