बाह्य शब्दावली (OOV) शब्द प्राकृतिक भाषा प्रसंस्करण (NLP) प्रणालियों में एक महत्वपूर्ण चुनौती पैदा करते हैं। ये शब्द सिस्टम के प्रशिक्षण डेटा में मौजूद नहीं हैं, जिससे अनुवाद, भावना विश्लेषण और भाषण मान्यता जैसे कार्यों में सटीकता कम हो सकती है।

OV Words को संभालने के लिए दृष्टिकोण

कई तरीकों का उपयोग एनएलपी सिस्टम में OOV शब्दों के मुद्दे को संबोधित करने के लिए किया जाता है। इन दृष्टिकोणों का उद्देश्य या तो अनदेखे शब्दों के लिए प्रतिनिधित्व का पूर्वानुमान करना या सिस्टम के उत्पादन पर अज्ञात शब्दावली के प्रभाव को कम करना है।

सामान्य रणनीति

  • ]Subword Tokenization: छोटे इकाइयों जैसे कि morphemes या syllables में शब्दों को तोड़कर सिस्टम को बिना किसी शब्दों के भागों को पहचानने की अनुमति देता है।
  • ]Character-Level मॉडल: शब्दों के बजाय अक्षरों का उपयोग करने से सिस्टम को किसी भी शब्द, ज्ञात या अज्ञात को संसाधित करने में सक्षम बनाता है।
  • Embedding Approximation: समान ज्ञात शब्दों के आधार पर OOV शब्दों के लिए वेक्टर प्रतिनिधित्व का आकलन।
  • Contextual Clues: अज्ञात शब्द के अर्थ या भूमिका को पूरा करने के लिए आसपास के शब्दों का लाभ उठाते हैं।

लाभ और सीमा

सबवर्ड और कैरेक्टर-आधारित तरीकों से सिस्टम की नए शब्दों को संभालने की क्षमता में सुधार होता है और बाहरी शब्दावली दर को कम करता है। हालांकि, वे कम्प्यूटेशनल जटिलता को बढ़ा सकते हैं और कभी-कभी कम सटीक प्रतिनिधित्व का कारण बन सकते हैं। प्रासंगिक दृष्टिकोण बेहतर समझ प्रदान कर सकते हैं लेकिन आसपास के पाठ पर भारी निर्भर करते हैं और अस्पष्ट शब्दों के साथ संघर्ष कर सकते हैं।