वर्ड एम्बेडिंग समानता स्कोर का उपयोग प्राकृतिक भाषा प्रसंस्करण में किया जाता है ताकि यह मापने के लिए कि उनके वेक्टर प्रतिनिधित्व पर समान दो शब्द या वाक्यांश कैसे आधारित हैं। ये स्कोर उन कार्यों में मदद करते हैं जैसे कि शब्द विश्लेषण, सूचना पुनर्प्राप्ति और मशीन अनुवाद।

वर्ड एम्बेडिंग को समझना

वर्ड एम्बेडिंग शब्द 2Vec, GloVe, या FastText जैसे एल्गोरिदम द्वारा उत्पन्न शब्दों के घने वेक्टर प्रतिनिधित्व हैं। प्रत्येक शब्द को एक उच्च-आयामी अंतरिक्ष में मैप किया जाता है जहां समान शब्द करीब एक साथ स्थित होते हैं।

समानता स्कोर की गणना

दो शब्द एम्बेडिंग के बीच समानता की गणना करने के लिए सबसे आम तरीका कॉसिन समानता का उपयोग कर रहा है। यह दो वैक्टरों के बीच कोण की कोसिन को मापता है, यह दर्शाता है कि उनके निर्देश कितने समान हैं।

Cosine समानता की गणना करने के लिए कदम

  • शब्दों के वेक्टर प्रतिनिधित्व को प्राप्त करें।
  • दो वेक्टरों के डॉट उत्पाद की गणना करें।
  • प्रत्येक वेक्टर की परिमाण (लंबाई) को पूरा करें।
  • उत्पाद को आवर्धन के उत्पाद द्वारा विभाजित करें।

कोसिन समानता के लिए सूत्र है:

कोसिन समानता = (A · B) / (FLT:1]]

स्कोर को व्याख्या करना

Cosine समानता स्कोर -1 से 1 तक होता है। 1 के करीब एक स्कोर उच्च समानता को इंगित करता है, 0 कोई समानता इंगित करता है, और -1 विपरीत अर्थ इंगित करता है।