डेटा बिंदुओं के बीच समानता को मापने के लिए असुरक्षित डेटा विश्लेषण में आवश्यक है। यह पूर्ववर्ती लेबल के बिना डेटासेट के भीतर पैटर्न, समूहन और संबंधों की पहचान करने में मदद करता है। विभिन्न गणनाओं और मीट्रिकों का उपयोग यह निर्धारित करने के लिए किया जाता है कि कैसे समान या अलग डेटा बिंदु हैं।

सामान्य समानता मीट्रिक

कई मीट्रिक समानता को मापने के लिए उपयोग किए जाते हैं, प्रत्येक विभिन्न प्रकार के डेटा और विश्लेषण लक्ष्यों के लिए उपयुक्त है। सबसे आम में यूक्लिडियन दूरी, कॉसिन समानता और जैककार्ड इंडेक्स शामिल हैं।

यूक्लिडियन दूरी

यूक्लिडन दूरी अंतरिक्ष में दो बिंदुओं के बीच सीधी रेखा की दूरी की गणना करती है। यह व्यापक रूप से संख्यात्मक डेटा के लिए उपयोग किया जाता है और इसे सभी सुविधाओं में वर्गीय मतभेदों के योग के वर्ग रूट के रूप में माना जाता है।

Cosine समानता

Cosine समानता दो वैक्टरों के बीच कोण के कोसिन को मापती है। यह विशेष रूप से उच्च-आयामी डेटा जैसे पाठ या दस्तावेज़ विश्लेषण के लिए उपयोगी है, जहां वेक्टर की परिमाण उनके अभिविन्यास की तुलना में कम महत्वपूर्ण है।

जैककार्ड इंडेक्स

जैककार्ड इंडेक्स दो सेटों के बीच समानता का मूल्यांकन करता है, जो उनके संघ के आकार से उनके चौराहे के आकार को विभाजित करता है। यह आमतौर पर द्विआधारी या श्रेणीबद्ध डेटा के लिए उपयोग किया जाता है।

  • यूक्लिडियन दूरी
  • Cosine समानता
  • जैककार्ड इंडेक्स
  • मैनहट्टन दूरी
  • Pearson correlation गुणांक