दूरी के उपाय असुरक्षित सीखने में आवश्यक उपकरण हैं, एल्गोरिदम को डेटा बिंदुओं के बीच समानता या अंतर का मूल्यांकन करने में सक्षम बनाता है। वे क्लस्टरिंग, आयामीता में कमी और विसंगत पहचान प्रक्रियाओं को प्रभावित करते हैं। यह समझना कि इन उपायों की गणना कैसे की जाती है और लागू मशीन लर्निंग मॉडल की प्रभावशीलता में सुधार करने में मदद करता है।

सामान्य दूरी उपाय

कई दूरी के उपायों का व्यापक रूप से असुरक्षित सीखने में उपयोग किया जाता है। विकल्प डेटा प्रकार और विशिष्ट अनुप्रयोग पर निर्भर करता है।

  • Euclidean दूरी: अंतरिक्ष में दो बिंदुओं के बीच सीधी रेखा की दूरी की गणना करता है।
  • Manhattan दूरी:] ग्रिड जैसे रास्ते पर आधारित दूरी को मापें, आयामों में पूर्ण अंतर को मापें।
  • कोसिन समानता: दो वैक्टरों के बीच कोण की कोसिन को इवैल्युट करता है, जिससे उनकी ओरिएंटेशन समानता का संकेत मिलता है।
  • ]Jaccard इंडेक्स: सीमित सेट के बीच समानता को मापें, द्विआधारी या श्रेणीबद्ध डेटा के लिए उपयोगी।

दूरी उपायों की गणना

गणना माप के आधार पर भिन्न होती है। उदाहरण के लिए, बिंदुओं के बीच यूक्लिडियन दूरी A] और B] निर्देशांक के साथ (x]1], y]1 ]]]]]]]]]2], y[FLT:FLT:8]]]]2[[FLT:]]]2[[FLT:FLT:5]]]]]]]]]]]

√(x]]2] - x]1]]]]]]]]2]]+ (y]]]2] - y]1]]]]]]]]]]]]2[FLT:FLT:5]]]]]]]]]]]]]]]]]

अन्य उपायों में अपना सूत्र होता है, अक्सर इसमें सुविधाओं के समीकरण या अनुपात शामिल होते हैं।

दूरी माप के अनुप्रयोग

विभिन्न प्रकार के सीखने के कार्यों में दूरी के उपायों का उपयोग किया जाता है:

  • Clustering: K-means जैसे एल्गोरिथ्म समान डेटा बिंदुओं के समूह की दूरी की गणना पर निर्भर करते हैं।
  • Dimensionality कमी:] तकनीक जैसे कि टी-SNE कम आयामों में डेटा संरचना को संरक्षित करने के लिए दूरी का उपयोग करते हैं।
  • ]Anomaly जांच: विशिष्ट डेटा क्लस्टर से उनकी दूरी के आधार पर बाहरी लोगों को पहचानता है।