Table of Contents
दूरी के उपाय असुरक्षित सीखने में आवश्यक उपकरण हैं, एल्गोरिदम को डेटा बिंदुओं के बीच समानता या अंतर का मूल्यांकन करने में सक्षम बनाता है। वे क्लस्टरिंग, आयामीता में कमी और विसंगत पहचान प्रक्रियाओं को प्रभावित करते हैं। यह समझना कि इन उपायों की गणना कैसे की जाती है और लागू मशीन लर्निंग मॉडल की प्रभावशीलता में सुधार करने में मदद करता है।
सामान्य दूरी उपाय
कई दूरी के उपायों का व्यापक रूप से असुरक्षित सीखने में उपयोग किया जाता है। विकल्प डेटा प्रकार और विशिष्ट अनुप्रयोग पर निर्भर करता है।
- Euclidean दूरी: अंतरिक्ष में दो बिंदुओं के बीच सीधी रेखा की दूरी की गणना करता है।
- Manhattan दूरी:] ग्रिड जैसे रास्ते पर आधारित दूरी को मापें, आयामों में पूर्ण अंतर को मापें।
- कोसिन समानता: दो वैक्टरों के बीच कोण की कोसिन को इवैल्युट करता है, जिससे उनकी ओरिएंटेशन समानता का संकेत मिलता है।
- ]Jaccard इंडेक्स: सीमित सेट के बीच समानता को मापें, द्विआधारी या श्रेणीबद्ध डेटा के लिए उपयोगी।
दूरी उपायों की गणना
गणना माप के आधार पर भिन्न होती है। उदाहरण के लिए, बिंदुओं के बीच यूक्लिडियन दूरी A] और B] निर्देशांक के साथ (x]1], y]1 ]]]]]]]]]2], y[FLT:FLT:8]]]]2[[FLT:]]]2[[FLT:FLT:5]]]]]]]]]]]
√(x]]2] - x]1]]]]]]]]2]]+ (y]]]2] - y]1]]]]]]]]]]]]2[FLT:FLT:5]]]]]]]]]]]]]]]]]
अन्य उपायों में अपना सूत्र होता है, अक्सर इसमें सुविधाओं के समीकरण या अनुपात शामिल होते हैं।
दूरी माप के अनुप्रयोग
विभिन्न प्रकार के सीखने के कार्यों में दूरी के उपायों का उपयोग किया जाता है:
- Clustering: K-means जैसे एल्गोरिथ्म समान डेटा बिंदुओं के समूह की दूरी की गणना पर निर्भर करते हैं।
- Dimensionality कमी:] तकनीक जैसे कि टी-SNE कम आयामों में डेटा संरचना को संरक्षित करने के लिए दूरी का उपयोग करते हैं।
- ]Anomaly जांच: विशिष्ट डेटा क्लस्टर से उनकी दूरी के आधार पर बाहरी लोगों को पहचानता है।