क्लस्टरिंग एक मूलभूत तकनीक है जो असुरक्षित सीखने में है जो उनकी विशेषताओं के आधार पर डेटा अंक को समूहित करती है। क्लस्टरिंग के पीछे गणितीय सिद्धांतों को समझना प्रभावी एल्गोरिदम डिजाइन करने और उनके परिणामों की व्याख्या करने में मदद करता है।

क्लस्टरिंग में दूरी मीट्रिक

दूरी मीट्रिक डेटा बिंदुओं के बीच समानता को मापते हैं। आम मीट्रिक में यूक्लिडियन दूरी, मैनहट्टन दूरी और कॉसिन समानता शामिल है। मीट्रिक प्रभावों की पसंद क्लस्टर कैसे बनते हैं और एल्गोरिदम की संवेदनशीलता को बाहरी लोगों तक प्रभावित कर सकते हैं।

Centroid की गणना

Centroids एक क्लस्टर के केंद्र का प्रतिनिधित्व करते हैं। उन्हें आम तौर पर क्लस्टर के भीतर सभी डेटा बिंदुओं के बीच की गणना की जाती है। गणितीय रूप से, बिंदुओं के साथ एक क्लस्टर के लिए x]1 , x]2], ..., xn]], centroid]C[FLT:]] है:

C = (1/n) Σi=1]]n] x]]i]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]

क्लस्टरिंग एल्गोरिथ्म के लिए डिजाइन सिद्धांत

प्रभावी क्लस्टरिंग एल्गोरिदम समूह को अनुकूलित करने के लिए कुछ सिद्धांतों का पालन करते हैं। इनमें इंट्रा-क्लस्टर विचरण को कम करना और अंतर-क्लस्टर दूरी को अधिकतम करना शामिल है। एल्गोरिथ्म जैसे कि के-मेन्स ने सामूहिक सह-हैंड में सुधार के लिए सेंट्रोइड्स को अपडेट किया।

क्लस्टरिंग प्रदर्शन का मूल्यांकन करना

सिलहोट स्कोर और डेविस-बोल्डिन इंडेक्स जैसे मीट्रिक क्लस्टरिंग की गुणवत्ता को निर्धारित करते हैं। वे यह आकलन करते हैं कि अन्य समूहों की तुलना में उनके क्लस्टरों के भीतर कितनी अच्छी तरह से डेटा पॉइंट फिट होते हैं, गाइडिंग पैरामीटर चयन और एल्गोरिदम ट्यूनिंग।