Table of Contents
असंतुलित डेटासेट कई वास्तविक दुनिया के अनुप्रयोगों में आम हैं, जैसे धोखाधड़ी का पता लगाना, चिकित्सा निदान और विसंगत पता लगाना। असंतुलन को संबोधित करना प्रभावी मशीन लर्निंग मॉडल के निर्माण के लिए महत्वपूर्ण है। यह लेख प्रभावी ढंग से असंतुलित डेटा को संभालने के लिए गणितीय सिद्धांतों द्वारा समर्थित व्यावहारिक तकनीकों का पता लगाता है।
डेटा असंतुलन को समझना
डेटा असंतुलन तब होता है जब एक वर्ग में उदाहरणों की संख्या दूसरे में काफी अधिक होती है। यह असंतुलन बहुमत वर्ग की ओर मॉडल को पूर्वाग्रह कर सकता है, जिससे अल्पसंख्यक वर्ग के उदाहरणों का पता लगाने की उनकी क्षमता को कम किया जा सकता है। गणितीय रूप से, अगर N] is कुल संख्या नमूनों की संख्या और Nminority[FLT:]minority ] ]]] [FLT:]]]]N[FLT[F[F[F[F[F]]][F[F[F[F[F[F[F]]]]]][FLT[F[F[F[F[[[[F]]]]][FLT[F[F[F[F[F[F[F]]]]]]]]]]]]]]]]]]]]][FLT[FLT[F[F[F[FLT[
असंतुलन को संभालने की तकनीक
कई तकनीक डेटा असंतुलन के प्रभावों को कम कर सकती है। इन तरीकों को मोटे तौर पर डेटा-स्तर और एल्गोरिदम-स्तर दृष्टिकोण में वर्गीकृत किया जा सकता है।
डेटा लेवल विधि
- Oversampling: मामूली वर्ग के नमूनों को बढ़ाने, अक्सर SMOTE जैसे तरीकों का उपयोग करते हुए, जो मौजूदा अल्पसंख्यक नमूनों के आधार पर सिंथेटिक डेटा अंक उत्पन्न करते हैं।
- Undersampling: डेटासेट को संतुलित करने के लिए बहुमत वर्ग के नमूनों को कम करना, जो मूल्यवान जानकारी खो सकते हैं।
- Hybrid दृष्टिकोण: डेटा संतुलन को अनुकूलित करने के लिए ओवरसैम्पलिंग और अंडरसैम्पलिंग का संयोजन।
Algorithm-Level Methods
- Cost-संवेदनशील शिक्षा: मॉडल के ध्यान को प्रभावित करने के लिए अल्पसंख्यक वर्ग त्रुटियों के लिए उच्च वर्गीकरण लागत को सौंपना।
- ]Ensemble तरीकों: अल्पसंख्यक वर्ग का पता लगाने में सुधार करने के लिए बढ़ाने की तरह तकनीकों का उपयोग करना।
- ]निर्णय सीमा को समायोजित करना: अल्पसंख्यक वर्ग भविष्यवाणियों के पक्ष में संभावना कटौती को संशोधित करना।
गणितीय फाउंडेशन
कई तकनीकों को सांख्यिकीय और गणितीय अवधारणाओं में आधार बनाया गया है। उदाहरण के लिए, SMOTE अल्पसंख्यक वर्ग बिंदुओं के बीच अंतर करके सिंथेटिक नमूनों का निर्माण करता है:
x]new]] = x]]i + लैम्ब्डा (x]j]] - x]i]]]]]]]]]]]]]
जहां ] x]i]] ] और xj]] अल्पसंख्यक वर्ग के नमूने हैं, और lambda 0 और 1 के बीच एक यादृच्छिक संख्या है। यह दृष्टिकोण अल्पसंख्यक वर्ग के फीचर स्पेस के भीतर सिंथेटिक डेटा को सुनिश्चित करता है, डेटा वितरण अखंडता को बनाए रखता है।