असंतुलित डेटासेट कई वास्तविक दुनिया के अनुप्रयोगों में आम हैं, जैसे धोखाधड़ी का पता लगाना, चिकित्सा निदान और विसंगत पता लगाना। असंतुलन को संबोधित करना प्रभावी मशीन लर्निंग मॉडल के निर्माण के लिए महत्वपूर्ण है। यह लेख प्रभावी ढंग से असंतुलित डेटा को संभालने के लिए गणितीय सिद्धांतों द्वारा समर्थित व्यावहारिक तकनीकों का पता लगाता है।

डेटा असंतुलन को समझना

डेटा असंतुलन तब होता है जब एक वर्ग में उदाहरणों की संख्या दूसरे में काफी अधिक होती है। यह असंतुलन बहुमत वर्ग की ओर मॉडल को पूर्वाग्रह कर सकता है, जिससे अल्पसंख्यक वर्ग के उदाहरणों का पता लगाने की उनकी क्षमता को कम किया जा सकता है। गणितीय रूप से, अगर N] is कुल संख्या नमूनों की संख्या और Nminority[FLT:]minority ] ]]] [FLT:]]]]N[FLT[F[F[F[F[F]]][F[F[F[F[F[F[F]]]]]][FLT[F[F[F[F[[[[F]]]]][FLT[F[F[F[F[F[F[F]]]]]]]]]]]]]]]]]]]]][FLT[FLT[F[F[F[FLT[

असंतुलन को संभालने की तकनीक

कई तकनीक डेटा असंतुलन के प्रभावों को कम कर सकती है। इन तरीकों को मोटे तौर पर डेटा-स्तर और एल्गोरिदम-स्तर दृष्टिकोण में वर्गीकृत किया जा सकता है।

डेटा लेवल विधि

  • Oversampling: मामूली वर्ग के नमूनों को बढ़ाने, अक्सर SMOTE जैसे तरीकों का उपयोग करते हुए, जो मौजूदा अल्पसंख्यक नमूनों के आधार पर सिंथेटिक डेटा अंक उत्पन्न करते हैं।
  • Undersampling: डेटासेट को संतुलित करने के लिए बहुमत वर्ग के नमूनों को कम करना, जो मूल्यवान जानकारी खो सकते हैं।
  • Hybrid दृष्टिकोण: डेटा संतुलन को अनुकूलित करने के लिए ओवरसैम्पलिंग और अंडरसैम्पलिंग का संयोजन।

Algorithm-Level Methods

  • Cost-संवेदनशील शिक्षा: मॉडल के ध्यान को प्रभावित करने के लिए अल्पसंख्यक वर्ग त्रुटियों के लिए उच्च वर्गीकरण लागत को सौंपना।
  • ]Ensemble तरीकों: अल्पसंख्यक वर्ग का पता लगाने में सुधार करने के लिए बढ़ाने की तरह तकनीकों का उपयोग करना।
  • ]निर्णय सीमा को समायोजित करना: अल्पसंख्यक वर्ग भविष्यवाणियों के पक्ष में संभावना कटौती को संशोधित करना।

गणितीय फाउंडेशन

कई तकनीकों को सांख्यिकीय और गणितीय अवधारणाओं में आधार बनाया गया है। उदाहरण के लिए, SMOTE अल्पसंख्यक वर्ग बिंदुओं के बीच अंतर करके सिंथेटिक नमूनों का निर्माण करता है:

x]new]] = x]]i + लैम्ब्डा (x]j]] - x]i]]]]]]]]]]]]]

जहां ] x]i]] ] और xj]] अल्पसंख्यक वर्ग के नमूने हैं, और lambda 0 और 1 के बीच एक यादृच्छिक संख्या है। यह दृष्टिकोण अल्पसंख्यक वर्ग के फीचर स्पेस के भीतर सिंथेटिक डेटा को सुनिश्चित करता है, डेटा वितरण अखंडता को बनाए रखता है।