क्लास असंतुलन तब होता है जब किसी डेटासेट में कुछ वर्गों को दूसरों की तुलना में काफी कम प्रतिनिधित्व किया जाता है। यह असंतुलन खराब मॉडल प्रदर्शन का कारण बन सकता है, विशेष रूप से वर्गीकरण जैसे कार्यों में जहां अल्पसंख्यक वर्ग महत्वपूर्ण हैं। सटीक और विश्वसनीय तंत्रिका नेटवर्क के विकास के लिए क्लास असंतुलन को संबोधित करना आवश्यक है।

कक्षा असंतुलन को संबोधित करने के लिए आम तकनीक

कई तरीकों का उपयोग तंत्रिका नेटवर्क में कक्षा असंतुलन को कम करने के लिए किया जाता है। इन तकनीकों को व्यक्तिगत रूप से या बेहतर परिणामों के लिए संयुक्त रूप से लागू किया जा सकता है।

डेटा लेवल विधि

डेटा-स्तर दृष्टिकोण डेटासेट को कक्षा वितरण को संतुलित करने के लिए संशोधित करता है।

  • Oversampling: मामूली वर्ग के नमूनों की संख्या में वृद्धि, अक्सर दोहराव या सिंथेटिक डेटा पीढ़ी के माध्यम से।
  • Undersampling: अल्पसंख्यक वर्गों से मेल खाने के लिए बहुमत वर्ग के नमूनों की संख्या को कम करने के लिए।
  • SMOTE: सिंथेटिक अल्पसंख्यक अति-सैंपलट तकनीक अल्पसंख्यक वर्गों के लिए नए सिंथेटिक उदाहरण बनाता है।

Algorithm-Level तकनीक

ये विधियां सीखने के एल्गोरिथ्म को बेहतर ढंग से असंतुलित डेटा को संभालने के लिए संशोधित करती हैं। उदाहरणों में शामिल हैं:

  • Cost-संवेदनशील शिक्षा: अल्पसंख्यक वर्गों को उच्च वर्गीकरण लागत सौंपा गया।
  • Focal loss: कठोर वर्गीय उदाहरणों पर प्रशिक्षण केंद्रित करता है, जिससे आसान नकारात्मक प्रभाव कम हो जाता है।

रियल-विश्व डाटा उदाहरण

चिकित्सा निदान में, डेटासेट में अक्सर कम सकारात्मक मामले होते हैं। ओवरसैम्पलिंग या SMOTE को लागू करने से मॉडल संवेदनशीलता में सुधार हो सकता है। धोखाधड़ी का पता लगाने में, जहां धोखाधड़ी का लेनदेन दुर्लभ है, लागत-संवेदनशील सीखने से इन मामलों की पहचान को प्रभावी ढंग से करने में मदद मिलती है।