Table of Contents
असंतुलित डेटा मशीन लर्निंग में एक आम चुनौती है, जहां एक वर्ग दूसरों को काफी हद तक बहिष्कार करता है। यह असंतुलन पूर्वाग्रहित मॉडलों का कारण बन सकता है जो अल्पसंख्यक वर्गों पर खराब प्रदर्शन करते हैं। लागत-संवेदनशील सीखने की तकनीक इस मुद्दे को गलतफहमी के लिए अलग-अलग लागतों को असाइन करके संबोधित करती है, जिससे मॉडल अल्पसंख्यक वर्गों पर ध्यान केंद्रित करने में मदद मिलती है।
असंतुलित डेटा को समझना
असंतुलित डेटासेट विभिन्न क्षेत्रों जैसे धोखाधड़ी का पता लगाने, चिकित्सा निदान और स्पैम फ़िल्टरिंग में होते हैं। इन मामलों में, अल्पसंख्यक वर्ग अक्सर अधिक महत्वपूर्ण लेकिन कम प्रतिनिधित्व किया जाता है। मानक एल्गोरिदम बहुमत वर्ग के पक्ष में होते हैं, जिसके परिणामस्वरूप अल्पसंख्यक वर्ग के लिए कम याद आती है।
लागत-संवेदनशील लर्निंग तकनीक
लागत-संवेदनशील सीखने में विभिन्न विविध गलत वर्गीकरण लागतों के लिए लेखांकन की सीखने की प्रक्रिया को संशोधित करना शामिल है। अल्पसंख्यक वर्गों पर त्रुटियों को उच्च लागत सौंपकर, मॉडल इन वर्गों के प्रति अधिक संवेदनशील हो जाते हैं, समग्र प्रदर्शन में सुधार करते हैं।
आम दृष्टिकोण
- ]Weighted एल्गोरिदम: अल्पसंख्यक वर्गों के गलत वर्गीकरण को दंडित करने के लिए हानि समारोह में वर्ग वजन को शामिल करना अधिक भारी।
- Cost matrices: एक मैट्रिक्स को हर प्रकार के गलत वर्गीकरण की लागत को निर्दिष्ट करने की परिभाषित करें, जो मॉडल को कुल लागत को कम करने के लिए मार्गदर्शन करता है।
- ]Sampling तकनीक: डेटासेट को संतुलित करने के लिए ओवरसैम्पलिंग या अंडरसैम्पलिंग के साथ लागत-संवेदनशील तरीकों को मिलाएं।