Table of Contents
पर्यवेक्षण शिक्षा एक व्यापक रूप से इस्तेमाल की जाने वाली मशीन लर्निंग दृष्टिकोण है जिसमें लेबल डेटा पर प्रशिक्षण मॉडल शामिल हैं। हालांकि, चिकित्सक अक्सर उन सामान्य नुकसानों का सामना करते हैं जो उनके मॉडल के प्रदर्शन और विश्वसनीयता को प्रभावित कर सकते हैं। इन मुद्दों को समझना और उचित गणना लागू करना उनके प्रभाव को कम करने में मदद कर सकता है।
ओवरफिटिंग और अंडरफिटिंग
ओवरफिटिंग तब होता है जब एक मॉडल प्रशिक्षण डेटा को अच्छी तरह से सीखता है, जिसमें शोर भी शामिल है, जिससे नए डेटा पर खराब सामान्यीकरण होता है। अंडरफिटिंग तब होता है जब मॉडल अंतर्निहित पैटर्न पर कब्जा करने के लिए बहुत सरल होता है।
उदाहरण के लिए, प्रशिक्षण त्रुटि (E]]train]] की तुलना में और सत्यापन त्रुटि (E]val]]) ओवरफिटिंग को इंगित कर सकता है अगर E]train बहुत कम है जबकि E]val] उच्च है। इसके विपरीत, दोनों पर उच्च त्रुटियाँ नीचे की ओर संकेत देती हैं।
वर्ग असंतुलन
क्लास असंतुलन तब होता है जब कुछ वर्ग डेटासेट में कम होते हैं, जिससे पूर्वाग्रहित मॉडल होते हैं। कक्षा वितरण प्रतिशत की गणना असंतुलन की पहचान करने में मदद करती है।
मान लीजिए कि डेटासेट में 1000 नमूने हैं, जिसमें 900 वर्ग A और 100 से लेकर कक्षा B तक का है। वर्ग वितरण प्रतिशत हैं:
कक्षा A: (900/1000) * 100 = 90%
कक्षा बी: (100/1000) * 100 = 10%
मॉडल प्रदर्शन का मूल्यांकन
सटीकता, परिशुद्धता, याद और F1-score जैसे मीट्रिक मॉडल प्रदर्शन का आकलन करने के लिए आवश्यक हैं। गणना में भ्रम मैट्रिक्स घटकों को शामिल किया गया है:
- True सकारात्मक (TP)
- झूठी सकारात्मक (FP)
- झूठी नकारात्मक (FN)
उदाहरण के लिए, परिशुद्धता की गणना निम्नानुसार की जाती है:
परिशुद्धता = TP / (TP + FP)
हैंडलिंग शोर डेटा
शोर डेटा मॉडल प्रशिक्षण को विकृत कर सकता है। गणनाएं जैसे शोर-टू-सिग्नल अनुपात डेटा की गुणवत्ता को मापने में मदद करता है।
मान लीजिए कि डेटासेट में 1000 कुल नमूनों से 100 शोर नमूने हैं। शोर अनुपात है:
शोर अनुपात = (नॉयस नमूने की संख्या) / (कुल नमूने) = 100/1000 = 0.1 या 10%