Table of Contents
मशीन लर्निंग मॉडल का मूल्यांकन करने के लिए ओवरफिटिंग और अंडरफिटिंग को समझना आवश्यक है। ये अवधारणाएं यह निर्धारित करने में मदद करती हैं कि कैसे अच्छी तरह से एक मॉडल बिना सोचे डेटा को सामान्यीकृत करता है। प्रासंगिक मीट्रिक की गणना मॉडल प्रदर्शन और गाइड सुधार में अंतर्दृष्टि प्रदान करती है।
ओवरफिटिंग मैट्रिक
ओवरफिटिंग तब होती है जब एक मॉडल प्रशिक्षण डेटा पर अच्छी तरह से प्रदर्शन करता है लेकिन नए डेटा पर खराब। ओवरफिटिंग का पता लगाने के लिए आम मीट्रिक में शामिल हैं:
- ]ट्रेनिंग बनाम वैलिडेशन त्रुटि: एक बड़ा अंतर अतिव्यापी इंगित करता है।
- Complexity Measures: जैसे डेटा बिंदुओं के सापेक्ष मापदंडों की संख्या।
- Cross-Validation स्कोर: सत्यापन स्कोर की तुलना में महत्वपूर्ण रूप से उच्च प्रशिक्षण स्कोर overfit का सुझाव देते हैं।
Underfit Metrics
जब एक मॉडल अंतर्निहित डेटा पैटर्न को कैप्चर करने के लिए बहुत सरल होता है तो अंडरफिटिंग में शामिल होते हैं:
- ] प्रशिक्षण और सत्यापन सेट दोनों पर उच्च त्रुटि: मॉडल को इंगित करता है कि यह सरल है।
- ] कम मॉडल जटिलता: जैसे बहुत कम सुविधाओं या मापदंडों।
- ]Consistent Poor Performance: प्रशिक्षण और सत्यापन डेटा के पार।
गणना मीट्रिक
आम मेट्रिक्स में सटीकता, परिशुद्धता, याद और F1 स्कोर शामिल हैं। ओवरफिटिंग या अंडरफिटिंग का मूल्यांकन करने के लिए, इन मेट्रिक्स की तुलना प्रशिक्षण और सत्यापन डेटासेट में की जाती है। एक महत्वपूर्ण विसंगति ओवरफिटिंग का सुझाव देती है, जबकि समान रूप से कम स्कोर नीचे इंगित करता है।
क्रॉस-वैलिडेशन का उपयोग करने से मॉडल स्थिरता का आकलन करने में मदद मिलती है। एकाधिक फोल्ड्स में औसत प्रदर्शन की गणना से मॉडल को अनसेंस्ड डेटा पर कैसे प्रदर्शन किया जाएगा, इसका विश्वसनीय अनुमान मिलता है।