Table of Contents
क्रॉस-वैलिडेशन एक सांख्यिकीय विधि है जिसका उपयोग मशीन लर्निंग मॉडल के प्रदर्शन का मूल्यांकन करने के लिए किया जाता है। यह आकलन करने में मदद करता है कि कैसे एक मॉडल एक स्वतंत्र डेटासेट को सामान्यीकृत करता है। क्रॉस-वैलिडेशन का उचित कार्यान्वयन विश्वसनीय मॉडल मूल्यांकन और चयन सुनिश्चित करता है।
क्रॉस-वैलिडेशन को समझना
क्रॉस-वैलिडेशन में डेटा को सबसेट में विभाजित करना, इन सबसेटों में से कुछ पर मॉडल को प्रशिक्षण देना और इसे दूसरों पर परीक्षण करना शामिल है। यह प्रक्रिया औसत प्रदर्शन मीट्रिक प्राप्त करने के लिए कई बार दोहराई जाती है। सबसे आम विधि k-fold क्रॉस-वैलिडेशन है, जहां डेटा k बराबर भागों में विभाजित है।
क्रॉस-वैलिडेशन में गणना
के-फोल्ड क्रॉस-वैलिडेशन में निम्नलिखित कदम किए जाते हैं:
- डेटासेट को K बराबर भागों में विभाजित करें।
- प्रत्येक पुनरावृत्ति के लिए, एक भाग को टेस्ट सेट के रूप में चुनें और शेष K-1 भागों को प्रशिक्षण सेट के रूप में चुनें।
- प्रशिक्षण सेट पर मॉडल को प्रशिक्षित करें और परीक्षण सेट पर इसका मूल्यांकन करें।
- प्रदर्शन मीट्रिक रिकॉर्ड करें, जैसे सटीकता या मतलब वर्ग त्रुटि।
- जब तक सभी भागों का परीक्षण सेट के रूप में उपयोग नहीं किया जाता है तब तक दोहराएं।
समग्र प्रदर्शन की गणना प्रत्येक पुनरावृत्ति में प्राप्त मैट्रिक्स को औसत करके की जाती है। यह मॉडल की प्रभावशीलता का अधिक मजबूत अनुमान प्रदान करता है।
क्रॉस-वैलिडेशन के लिए सर्वश्रेष्ठ अभ्यास
सटीक मूल्यांकन सुनिश्चित करने के लिए, इन सर्वोत्तम प्रथाओं पर विचार करें:
- डेटासेट आकार के आधार पर, K का उपयुक्त मान, जैसे 5 या 10।
- पूर्वाग्रह को रोकने के लिए विभाजन से पहले डेटा shuffling सुनिश्चित करें।
- असंतुलित डेटासेट के लिए वर्ग वितरण को बनाए रखने के लिए स्ट्रेटिफाइड क्रॉस-वैलिडेशन का उपयोग करें।
- इष्टतम परिणामों के लिए अतिपरामीटर ट्यूनिंग के साथ क्रॉस-वैलिडेशन को मिलाएं।
- प्रशिक्षण और परीक्षण सेट के बीच लीक होने से सूचना को रोकने के द्वारा डेटा रिसाव के प्रति सावधान रहें।