Table of Contents
क्रॉस-वैलिडेशन एक तकनीक है जिसका उपयोग मशीन लर्निंग मॉडल के प्रदर्शन का मूल्यांकन करने के लिए किया जाता है। यह ट्यूनिंग मॉडल मापदंडों में मदद करता है, यह अनुमान लगाकर कि कैसे अच्छी तरह से मॉडल बिना किसी डेटा पर प्रदर्शन करेगा। इस प्रक्रिया में डेटासेट को कई हिस्सों में विभाजित करना, कुछ हिस्सों पर मॉडल को प्रशिक्षण देना और दूसरों पर इसका परीक्षण करना शामिल है। यह लेख मॉडल ट्यूनिंग के दौरान क्रॉस-वैलिडेशन त्रुटि की चरण-दर-चरण गणना बताता है।
चरण 1: डेटा विभाजन
डेटासेट को 'के' बराबर भागों में विभाजित किया गया है, जिसे फोल्ड कहा जाता है। 'के' के लिए आम विकल्प 5 या 10 हैं। प्रत्येक गुना एक बार मान्यकरण सेट के रूप में कार्य करता है, जबकि शेष फोल्ड प्रशिक्षण सेट बनाते हैं। यह प्रक्रिया यह सुनिश्चित करती है कि प्रत्येक डेटा बिंदु का उपयोग प्रशिक्षण और सत्यापन दोनों के लिए किया जाता है।
चरण 2: मॉडल प्रशिक्षण और सत्यापन
प्रत्येक गुना के लिए, मॉडल को शेष 'K-1' फोल्ड पर प्रशिक्षित किया जाता है। इसके बाद इसे वर्तमान मोड़ पर मान्य किया जाता है। सत्यापन फोल्ड में वास्तविक मूल्यों की तुलना में त्रुटि की गणना मॉडल की भविष्यवाणी के आधार पर की जाती है। यह कदम सभी फोल्ड्स के लिए दोहराया जाता है।
चरण 3: त्रुटि गणना
प्रत्येक गुना से त्रुटियां दर्ज की गई हैं। आम त्रुटि मीट्रिक में मतलब वर्ग त्रुटि (MSE) या मतलब पूर्ण त्रुटि (MAE) शामिल है। क्रॉस-वैलिडेशन त्रुटि इन त्रुटियों का औसत है, जो सभी गुना में मॉडल के प्रदर्शन का अनुमान प्रदान करती है।
चरण 4: अंतिम त्रुटि अनुमान
क्रॉस-वैलिडेशन प्रक्रिया से प्राप्त औसत त्रुटि यह अनुमान के रूप में कार्य करती है कि कैसे मॉडल नए, बिना सोचे डेटा पर प्रदर्शन करेगा। यह मान ट्यूनिंग के दौरान इष्टतम मॉडल मापदंडों के चयन का मार्गदर्शन करता है।