क्रॉस-वैलिडेशन एक तकनीक है जिसका उपयोग मशीन लर्निंग मॉडल के प्रदर्शन का मूल्यांकन करने के लिए किया जाता है। यह ट्यूनिंग मॉडल मापदंडों में मदद करता है, यह अनुमान लगाकर कि कैसे अच्छी तरह से मॉडल बिना किसी डेटा पर प्रदर्शन करेगा। इस प्रक्रिया में डेटासेट को कई हिस्सों में विभाजित करना, कुछ हिस्सों पर मॉडल को प्रशिक्षण देना और दूसरों पर इसका परीक्षण करना शामिल है। यह लेख मॉडल ट्यूनिंग के दौरान क्रॉस-वैलिडेशन त्रुटि की चरण-दर-चरण गणना बताता है।

चरण 1: डेटा विभाजन

डेटासेट को 'के' बराबर भागों में विभाजित किया गया है, जिसे फोल्ड कहा जाता है। 'के' के लिए आम विकल्प 5 या 10 हैं। प्रत्येक गुना एक बार मान्यकरण सेट के रूप में कार्य करता है, जबकि शेष फोल्ड प्रशिक्षण सेट बनाते हैं। यह प्रक्रिया यह सुनिश्चित करती है कि प्रत्येक डेटा बिंदु का उपयोग प्रशिक्षण और सत्यापन दोनों के लिए किया जाता है।

चरण 2: मॉडल प्रशिक्षण और सत्यापन

प्रत्येक गुना के लिए, मॉडल को शेष 'K-1' फोल्ड पर प्रशिक्षित किया जाता है। इसके बाद इसे वर्तमान मोड़ पर मान्य किया जाता है। सत्यापन फोल्ड में वास्तविक मूल्यों की तुलना में त्रुटि की गणना मॉडल की भविष्यवाणी के आधार पर की जाती है। यह कदम सभी फोल्ड्स के लिए दोहराया जाता है।

चरण 3: त्रुटि गणना

प्रत्येक गुना से त्रुटियां दर्ज की गई हैं। आम त्रुटि मीट्रिक में मतलब वर्ग त्रुटि (MSE) या मतलब पूर्ण त्रुटि (MAE) शामिल है। क्रॉस-वैलिडेशन त्रुटि इन त्रुटियों का औसत है, जो सभी गुना में मॉडल के प्रदर्शन का अनुमान प्रदान करती है।

चरण 4: अंतिम त्रुटि अनुमान

क्रॉस-वैलिडेशन प्रक्रिया से प्राप्त औसत त्रुटि यह अनुमान के रूप में कार्य करती है कि कैसे मॉडल नए, बिना सोचे डेटा पर प्रदर्शन करेगा। यह मान ट्यूनिंग के दौरान इष्टतम मॉडल मापदंडों के चयन का मार्गदर्शन करता है।