Table of Contents
क्रॉस-वैलिडेशन एक सांख्यिकीय विधि है जिसका उपयोग मशीन लर्निंग मॉडल के प्रदर्शन का मूल्यांकन करने के लिए किया जाता है। यह आकलन करने में मदद करता है कि कैसे अच्छी तरह से एक मॉडल बिना सोचे डेटा को सामान्यीकृत करता है। उचित डिजाइन और गणना विश्वसनीय परिणाम प्राप्त करने और ओवरफिटिंग या अंडरफिटिंग से बचने के लिए आवश्यक हैं।
क्रॉस-वैलिडेशन के मूल सिद्धांत
क्रॉस-वैलिडेशन में डेटा को सबसेट में विभाजित करना, कुछ सबसेट पर मॉडल को प्रशिक्षण देना और इसे दूसरों पर परीक्षण करना शामिल है। यह प्रक्रिया नए डेटा पर मॉडल के प्रदर्शन का अनुमान प्रदान करती है। सबसे आम विधि k-fold क्रॉस-वैलिडेशन है, जहां डेटा k बराबर भागों में विभाजित है।
डिजाइन विचार
सही मापदंडों का चयन करना महत्वपूर्ण है। गुना (k) की संख्या पूर्वाग्रह और भिन्नता को प्रभावित करती है। एक उच्च k पूर्वाग्रह को कम करता है लेकिन गणना समय को बढ़ाता है। आमतौर पर, k संतुलित परिणामों के लिए 5 या 10 तक सेट होता है। डेटा को सुनिश्चित करने से पहले डेटा को बेतरतीब ढंग से छिलका दिया जाता है जिससे डेटा के आदेश के कारण पूर्वाग्रह को रोका जा सकता है।
विश्वसनीय परिणामों के लिए गणना
सभी फोल्ड्स में औसत प्रदर्शन मीट्रिक की गणना एक समग्र अनुमान प्रदान करती है। इसके अतिरिक्त, मानक विचलन की गणना मॉडल के प्रदर्शन की परिवर्तनशीलता में अंतर्दृष्टि प्रदान करती है। यह मॉडल की स्थिरता को समझने में मदद करता है।
- डेटा को K बराबर भागों में विभाजित करें
- K-1 भागों पर ट्रेन, शेष भाग पर परीक्षण
- सभी K भागों के लिए दोहराएं
- प्रदर्शन मीट्रिक का औसत और मानक विचलन की गणना