वैनिषय स्नातक की समस्याएं गहरी तंत्रिका नेटवर्क प्रशिक्षण में एक आम चुनौती है। वे तब होते हैं जब ढाल बहुत छोटे हो जाते हैं, जिससे नेटवर्क को प्रभावी ढंग से सीखने से रोका जा सकता है। कारणों और समाधानों को समझना मॉडल प्रदर्शन और प्रशिक्षण स्थिरता में सुधार कर सकता है।

वैनिषिंग ग्रेडियेंट्स को समझना

यह स्पष्ट रूप से स्पष्ट रूप से कम हो सकता है कि यह एक बहुत ही धीमी गति से सीखने की ओर जाता है या इससे पहले की परतों में कोई सीखने की कोई आवश्यकता नहीं होती है।

आम कारणों

  • सक्रियण कार्यों का उपयोग जैसे सिग्मोइड या तान्ह जो स्क्वैश इनपुट को छोटी श्रेणियों में शामिल करता है।
  • कई परतों के साथ दीप नेटवर्क आर्किटेक्चर।
  • अनुचित वजन प्रारंभिककरण।

प्रैक्टिकल सॉल्यूशंस

कई तकनीकें वैनिशिंग ग्रेडिएंट को कम कर सकती हैं और प्रशिक्षण परिणामों में सुधार कर सकती हैं।

सक्रियण कार्य

Relu (Rectified Linear Unit) या इसके संस्करण के साथ सिग्मोइड या तान्ह को बदलना ढाल प्रवाह को बनाए रखने में मदद करता है। ये कार्य स्क्वैश इनपुट को छोटी रेंज में नहीं करते हैं, जिससे ढाल को अधिक प्रभावी ढंग से गुजरने की अनुमति मिलती है।

वजन आरंभीकरण

उचित प्रारंभिककरण विधियों का उपयोग करके, जैसे कि ज़ेवियर या हे प्रारंभिककरण, प्रशिक्षण की शुरुआत में लुप्त होने या विस्फोट करने से ढाल को रोका जा सकता है।

नेटवर्क वास्तुकला

अवशिष्ट कनेक्शन को कार्यान्वित करने या कनेक्शन छोड़ने से ढाल को कुछ परतों को बायपास करने की अनुमति मिलती है, जो बैकप्रोपेशन के दौरान अपनी ताकत को बनाए रखती है।