ग्रेडीएंट गायब और विस्फोट गहरी तंत्रिका नेटवर्क प्रशिक्षण में आम मुद्दे हैं। जब वे स्नातक होते हैं तो वे बैकप्रोपिएशन के दौरान बहुत छोटे या बहुत बड़े होते हैं, जिससे सीखने की प्रक्रिया को प्रभावित किया जाता है। इन घटनाओं को समझना वजन अद्यतन के पीछे की गणना का विश्लेषण करना और संभावित समाधानों की खोज करना शामिल है।

ग्रैडिएंट गायब

जब ढालें तेजी से कम हो जाती हैं तो वे परतों के माध्यम से पिछड़े हो जाते हैं। इससे बहुत छोटे वजन के अपडेट होते हैं, जिससे नेटवर्क को धीरे-धीरे सीखने या पूरी तरह से सीखने को रोकने के लिए प्रेरित किया जाता है।

गणितीय रूप से, यदि सक्रियण कार्य का व्युत्पन्न 1 से कम है, तो परत पर ढाल l] को निम्नानुसार व्यक्त किया जा सकता है:

]l]]](L/a ]l]]]]](L]]]l/ll]]]]]]](l[FLT:]]]]]]]]/l[FLT:]]]]]]]](]]]]]]]]](]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]

जहाँ ]]]]वाड़ा l]/warz]l ] सक्रियण समारोह का व्युत्पन्न है। यदि यह व्युत्पन्न 1 से कम है, तो बार-बार गुणन क्रमिक रूप से कम करने के लिए ढाल का कारण बनता है।

ग्रेडिएंट एक्सप्लोडिंग

जब ढालें बैकप्रोपैगेशन के दौरान तेजी से बढ़ती हैं तो ग्रेडिएंट का विस्फोट होता है। इससे बहुत बड़े वजन के अपडेट होते हैं, जिससे प्रशिक्षण में अस्थिरता और विचलन हो सकता है।

गणितीय रूप से, यदि शामिल डेरिवेटिव 1 से अधिक हैं, तो ग्रेडिएंट तेजी से बढ़ सकते हैं:

]]l]] ≈ (L/alia]l+1]]]]](]]l+1]]/lanz]l+1]]]]]]]](lz[FLT:]l+1[[FLT:]]]]]/lana]l[FLT[FLT:]]]]]]]]]]]]]]

वैनिषिंग और एक्सप्लोडिंग ग्रेडियेंट्स के समाधान

कई तकनीकों में इन मुद्दों को कम कर सकते हैं:

  • ]वाइट आरंभीकरण: Xavier या He प्रारंभिककरण जैसे तरीकों का उपयोग स्थिर ढाल बनाए रखने में मदद करता है।
  • Activation Functions: ReLU और इसके संस्करण गायब ढाल के जोखिम को कम करते हैं।
  • ]ग्रेडीन्ट क्लिपिंग:ग्रेडीन्ट्स के अधिकतम मूल्य को सीमित करने से विस्फोट को रोका जा सकता है।
  • Normalization: बैच सामान्यीकरण सीखने की प्रक्रिया को स्थिर करता है।