إن التخريب والتفريغ الجانتين هما من القضايا المشتركة في تدريب الشبكات العصبية العميقة، حيث يحدث ذلك عندما تصبح المتدرجات صغيرة جدا أو كبيرة جدا أثناء عملية التكرير، مما يؤثر على عملية التعلم، ويستلزم فهم هذه الظواهر تحليل الحسابات التي تُجرى وراء تحديثات الوزن واستكشاف الحلول المحتملة.

اختفاء كبير

ويحدث اختفاء كبير عندما تنخفض التدرجات انخفاضاً هائلاً حيث تُنشر من الخلف عبر طبقات، مما يؤدي إلى تحديثات صغيرة جداً للوزن، مما يُسبب في تَعَلُّم الشبكة ببطء شديد أو التوقف عن التعلم كلية.

الرياضيات، إذا كانت وظيفة التفعيل أقل من 1، التدرج في طبقة

⁇ L/ ⁇ w]l] = ())* ()/

(أ) إذا كان ()]l/ ⁇ z]l]] هو المشتق لوظيفة التنشيط، وإذا كان هذا المشتق أقل من 1، فإن تكرار تعدد الآثار يؤدي إلى تضاؤل الأداء.

استكشاف المراعي

ويحدث انفجار كبير عندما تنمو الخريجات بشكل مكثف أثناء عملية التكرير الخلفي، مما يؤدي إلى تحديثات كبيرة جدا للوزن، مما قد يتسبب في عدم الاستقرار والاختلاف في التدريب.

الرياضيات، إذا كانت المشتقات المعنية أكبر من 1، يمكن أن تزيد المستويات زيادة مضاعفة:

⁇ L/ ⁇ w]l] ng (l+1)* ([)

الحلول التي يتعين حلها لإبطال مفعول العرّافات وتفجيرها

ويمكن لعدة أساليب التخفيف من هذه المسائل:

  • Weight Initialization:] Using methods like Xavier or He initialization helps maintain stable gradients.
  • Activation Functions:] ReLU and its variants reduce the risk of vanishing gradients.
  • Gradient Clipping:] Limiting the maximum value of gradients prevents explosion.
  • Normalization:] Batch normalization settles the learning process.