مشکلات گرادینت از دست رفته یک چالش رایج در آموزش شبکه های عصبی عمیق است که زمانی رخ می دهد که گرادیان خیلی کوچک می شوند و از یادگیری به طور موثر جلوگیری می کنند. درک علل و راه حل ها می تواند عملکرد مدل و ثبات آموزش را بهبود بخشد.

درک Vanishing Gradients

مشکل گرادینت از بین رفته در شبکه های عمیق در طول ارتقاء عقب ایجاد می شود، زیرا سیگنال خطا از طریق بسیاری از لایه ها به عقب منتشر می شود، گرادیان می توانند به صورت نمایی کاهش یابند.این منجر به یادگیری بسیار آهسته یا بدون یادگیری در لایه های قبلی می شود.

علل مشترک

  • استفاده از توابع فعال سازی مانند sigmoid یا tanh که ورودی را به محدوده های کوچک محدود می کند.
  • معماری شبکه های عمیق با لایه های مختلف
  • تزریق وزن اولیه

راه حل های عملی

چندین تکنیک می توانند گرادیان های از بین رفته را کاهش دهند و نتایج آموزش را بهبود بخشند.

فعال سازی توابع

جایگزینی sigmoid یا tanh با ReLU (واحد خطی تقویت شده) یا انواع آن به حفظ جریان گرادیان کمک می کند.این توابع ورودی های فشرده را به محدوده های کوچک محدود نمی کنند و اجازه می دهد گرادیان به طور موثر عبور کنند.

وزن اولیه

استفاده از روش های اولیه مناسب، مانند خاویر یا اولیه سازی او، می تواند از از ناپدید شدن یا منفجر شدن گرادیان در ابتدای آموزش جلوگیری کند.

معماری شبکه

پیاده سازی اتصالات باقیمانده یا اتصالات پرش اجازه می دهد تا گرادیان ها لایه های خاصی را دور بزنند، قدرت خود را در طول ارتقاء عقب حفظ کنند.