Table of Contents
شبکه های عصبی عمیق می توانند در طول آموزش با چالش مواجه شوند، به ویژه با مشکل گرادینت های از بین رفته، این مسئله زمانی رخ می دهد که گرادیان بسیار کوچک می شوند، مانع توانایی شبکه برای یادگیری موثر تکنیک های مختلف برای حل این مشکل و بهبود روند آموزش می شوند.
درک مشکل از دست رفته Gradient
مشکل گرادینت از بین رفته در درجه اول بر شبکه های عمیق با لایه های مختلف تأثیر می گذارد.در طول ارتقاء مجدد، گرادیان به عقب از طریق شبکه پخش می شوند، اگر گرادیان به طور چشمگیری کاهش یابد، لایه های قبلی به آرامی یاد می گیرند یا یادگیری را متوقف می کنند، این ظرفیت شبکه برای مدل سازی توابع پیچیده را محدود می کند.
تکنیک های Mitigate مسئله
چندین روش می تواند به کاهش تاثیر گرادیان های از بین رفتن کمک کند:
- عملکرد محرک: [FLT 1] استفاده از توابع مانند ReLU (واحد خطی یکپارچه) به جای sigmoid یاtanh کمک می کند تا گرادیان قوی تر حفظ شود.
- آغاز اولیه: روش های اولیه مناسب، مانند خاویر یا اولیه، از گرادیان جلوگیری از کوچک شدن یا انفجار در ابتدا.
- عادی سازی را فراموش کنید؛ ، ورودی های لایه ای ثابت می کند یادگیری و حفظ جریان گرادیان سالم است.
- اتصال های Skip: معماری مانند ResNet میانبرهایی را معرفی می کند که به گرادیان اجازه می دهد لایه های خاصی را دور بزنند.
- [[۱] [۱۰]: [۱۰] [۱۰] [۱۰] [۱۰]] [۱۰] [۱۰] [۱۰]]) کاهش اندازه گرادیان در طول آموزش مانع از کوچک شدن یا خیلی بزرگ شدن آنها می شود.
محاسبه ها و بینش ریاضی
در این صورت، در صورت بروز این کار، می توان به صورت زیر اشاره کرد:
[[ویرایش] [[[ویرایش] [[[ویرایش]] [[[ویرایش]]]] [[[[ویرایش]]] [[[ویرایش]] l /w [[[ویرایش] [FLT=L] [F8]
[در این باره] [و [از دست دادن] [از دست دادن [و [از دست دادن] [و [از دست دادن] [و [از دست دادن] [و [از دست دادن] [و [از دست دادن] [و [و]]] [و [از این رو] [از این رو] [براى] [براى [براى] [براى [براى] [براى [براى [براى] [و]]]] [براى [وى] [براى [براى [براى [براى]]]] [براى [براى [براى [براى]] [و [براى]]] [براى [براى [و [براى [براى [براى [براى [براى [براى]]]]]]]]]]]]]]]]]]] [براى [براى [براى [براى [براى [براى [براى [براى [براى [براى [براى [براى [براى [براى [براى [براى [براى [براى [براى [براى [بر
برای فعال سازی توابع مانند sigmoid، مشتق شده است:
[[ویرایش] [۱] [۱۰] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱۰] [۱] [۱] [۱] [۱۰] [۱] [۱] [۱۰] [۱] [۱] [۲] [۱] [۱] [۲] [۲] [۱] [۱] [۲] [۳] [۳] [۳] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۲] [۲] [۲] [۲] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۲] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۲] [۱] [۱] [۱] [۱] [۱] [۲] [۱] [۱]
از آنجایی که σ (x) بین 0 و 1 محدوده دارد، مشتق می تواند بسیار کوچک باشد، به ویژه برای |x، که به مشکل گرادینت در حال از بین رفتن کمک می کند.