انتخاب اندازه گام مناسب یا میزان یادگیری، برای آموزش شبکه های عصبی عمیق ضروری است.این بر چگونگی ترکیب و تاثیر سریع مدل و بر ثبات فرآیند آموزش تأثیر می گذارد.این مقاله یک رویکرد عملی برای محاسبه اندازه گام برای گرادیانت در مدل های یادگیری عمیق فراهم می کند.

آشنایی با Gradient Descent

Gradiention یک الگوریتم بهینه سازی است که برای به حداقل رساندن عملکرد از دست دادن با آنی که به طور غریزی به روز رسانی وزن مدل را به روز می کند، استفاده می شود. اندازه گام که بسیار بزرگ است می تواند باعث بیش از حد عیب یابی شود، در حالی که یک بسیار کوچک ممکن است منجر به همگرایی کند.

محاسبه اندازه ی مرحله

یک روش عملی شامل استفاده از ثابت لیپشتز از گرادینت تابع از دست دادن است، اگر این ثابت، به عنوان L، شناخته شده یا تخمین زده شده باشد، اندازه گام می تواند به عنوان 1 / L تنظیم شود که همگرایی پایدار را در طول آموزش تضمین می کند.

در مواردی که L ناشناخته است، یک رویکرد مشترک این است که یک جستجوی خط یا استفاده از روش های اکتشافی مانند برنامه های سرعت یادگیری را انجام دهید.این تکنیک ها اندازه گام را بر اساس پیشرفت آموزش سازگار می کنند.

نکات عملی

  • با یک سرعت یادگیری کوچک شروع کنید و به تدریج آن را افزایش دهید.
  • نظارت بر عملکرد از دست دادن برای تشخیص اختلاف یا همگرایی آهسته.
  • از بهینه سازی های سازگار مانند آدام یا RMSprop استفاده کنید که اندازه گام را به طور خودکار تنظیم می کنند.
  • استفاده از تجزیه و تحلیل نرخ یادگیری برای اصلاح آموزش به عنوان پیشرفت.