Table of Contents
Gradiention یک الگوریتم بهینه سازی اساسی است که در آموزش مدل های یادگیری ماشین نظارت شده استفاده می شود.این به به حداقل رساندن عملکرد خطا توسط پارامترهای مدل تنظیم کننده کمک می کند. درک چگونگی استخراج و اعمال این روش برای آموزش مدل موثر ضروری است.
آموزش درجه بندی ( Gradient Descent)
ایده اصلی گرادینت شامل محاسبه گرادیان تابع از دست دادن با توجه به پارامترهای مدل است.این گرادیان نشان دهنده جهت افزایش شیب دار است.برای به حداقل رساندن از دست دادن، پارامترهای در جهت مخالف گرادینت به روز می شوند.
از نظر ریاضی، قانون به روز رسانی پارامتر به عنوان:
[[ویرایش] [۱] [۱۰] [۱۰] [۱۰] [۱۰] [۱۰] [۱۰] [۱۰] [۱۰] [۱] [۱۰] [۱] [۱۰] [۱] [۱۰] [۱] [۱۰] [۱] [۱۰] [۱] [۱] [۱۰] [۱] [۳] [۳] [۳] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۲] [۱] [۱] [۳] [۲] [۲] [۲] [۲] [۱]
در جایی که پارامترهای مدل را نشان می دهد نرخ یادگیری و [1]L [GB] [GB] گرادیان تابع از دست دادن است.
استفاده از Gradient Descent
برای استفاده از گرادیان، مراحل زیر معمولاً دنبال می شوند:
- پارامترهای مدل را به طور تصادفی یا با مقادیر خاص اولیه کنید.
- عملکرد از دست دادن را بر اساس پارامترهای فعلی و داده های آموزشی محاسبه کنید.
- گرادینت از دست دادن را با توجه به هر پارامتر تکمیل کنید.
- پارامترهای استفاده از قانون شیب دار را به روز کنید.
- این فرآیند را تکرار کنید تا زمانی که از دست دادن به هم پیوسته یا تعدادی از کلروفیل ها برسد.
انتخاب نرخ یادگیری
میزان یادگیری (FLT:0) ⁇ اندازه هر مرحله به روز رسانی را تعیین می کند، یک نرخ یادگیری کوچک ممکن است به همگرایی آهسته منجر شود، در حالی که یک بزرگ می تواند حداقل را به حداکثر برساند.