پیش پردازش داده ها یک گام مهم در توسعه شبکه های عصبی موثر است که به درستی آماده شده اند، داده ها می توانند دقت مدل و کارایی آموزش را بهبود بخشند.این مقاله تکنیک های عملی مورد استفاده برای پردازش داده ها برای برنامه های یادگیری عمیق را تشریح می کند.

تمیز کردن داده ها

تمیز کردن داده ها شامل حذف یا اصلاح نقاط داده نادرست، متناقض یا ناقص است.این مرحله تضمین می کند که مدل از اطلاعات قابل اعتماد یاد می گیرد. تکنیک ها شامل کنترل مقادیر از دست رفته، حذف تکرارها و تصحیح خطا هستند.

عادی سازی و استاندارد سازی

عادی سازی داده ها را به یک محدوده خاص، اغلب [0، 1]، که در همگرایی سریع تر در طول آموزش کمک می کند، استاندارد سازی داده ها را به یک معنی صفر و انحراف استاندارد از یک تبدیل می کند. هر دو روش ثبات و عملکرد مدل را بهبود می بخشد.

مهندسی

ایجاد ویژگی های معنادار از داده های خام می تواند یادگیری مدل را افزایش دهد. تکنیک ها شامل متغیرهای کاتالیک رمزگذاری، استخراج تاریخ / ویژگی های زمان و ایجاد شرایط تعامل نیز باعث کاهش ابعاد و نویز می شود.

اطلاعات آگوست

تقویت داده ها به طور مصنوعی اندازه مجموعه داده های آموزشی را با استفاده از تحولات افزایش می دهد. روش های مشترک شامل رول، چرخش یا تصاویر محصول سازی و اضافه کردن سر و صدا به نقاط داده است.این تکنیک کمک می کند تا از بیش از حد و بهبود تعمیم جلوگیری کند.