Table of Contents
عادی سازی داده ها و مقیاس پذیری گام های پیش پردازش ضروری در یادگیری ماشین هستند، آنها به بهبود عملکرد مدل با اطمینان از اینکه ویژگی ها به همان اندازه به فرآیند یادگیری کمک می کنند، کمک می کنند.
درک عادی سازی داده ها و مقیاس سازی
عادی سازی داده ها داده ها را به مقیاس مشترک بدون تحریف تفاوت در محدوده ارزش ها تنظیم می کند. مقیاسینگ معمولا شامل تبدیل ویژگی ها به تناسب در یک محدوده خاص یا توزیع است. هر دو تکنیک با هدف ایجاد ویژگی های قابل مقایسه و بهبود بهره وری الگوریتم ها.
تکنیک های مشترک
- مقیاسی با سرعت: [FLT 1] ویژگی های ثابت را به محدوده ثابت تبدیل می کند، معمولا 0 تا 1
- استاندارد سازی: داده های مربوط به این معنی است که با انحراف استاندارد 1
- [[۱] [۱۰] [۱] [۱۰] [۱] [۱۰]] [۱]] [۱۰] [۱]] [۱۰] [۱]] [۱۰] [۱] [۱] [۱۰] [۱]] از [برجبران و [بران] [بران] استفاده می کند، که با استفاده از [برداران] مؤثر است.
بهترین تمرین ها
به طور معمول سازی و مقیاس پذیری را پس از تقسیم داده ها به آموزش و آزمایش برای جلوگیری از نشت داده اعمال کنید.برای مثال، مدل های مبتنی بر درخت اغلب به مقیاس پذیری نیاز ندارند، در حالی که الگوریتم هایی مانند SVM و k-NN به طور قابل توجهی از آن بهره مند می شوند.