Table of Contents
انتخاب ویژگی یک فرایند است که در یادگیری ماشین برای شناسایی مناسب ترین متغیرهای برای آموزش مدل استفاده می شود.این به بهبود عملکرد مدل، کاهش بیش از حد و کاهش هزینه های محاسباتی کمک می کند.این مقاله در مورد تکنیک های مشترک بحث می کند و نمونه های عملی برای نشان دادن برنامه خود فراهم می کند.
روش های فیلتر
روش های فیلتر ارتباط ویژگی های مبتنی بر اقدامات آماری را ارزیابی می کنند، آنها سریع و مناسب برای داده های بالا بعدی هستند. تکنیک های مشترک شامل ضریب همبستگی، تست های مربعی چی و اطلاعات متقابل است.
به عنوان مثال، با استفاده از همبستگی، ویژگی های با همبستگی بالا با متغیر هدف انتخاب می شوند، در حالی که کسانی که دارای همبستگی پایین هستند، این روش ساده است، اما ممکن است از تعاملات بین ویژگی ها غافل شوند.
روش های Addper
روش های اسکر، زیرمجموعه های ویژگی ها را با آموزش یک مدل ارزیابی می کنند و ترکیبی را انتخاب می کنند که بهترین عملکرد را به دست می آورد، دقیق تر اما فشرده تر هستند.
تکنیک ها شامل حذف ویژگی های بازگشتی (RFE) و انتخاب رو به جلو یا عقب مانده است.به عنوان مثال RFE بارها یک مدل را آموزش می دهد، حداقل ویژگی های مهم را حذف می کند و زیرمجموعه را تا زمانی که عملکرد بهینه به دست آید، اصلاح می کند.
روش های جاسازی شده
روش های جاسازی شده انتخاب ویژگی در طول فرآیند آموزش مدل را انجام می دهند.آنها تکنیک های منظم سازی را که ویژگی های مهم کمتری را مجازات می کنند، ترکیب می کنند.
مثال ها شامل Lasso (L1 مرتب سازی) و الگوریتم های مبتنی بر درخت مانند جنگل های تصادفی است که امتیاز های مهمی را ارائه می دهند.این روش ها دقت و کارایی را متعادل می کنند.
مثال عملی
فرض کنید مجموعه ای با ویژگی های متعدد پیش بینی قیمت خانه دارید.با استفاده از یک روش فیلتر، شما ممکن است ویژگی هایی را با بالاترین همبستگی قیمت انتخاب کنید، سپس RFE را برای اصلاح زیرمجموعه با یک روش بسته بندی استفاده کنید.در نهایت، یک مدل با امتیازات مهم جاسازی شده برای نهایی کردن انتخاب.