Table of Contents
مهندسی ویژگی یک گام حیاتی در فرآیند یادگیری ماشین است که شامل ایجاد، تبدیل و انتخاب متغیرهای برای بهبود عملکرد مدل است. مهندسی ویژگی موثر می تواند به پیش بینی دقیق تر و بینش بهتر از داده ها منجر شود.این مقاله استراتژی های عملی برای بهبود مدل های خود را از طریق مهندسی ویژگی بررسی می کند.
درک مهندسی
مهندسی ویژگی شامل دستکاری داده های خام برای ایجاد ویژگی های معنی دار است که بهتر نشان دهنده مشکل اساسی است.این شامل تکنیک هایی مانند رمزگذاری متغیرهای کاتورical، مقیاس داده های عددی و ایجاد ویژگی های جدید از موارد موجود است.
استراتژی های عملی برای مهندسی
پیاده سازی استراتژی های موثر می تواند عملکرد مدل را به طور قابل توجهی بهبود بخشد.در زیر برخی از روش های مشترک است:
- ] و از دست دادن داده های از دست رفته: [FLT 1 ] پر از ارزش های از دست رفته با استفاده از معنی، رسانه ها و یا حالت، و یا حذف سوابق ناقص.
- متغیرهای کاتاگورتیک را رمزگذاری کنید: از یک رمزگذاری یا برچسب برای تبدیل دسته ها به فرمت عددی استفاده کنید.
- مقیاس سنجی (FLT 1) برای اطمینان از ویژگی ها در همان مقیاس، عادی سازی یا استاندارد سازی را اعمال کنید.
- ویژگی های تعامل باروری: [FLT 1] دو یا چند ویژگی را برای جذب روابط مانند ضرب و شتم یا اضافه کردن متغیرهای ترکیب کنید.
- کاهش ابعاد جانبی: [FLT 1] استفاده از تکنیک هایی مانند PCA برای کاهش تعداد ویژگی ها در هنگام حفظ اطلاعات مهم.
نمونه هایی از مهندسی
به عنوان مثال، در مدل پیش بینی قیمت مسکن، ایجاد یک ویژگی مانند "Age of property" با کم کردن سال ساخته شده از سال جاری می تواند اطلاعات ارزشمندی را به طور مشابه ارائه دهد، تبدیل ویژگی های تاریخ به روز هفته یا ماه می تواند الگوهای فصلی را آشکار کند.
در وظایف طبقه بندی، رمزگذاری متغیرهای کاتالیک مانند "رنگ" یا "نوع" به فرمت های عددی به الگوریتم ها کمک می کند تا داده ها را به طور موثر تفسیر کنند.