Table of Contents
داده های متعادل یک چالش رایج در یادگیری ماشین است، جایی که یک کلاس به طور قابل توجهی از دیگران تعداد می برد، این عدم تعادل می تواند منجر به مدل های پیش فرض شود که به طور ضعیف بر روی کلاس های اقلیت عمل می کنند. تکنیک های یادگیری حساس به هزینه این مسئله را با اختصاص هزینه های مختلف به طبقه بندی های نادرست، کمک به مدل ها بر کلاس های اقلیت.
درک داده های متعادل
مجموعه داده های متعادل در زمینه های مختلف مانند تشخیص تقلب، تشخیص پزشکی و فیلترینگ اسپم رخ می دهد.در این موارد، کلاس اقلیت اغلب مهم تر است اما الگوریتم های استاندارد تمایل به نفع کلاس اکثریت دارند و منجر به یادآوری پایین برای کلاس اقلیت می شود.
تکنیک های یادگیری حساس به هزینه
یادگیری حساس به هزینه شامل تغییر فرآیند یادگیری برای در نظر گرفتن هزینه های طبقه بندی مختلف است.با اختصاص هزینه های بالاتر به خطا در کلاس های اقلیت، مدل ها نسبت به این کلاس ها حساس تر می شوند و عملکرد کلی را بهبود می بخشند.
رویکردهای مشترک
- الگوریتم های فشرده: وزن کلاس شرکت در تابع از دست دادن به مجازات طبقه بندی نادرست از کلاس های اقلیت به شدت.
- مردانگی: یک ماتریس تعیین هزینه هر نوع طبقه بندی اشتباه، هدایت مدل برای به حداقل رساندن کل هزینه.
- تکنیک های اندازه گیری: ترکیب روش های حساس به هزینه با بیش از حد و یا زیر ریز کردن برای تعادل داده ها.