Table of Contents
داده های متعادل یک چالش رایج در یادگیری ماشین است، جایی که یک کلاس به طور قابل توجهی از دیگران تعداد می برد، این عدم تعادل می تواند منجر به مدل های بی طرفانه شود که در کلاس های اقلیت ضعیف عمل می کنند. پیاده سازی تکنیک های موثر می تواند به بهبود عدالت و دقت مدل کمک کند.
درک تعادل داده ها Im Balance
عدم تعادل داده ها زمانی رخ می دهد که توزیع کلاس ها در مجموعه داده ها نامشروط باشد، به عنوان مثال، در تشخیص تقلب، معاملات واقعی به طور گسترده ای تعداد کلاهبرداران را به خود اختصاص می دهد.این عدم تعادل می تواند مدل هایی برای نفع طبقه اکثریت ایجاد کند و توانایی آنها برای تشخیص نمونه های کلاس اقلیت را کاهش دهد.
تکنیک های آدرس Im Balance
چندین روش را می توان برای کاهش عدم تعادل داده ها استفاده کرد:
- Resampling: تنظیم داده ها توسط بیش از حد جمع آوری کلاس های اقلیت و یا کلاس های اکثریت کمتر.
- نسل داده های مصنوعی: از الگوریتم هایی مانند SMOTE برای ایجاد نمونه های مصنوعی از کلاس های اقلیت استفاده کنید.
- رویکردهای نسبی: مدل های کارفرمایان که به طور ذاتی قوی به عدم تعادل، مانند روش های گروهی هستند.
- یادگیری حساس به ارزش: [FLT 1] هزینه طبقه بندی نادرست بالاتر به کلاس های اقلیت در طول آموزش.
محاسبه برای بهبود منصفانه
متریک هایی مانند Precision، Recall و F1Score به ارزیابی عملکرد مدل در داده های عدم تعادل کمک می کنند. محاسبه G-mean و AUC-ROC بینش هایی در مورد تعادل بین حساسیت و خاص بودن را فراهم می کند.این تنظیمات راهنمای برای بهبود عدالت.
برای مثال، F1Score به عنوان:
[[ویرایش] [۱] [۱۰] = ۲ [۱] [پیش نویس] [۱] [۱] [۱] [۱] [۱] [۱] [۱۰] [۱] [۱۰] [۱] [۱۰] [۱] [۱۰] [۱] [۱۰] [۱] [۱] [۱] [۱] [۱] [۲] [۱] [۱] [۱] [۲] [۱] [۱] [۲] [۲] [۲] [۱] [۱] [۱] [۱] [۲] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۲] [۲] [۲] [۲] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۲] [۲] [۲] [۲] [۱] [۲] [۲] [۱] [۱] [۱]
بهینه سازی این معیارها تضمین می کند که مدل در تمام کلاس ها عملکرد خوبی دارد، ترویج عدالت و اطمینان.