Table of Contents
عدم تعادل داده ها زمانی رخ می دهد که توزیع کلاس ها در مجموعه داده ها نامشروط باشد، این می تواند به طور قابل توجهی بر عملکرد مدل های یادگیری نظارت شده تأثیر بگذارد، که منجر به پیش بینی های پیش بینی شده و کاهش دقت برای کلاس های اقلیت می شود.
درک تعادل داده ها Im Balance
در بسیاری از سناریوهای دنیای واقعی، برخی از کلاس ها از دیگران رایج تر هستند، به عنوان مثال، در تشخیص تقلب، معاملات جعلی در مقایسه با موارد قانونی نادر است.این عدم تعادل می تواند مدل هایی برای نفع کلاس اکثریت ایجاد کند، نادیده گرفتن طبقه اقلیت.
اندازه گیری تاثیر
برای ارزیابی اینکه چگونه عدم تعادل داده بر یک مدل تاثیر می گذارد، می توان از چندین معیار استفاده کرد:
- خطر: ممکن است گمراه کننده در مجموعه داده های عدم تعادل، به عنوان دقت بالا می تواند با همیشه پیش بینی طبقه اکثریت به دست آورد.
- تصمیم گیری و یادآوری: [FLT 1] ارائه بینش در مورد توانایی مدل برای شناسایی موارد مثبت.
- [در این میان] [و] [از این رو] امتیاز [FLT1] را به کار می گیرد و به یاد می آورد که به اندازه ای متعادل و متعادل دست یابد.
- [[۱] [۱۰]- ⁇ ] [۱۰] [۱۰] [۱۰] [۱]] [۱۰] [۱]] توانایی مدل برای تشخیص بین طبقات در آستانه ها را اندازه گیری می کند.
محاسبه تاثیر
یک رویکرد برای تعیین تاثیر عدم تعادل داده ها، مقایسه عملکرد مدل بر مجموعه داده های متعادل در مقابل عدم تعادل است.
- استفاده از روش های اصلاح مانند Oversampling یا زیرمجموعه
- استفاده از نسل داده های مصنوعی مانند SMOTE
- ارزیابی معیارهای قبل و بعد از تکنیک های تعادل
- تجزیه و تحلیل تغییرات در دقت، یادآوری و نمره F1
با اندازه گیری این معیارها، تمرین کنندگان می توانند ارزیابی کنند که عدم تعادل چقدر بر پیش بینی های مدل تاثیر می گذارد و استراتژی های کاهش مناسب را تعیین می کند.