Ketidakseimbangan data terjadi ketika distribusi kelas dalam suatu dataset tidak merata. Hal ini dapat secara signifikan mempengaruhi kinerja model pembelajaran yang diawasi, mengarah pada prediksi yang bias dan mengurangi akurasi untuk kelas minoritas.

Keseimbangan Data Memahami Kesamaan Data

Sebagai contoh, dalam deteksi penipuan, transaksi penipuan jarang terjadi dibandingkan dengan yang sah ketidakseimbangan ini dapat menyebabkan model mendukung kelas mayoritas, mengabaikan kelas minoritas.

Mengukur Dampaknya

Untuk mengevaluasi bagaimana ketidakseimbangan data mempengaruhi suatu model, beberapa metrik dapat digunakan:

  • [[GOGALT:0]]Akcurasi: Mungkin menyesatkan dalam dataset yang tidak seimbang, sebagai akurasi tinggi dapat dicapai dengan selalu memprediksi kelas mayoritas.
  • [[Efronth:0]]Precision and Recall: Menyediakan wawasan tentang kemampuan model untuk mengidentifikasi kasus positif.
  • [[EfleksifLT:0]]F1 Skor: Kombinasi presisi dan recall untuk memberikan ukuran yang seimbang.
  • [[Efleksif:0]]ROC-AUC: Mengukur kemampuan model untuk membedakan antara kelas melintasi ambang batas.

Mengira Dampaknya

Salah satu pendekatan untuk mengkuantifikasi dampak ketidakseimbangan data adalah membandingkan kinerja model pada kesetimbangan versus dataset yang tidak seimbang Teknik termasuk:

  • Metode - metode yang digunakan lagi untuk mengasamp atau mengasam.
  • Penjanaan data sintetis menggunakan nama seperti SMOTE.
  • Mengevaluasi metrik sebelum dan sesudah teknik menyeimbangkan.
  • Menganalisa perubahan presisi, recall, dan F1.

Dengan mengukur metrik ini, praktisi dapat menilai seberapa besar pengaruh ketidakseimbangan dari model prediksi dan menentukan strategi mitigasi yang sesuai.