Data yang tidak seimbang yang ditangani merupakan tantangan umum dalam pembelajaran mesin. terjadi ketika satu kelas secara signifikan mengungguli yang lain, mempengaruhi kinerja model prediksi. Menerapkan teknik yang sesuai dapat meningkatkan ketepatan model dan keandalan.

Data Keseimbangan Pengertian Kesamaan

Dataset yang tidak seimbang dicirikan oleh distribusi kelas yang tidak proporsional. Misalnya, dalam deteksi penipuan, transaksi yang benar-benar berlebihan melebihi jumlah yang kurang angka yang tidak seimbang ini dapat menyebabkan model mendukung kelas mayoritas, mengurangi deteksi dari contoh kelas minoritas.

Praktis Praktisi Teknik untuk Mengendalikan Ketidakseimbangan

Beberapa metode dapat mengatasi ketidakseimbangan data secara efektif:

  • Resampelling: Laras dataset oleh kelas minoritas oversampel atau kelas mayoritas undersampel.
  • Synthetic Data Generation: Gunakan teknik seperti SMOTE untuk membuat contoh buatan dari kelas minoritas.
  • [[CharfLT:0]]Algoritmik Pendekatan: Model karyawan yang secara inheren kuat untuk tidak seimbang, seperti metode ensemble.
  • [[Cest-sensitive Learning:Umpukkan biaya misclassification yang lebih tinggi ke kesalahan kelas minoritas.

Metrik Performance untuk Data yang Tidak Seimbang

Model pengevaluasan pada data yang tidak seimbang memerlukan metrik tertentu:

  • [[GANAL:0]]Precision: Proporsi prediksi positif sejati di antara semua prediksi positif.
  • [[GANDAFLT:0]]Recall: Proporsi dari positif aktual yang diidentifikasi dengan benar.
  • [[GANDAFLT:0]]F1 Skor: Kelarasan artian presisi dan recall.
  • [[EfleksifLT:0]]AUC-ROC: Mengukur kemampuan model untuk membedakan antara kelas melintasi ambang batas.