Dataset yang tidak seimbang yang tidak seimbang adalah tantangan umum dalam pembelajaran mesin. ketika satu kelas secara signifikan melebihi jumlah lainnya, model mungkin menjadi bias, mengarah pada kinerja buruk pada kelas minoritas. menerapkan strategi praktis dapat meningkatkan keakuratan model dan keadilan.

Memahami Dataset yang Tidak Seimbang

Dataset yang tidak seimbang terjadi ketika distribusi kelas tidak merata. Misalnya, dalam deteksi penipuan, transaksi penipuan jarang terjadi dibandingkan dengan yang sah.

Teknik Teknik Teknik Teknik Teknik Teknik Teknik Data

Teknik tingkat-data oleaudon memodifikasi dataset untuk menyeimbangkan distribusi kelas. Metode umum meliputi:

  • ¡Efleksi Oversampling: Meningkatnya jumlah sampel kelas minoritas, sering kali menggunakan teknik seperti SMOTE.
  • OCLC Undersampelling: Menuding sampel kelas mayoritas untuk cocok dengan ukuran kelas minoritas.
  • [[LANCULT:0]]Data Augmentation:Membentuk sampel sintetik baru untuk meningkatkan representasi kelas minoritas.

Strategi Algoritma-Aras-Agoza

Mengatur algoritma pembelajaran juga dapat mengatasi ketidakseimbangan kelas.

  • [[LRT:0]]Cost-sensitive learning: Tugaskan biaya misclassification yang lebih tinggi kepada kesalahan kelas minoritas.
  • Menimbang berat kelas:] Modifikasi pentingnya kelas selama latihan model.
  • Metode-metode ansemble Ensemble: Menggabungkan model multiple untuk meningkatkan deteksi kelas minoritas.

Evaluasi Metrik Evaluasi

Menggunakan metrik yang sesuai sangat penting untuk mengevaluasi kinerja model pada data yang tidak seimbang.

  • [[GANAL:0]]Precision: Proporsi positif sejati di antara positif yang diprediksi.
  • [[GANDAFLT:0]]Recall: Proporsi dari positif aktual yang diidentifikasi dengan benar.
  • [[GANDAFLT:0]]F1 Skor: Kelarasan artian presisi dan recall.
  • [[Eflat:0]]AUC-ROC: Mengukur kemampuan model untuk membedakan antara kelas.