Table of Contents
Data yang tidak seimbang ini merupakan tantangan umum dalam pembelajaran mesin, di mana satu kelas secara signifikan melebihi jumlah yang lain. Ketidakseimbangan ini dapat menyebabkan model yang bias yang melakukan hal yang buruk pada kelas minoritas. Teknik belajar yang sensitif biaya mengatasi masalah ini dengan menetapkan biaya yang berbeda untuk misklasifikasi, membantu model fokus pada kelas minoritas.
Data Keseimbangan Pengertian Kesamaan
Dataset yang tidak seimbang terjadi di berbagai bidang seperti deteksi penipuan, diagnosis medis, dan penyaringan spam. Dalam kasus-kasus ini, golongan minoritas sering kali lebih penting tetapi kurang terwakili.Algoritma standar cenderung mendukung golongan mayoritas, sehingga berkurangnya recall untuk golongan minoritas.
Teknik Belajar Bersensitif Biaya
Pembelajaran sensitif biaya yang dilakukan oleh pihak-pihak terkait memodifikasi proses pembelajaran untuk memperhitungkan biaya misklasifikasi yang berbeda.Dengan memberikan biaya yang lebih tinggi untuk kesalahan pada kelas minoritas, model menjadi lebih sensitif terhadap kelas-kelas ini, meningkatkan kinerja secara keseluruhan.
Pendekatan Biasa
- [GALALT:0]]Algoritma yang diberatkan: Incorporate kelas berat ke dalam fungsi kehilangan untuk menalisasi misklasifikasi kelas minoritas yang lebih berat.
- Cost matricess: Definisikan matriks yang menyatakan biaya setiap jenis misclassification, membimbing model untuk meminimalkan total biaya.
- [EfronthFLT:0]]Persampelan teknik: Kombinasi metode sensitif-biaya dengan oversampel atau undersampling untuk menyeimbangkan dataset.