Dataset yang tidak seimbang adalah hal umum dalam banyak aplikasi dunia nyata, seperti deteksi penipuan, diagnosis medis, dan deteksi anomali. Mengalamatkan ketidakseimbangan sangat penting untuk membangun model pembelajaran mesin yang efektif. Artikel ini mengeksplorasi teknik praktis yang didukung oleh prinsip matematika untuk menangani data yang tidak seimbang secara efektif.

Keseimbangan Data Memahami Kesamaan Data

Ketidakseimbangan data tools terjadi ketika jumlah instansi dalam satu kelas secara signifikan melebihi yang lain. Ketidakseimbangan ini dapat bias model terhadap kelas mayoritas, mengurangi kemampuan mereka untuk mendeteksi kejadian kelas minoritas. Secara matematis, jika N adalah jumlah total sampel dan Nminority]] adalah jumlah sampel golongan minoritas, rasio imbalance adalah N] = N]]]]].

Teknik untuk Mengendalikan Ketidakseimbangan

Beberapa teknik dapat mengmitigasi efek ketidakseimbangan data. Metode-metode ini dapat dikategorikan secara luas ke dalam pendekatan tingkat data dan tingkat algoritma.

Metode Aras-Data

  • ¡OblastOfLT:0]]Oversampel: Meningkatnya sampel kelas minoritas, sering kali menggunakan metode seperti SMOTE, yang menghasilkan titik data sintetis berdasarkan sampel minoritas yang ada.
  • OCLC Undersampelling: Menuding sampel kelas mayoritas untuk menyeimbangkan dataset, yang dapat berisiko kehilangan informasi berharga.
  • [[ZOBILT:0]]Hybrid pendekatan: Menggabungkan oversampel dan undersampling untuk mengoptimalkan keseimbangan data.

Metode Algoritma-Aras

  • [[Cest-sensitive learning: Tugaskan biaya misclassification yang lebih tinggi untuk kesalahan kelas minoritas untuk mempengaruhi fokus model.
  • Metode-metode ELSEmble: Menggunakan teknik seperti mendorong untuk meningkatkan deteksi kelas minoritas.
  • Menadilkan ambang keputusan: Mengubah kemungkinan dipotong untuk mendukung prediksi kelas minoritas.

Yayasan Matematika Mathematik

Misalnya, SMOTE menciptakan sampel sintetis dengan melakukan interpolasi antara titik kelas minoritas:

tool new = xi + lambda (x]j] - x]i]]

Tempat asal kota-kota di mana kota-kota kota-kota di luar kota di luar kota dan kota-kota di luar kota di luar kota di luar kota, ]]xj][] adalah sampel kelas minoritas, dan lambda adalah nomor acak antara 0 dan 1. Pendekatan ini memastikan data sintetik berada di dalam ruang fitur kelas minoritas, mempertahankan integritas data distribusi.