Veri dengesizliği, bir veri kümesindeki sınıfların dağılımının eşitsiz olduğu ortaya çıkar. Bu, denetimli öğrenme modellerinin performansını önemli ölçüde etkileyebilir ve azınlık sınıflar için doğruluk azaltılır.

Data Imbalance

Birçok gerçek dünya senaryolarında, bazı sınıflar diğerlerinden daha yaygındır. Örneğin, dolandırıcılık tespitinde, sahte işlemler meşru olanlara kıyasla nadirdir. Bu dengesizlik, azınlık sınıfından vazgeçerek modellere neden olabilir.

Etkisi Ölçün

Veri dengesizliğinin bir modele nasıl etkileyebileceğini değerlendirmek için, birkaç ölçüm kullanılabilir:

  • [FONT:0) Adaylık:[Dönetici:[Dönetici:0)[Dönetici:[Dönetici:0)[[Dönetici:[Dönetici: · 1)) Bu, her zaman çoğunluk sınıfını tahmin ederek elde edilebilir.
  • [FONT:0)Öyleçme ve Recall:) Modelin pozitif vakaları tanımlama yeteneğini sağlar.
  • [FONT:0]F1 Puan:[[Dönetici: 1 ) Hassasiyetle birleştirir ve dengeli bir ölçü vermeyi unutmayın.
  • [FONT:0]ROC-AUC:[Dönler:[Dönler:[Dönler: 1 ) Modelin eşleri arasındaki sınıfları ayırt etme yeteneği.

Etkisi Hesaplamak

Veri dengesizliğinin etkisini ölçmek için bir yaklaşım, dengesiz veri setlerine karşı dengeli modelleme performansı karşılaştırmaktır. Teknikler şunları içerir:

  • Aşırı veya altlar gibi yeniden toplanma yöntemleri uygulayın.
  • SMOTE gibi sentetik veri nesli kullanmak.
  • Daha önce ve dengeleme teknikleri sonrasında ölçümler yapmak.
  • Hassasiyetteki değişiklikleri analiz edin ve F1 puan.

Bu ölçümleri ölçerek, uygulayıcılar, hangi dengesizliğin model tahminlerini ölçebilir ve uygun mitigation stratejileri belirleyebilirler.