Imbalanced verileri makine öğreniminde yaygın bir meydan okumadır, bir sınıf önemli ölçüde diğerlerini saymaktadır. Bu dengesizlik azınlık sınıflarda kötü performans gösteren önyargılı modellere yol açabilir. Etkili teknikler uygulama adilliği ve doğruluğu geliştirmeye yardımcı olabilir.

Data Imbalance

Veri dengesizliği, bir veri kümesindeki sınıfların dağılımının eşitsiz olduğu ortaya çıkar. Örneğin, dolandırıcılık tespitinde, gerçek işlemler büyük ölçüde hileli olanları ortaya çıkarabilir. Bu dengesizlik, azınlık sınıf örneklerini tespit etme yeteneklerini azaltabilir.

Adres Imbalance

Çeşitli yöntemler veri dengesizliğini azaltmak için kullanılabilir:

  • [FONT:0)Resampling:[Dönetici:[Dönetici:0) Elde edilen azınlık sınıfları veya alt sınıflar çoğunluk sınıfları tarafından veri kümesini ayarlayın.
  • [FONT=0)Syn Data Generation:[Dönetici:[Dönetici:0) SMOTE gibi algoritmaları azınlık sınıflarının sentetik örneklerini oluşturmak için kullanır.
  • [FONT:0)Algorithmic Approaches:), Ensemble yöntemleri gibi dengesizliğe doğal olarak sağlam olan iş modelleri.
  • [FONT=0)Cost-sensitive Learning:[Dönetici:[Dönetici:[Dönetici: 1))Eğitim sırasında azınlık sınıflarına daha yüksek yanlış sınıflaştırma maliyetleri imzalarken.

Fairness geliştirmek için hesaplamalar

Hassasiyet, Recall ve F1-Score gibi değerler, dengesiz veriler üzerinde modelleme performansı değerlendirmenize yardımcı olur. G-mean ve AUC-ROC, hassasiyet ve spesifikite arasındaki dengeye ilişkin öngörüler sağlar.Bu hesaplamalar, adilliği artırmak için kılavuz ayarlamalar sağlar.

Örneğin, F1-Score hesaplandı:

[0]F1 = 2 * (Örnek * Recall) / (Precision + Recall)).

Bu ölçümleri optimize etmek, modelin tüm sınıflarda iyi performans göstermesini, adilliği ve güvenilirliğini teşvik etmesini sağlar.