O desequilíbrio de classes ocorre quando certas classes em um conjunto de dados estão significativamente sub-representadas em comparação com outras, o que pode levar ao baixo desempenho do modelo, especialmente em tarefas como a classificação em que classes minoritárias são críticas.

Técnicas comuns para resolver o desequilíbrio de classes

Vários métodos são usados para mitigar o desequilíbrio de classes em redes neurais, que podem ser aplicadas individualmente ou combinadas para melhores resultados.

Métodos de Nível de Dados

As abordagens de nível de dados modificam o conjunto de dados para equilibrar a distribuição de classes. Estas incluem:

  • Excedente: Aumentar o número de amostras de classe minoritária, muitas vezes através de duplicação ou geração de dados sintéticos.
  • Subsampling: Reduzindo o número de amostras de classe majoritária para corresponder às classes minoritárias.
  • SMOTE: Técnica de sobre-amostragem de minoridade sintética cria novos exemplos sintéticos para classes minoritárias.

Técnicas de Nível de Algoritmo

Estes métodos modificam o algoritmo de aprendizagem para melhor lidar com dados desequilibrados. Exemplos incluem:

  • Aprendização sensível à causa:Atribui custos de classificação incorreta mais elevados às classes minoritárias.
  • Perda focal: Foca o treinamento em exemplos difíceis de classificar, reduzindo o impacto de negativos fáceis.

Exemplos de dados do mundo real

No diagnóstico médico, os conjuntos de dados frequentemente contêm menos casos positivos. Aplicar sobreamostragem ou SMOTE pode melhorar a sensibilidade do modelo. Na detecção de fraudes, onde transações fraudulentas são raras, o aprendizado sensível aos custos ajuda o modelo a priorizar a identificação desses casos efetivamente.