O tratamento de conjuntos de dados desequilibrados é um desafio comum no aprendizado de máquina. Quando uma classe supera significativamente outras, os modelos podem se tornar tendenciosos, levando a um desempenho ruim em classes minoritárias.

Compreensão de conjuntos de dados desequilibrados

Um conjunto de dados desequilibrado ocorre quando a distribuição das classes é desigual. Por exemplo, na detecção de fraudes, as transações fraudulentas são raras em comparação com as legítimas. Reconhecer esse desequilíbrio é o primeiro passo para endereçá-lo de forma eficaz.

Técnicas de Nível de Dados

As técnicas de nível de dados modificam o conjunto de dados para equilibrar a distribuição de classes. Os métodos comuns incluem:

  • Excedente: Aumentar o número de amostras de classe minoritária, muitas vezes usando técnicas como o SMOTE.
  • Subsampling: Reduzindo as amostras da classe majoritária para corresponder ao tamanho da classe minoritária.
  • Aumento de dados: Criando novas amostras sintéticas para melhorar a representação de classe minoritária.

Estratégias de Nível de Algoritmo

Ajustar o algoritmo de aprendizagem também pode resolver o desequilíbrio de classes. As técnicas incluem:

  • Aprendizagem sensível ao custo:Atribuir custos de classificação incorreta mais elevados a erros de classe minoritários.
  • Ajustar os pesos da classe: Modificar a importância das aulas durante o treino do modelo.
  • Ensemble methods:] Combinando vários modelos para melhorar a detecção de classe minoritária.

Métricas de Avaliação

Usar métricas apropriadas é essencial para avaliar o desempenho do modelo em dados desequilibrados. As métricas comuns incluem:

  • Precisão: A proporção de verdadeiros positivos entre os positivos previstos.
  • Recorda: A proporção de positivos reais corretamente identificados.
  • F1 Pontuação: A média harmônica de precisão e de memória.
  • AUC-ROC:Mede a capacidade do modelo de distinguir entre classes.