El desequilibrio de clase se produce cuando ciertas clases en un conjunto de datos están muy insuficientemente representadas en comparación con otras. Este desequilibrio puede dar lugar a un rendimiento deficiente de los modelos, especialmente en tareas como la clasificación en que las clases minoritarias son críticas.

Técnicas comunes para abordar el equilibrio de clase

Se utilizan varios métodos para mitigar el desequilibrio de clase en las redes neuronales. Estas técnicas se pueden aplicar individualmente o combinar para obtener mejores resultados.

Métodos de datos

Los enfoques de nivel de datos modifican el conjunto de datos para equilibrar la distribución de clases, entre ellos:

  • Oversampling: Aumentar el número de muestras de clase minoritaria, a menudo mediante la duplicación o la generación de datos sintéticos.
  • Undersampling: Reducir el número de muestras de clase mayoritaria para que coincidan con las clases minoritarias.
  • SMOTE:] La Técnica de Sobre-ampulación de Minoritarias sintéticas crea nuevos ejemplos sintéticos para las clases minoritarias.

Técnicas Algoritm-Level

Estos métodos modifican el algoritmo de aprendizaje para manejar mejor los datos desbalanzados. Ejemplos incluyen:

  • Aprendizaje sensible al consumidor: Asigna costos de clasificación errónea más altos a las clases minoritarias.
  • Pérdida de la energía: Se centra en la formación en ejemplos difíciles de clasificar, reduciendo el impacto de los negativos fáciles.

Ejemplos de datos reales-mundiales

En el diagnóstico médico, los conjuntos de datos suelen contener menos casos positivos. Aplicar sobresampling o SMOTE puede mejorar la sensibilidad de los modelos. En la detección del fraude, donde las transacciones fraudulentas son raras y sensibles a los costos el aprendizaje ayuda al modelo a priorizar la identificación de estos casos de manera efectiva.