Pistácios comuns na aprendizagem supervisionada e como endereçá - los com cálculos

A aprendizagem supervisionada é uma abordagem de aprendizagem de máquina amplamente utilizada que envolve modelos de treinamento em dados rotulados. No entanto, os profissionais muitas vezes encontram armadilhas comuns que podem afetar o desempenho e confiabilidade de seus modelos. Compreender essas questões e aplicar cálculos apropriados podem ajudar a atenuar o seu impacto.

Superfitting e Underfitting

O ajuste excessivo ocorre quando um modelo aprende os dados de treinamento muito bem, incluindo o ruído, levando a uma má generalização de novos dados. O ajuste inadequado acontece quando o modelo é muito simples para capturar padrões subjacentes. Cálculos como as taxas de erro de treinamento e validação podem ajudar a identificar esses problemas.

Por exemplo, comparar o erro de treino (E)trein) e erro de validação (Eval[) pode indicar sobreposição se Etrein é muito baixo enquanto Eval[[ é alto. Por outro lado, erros elevados em ambos sugerem subconfiguração.

Desbalanceamento de Classe

O desequilíbrio de classes ocorre quando algumas classes estão sub-representadas no conjunto de dados, levando a modelos tendenciosos. Calcular percentuais de distribuição de classes ajuda a identificar desequilíbrio.

Suponha que o conjunto de dados tenha 1000 amostras, com 900 pertencentes à classe A e 100 à classe B. As percentagens de distribuição da classe são:

Classe A: (90/1000) * 100 = 90%

Classe B: (100/1000) * 100 = 10%

Avaliação do desempenho do modelo

Métricas como precisão, precisão, memória e pontuação F1 são essenciais para avaliar o desempenho do modelo. Cálculos envolvem componentes de matriz de confusão:

Por exemplo, a precisão é calculada como:

Precisão = TP / (TP + FP)

Manuseando dados ruidosos

Os dados ruidosos podem distorcer o treinamento do modelo. Cálculos como a relação ruído-sinal ajudam a quantificar a qualidade dos dados.

Suponha que o conjunto de dados contenha 100 amostras ruidosas de 1000 amostras totais. A relação de ruído é:

Razão de ruído = (Número de amostras ruidosas) / (Total de amostras) = 100 / 1000 = 0,1 ou 10%