Fundamentos matemáticos de aprendizagem supervisionada: derivando funções de perda e graduações
A aprendizagem supervisionada é uma área central de aprendizagem de máquina que envolve modelos de treinamento usando dados rotulados. Compreender as fundações matemáticas ajuda a projetar algoritmos eficazes derivando funções de perda e seus gradientes, que orientam o processo de otimização.
Funções de perda em aprendizagem supervisionada
As funções de perda medem a discrepância entre as saídas previstas de um modelo e as etiquetas reais. Elas são essenciais para o treinamento de modelos, fornecendo um valor escalar que indica o desempenho do modelo.
As funções comuns de perda incluem Erro Médio Quadrado (EME) para tarefas de regressão e Perda de Entropia Cruzada para tarefas de classificação. A escolha da função de perda influencia o processo de aprendizagem e o comportamento de convergência.
Derivando Gradientes de Funções de Perda
Os gradientes são derivados da função perda em relação aos parâmetros do modelo, indicando a direção e magnitude dos ajustes necessários para minimizar a perda durante o treinamento.
Por exemplo, o gradiente de MSE em relação a uma predição (hat{y}) é (2(hat{y} - y)), onde (y) é o rótulo verdadeiro. Esta derivada guia a regra de atualização em algoritmos de descida gradiente.
Otimização com Gradientes
Algoritmos de descida gradual atualizam iterativamente os parâmetros do modelo movendo-se na direção oposta ao gradiente. Este processo minimiza a função de perda, melhorando a precisão do modelo ao longo do tempo.
- Calcular a perda para as previsões atuais.
- Calcular o gradiente da perda em relação aos parâmetros.
- Atualizar parâmetros subtraindo um gradiente escalado.
- Repita até que os critérios de convergência ou de paragem sejam cumpridos.