La normalisation par lots est une technique utilisée dans l'apprentissage profond pour améliorer le processus de formation des réseaux neuronaux. Elle normalise les apports de chaque couche, ce qui aide à stabiliser et accélérer l'apprentissage. Cet article explore les calculs impliqués, les avantages qu'il offre, et comment déployer la normalisation par lots dans la pratique.

Calculs dans la normalisation par lots

Pendant l'entraînement, la normalisation par lots calcule la moyenne et la variance de chaque fonction dans le mini-lot actuel. La valeur normalisée est ensuite calculée en soustrayant la moyenne et en divisant par l'écart-type. La formule est :

Valeur normale:[ x= (x - μ) / √(ε2 + ε)

x est l'entrée, μ est la moyenne du lot, ε2 est la variance du lot, et ε est une petite constante pour empêcher la division de zéro.

Production: y = γ * x φ + β]

Avantages de la normalisation par lots

La normalisation par lots offre plusieurs avantages dans la formation des réseaux neuraux. Elle réduit le décalage interne, qui est le changement dans la distribution des activations de réseau. Cette stabilisation permet des taux d'apprentissage plus élevés et une convergence plus rapide.

D'autres avantages incluent une précision et une robustesse accrues du modèle, ainsi que la capacité d'utiliser des réseaux plus profonds sans souffrir de la disparition ou de l'explosion de gradients.

Déploiement pratique de la normalisation par lots

La normalisation par lots dans un réseau neuronal implique l'ajout d'une couche de normalisation par lots après chaque couche convolutionnelle ou entièrement connectée. Dans les cadres comme TensorFlow ou PyTorch, c'est simple avec des fonctions intégrées.

Pendant la formation, les couches de normalisation par lots mettent à jour leurs moyennes mobiles de moyenne et de variance.

Il est important de tenir compte de la taille des lots lors du déploiement de la normalisation des lots. Les tailles plus petites des lots peuvent conduire à des estimations moins stables de la moyenne et de la variance, ce qui peut affecter les performances du modèle.