Dispariţia şi explozia gradientului sunt probleme comune în formarea reţelelor neurale profunde. Ele apar atunci când gradientele devin prea mici sau prea mari în timpul propunerii de spate, afectând procesul de învăţare. Înţelegerea acestor fenomene implică analiza calculelor din spatele actualizărilor de greutate şi explorarea soluţiilor potenţiale.

Dispărut în gradient

Dispararea gradient se întâmplă atunci când gradients scade exponențial ca acestea sunt propagate înapoi prin straturi. Acest lucru duce la actualizări foarte mici de greutate, ceea ce face rețeaua să învețe foarte lent sau opri învățarea cu totul.

În mod matematic, dacă derivatul funcției de activare este mai mic de 1, gradientul la nivel de strat l poate fi exprimat ca:

]

unde

Gradient Exploding

Gradient explodează atunci când gradient cresc exponențial în timpul retropropagare. Acest lucru duce la actualizări foarte mari de greutate, care pot provoca instabilitate și divergențe în formare.

Matematic, dacă derivaţii implicaţi sunt mai mari de 1, gradienţii pot creşte exponenţial:

]

Soluţii pentru dispariţia şi explorarea Gradientilor

Mai multe tehnici pot atenua aceste probleme:

  • Inalizarea înălțimii: Folosirea metodelor precum Xavier sau El inițializarea ajută la menținerea gradientilor stabili.
  • Funcții de activare: ReLU și variantele sale reduc riscul de dispariție a gradientilor.
  • Limitarea valorii maxime a gradientului previne explozia.
  • Normalizarea lotului stabilizează procesul de învăţare.