Table of Contents
Gradient katoaminen ja räjähtäminen ovat yleisiä kysymyksiä harjoittaessa syvän hermoston verkostoja. Ne tapahtuvat, kun kaltevuudet tulevat liian pieniksi tai liian suuri aikana backpropagation, vaikuttaa oppimisprosessiin. Ymmärtäminen nämä ilmiöt edellyttää analysoimalla laskelmia takana painopäivityksiä ja tutkimalla mahdollisia ratkaisuja.
Gradient- katoaminen
Gradient katoaa, kun gradientit vähenevät eksponentiaalisesti, kun ne siirtyvät taaksepäin kerrosten läpi. Tämä johtaa hyvin pieniin painopäivityksiin, mikä saa verkoston oppimaan hyvin hitaasti tai lopettamaan oppimisen kokonaan.
Matemaattisesti, jos aktivointitoiminnon johdannainen on pienempi kuin 1, kaltevuus kerroksen l voidaan ilmaista seuraavasti:
∂L/∂w][[] = (∂L/∂a[]]] * (∂a[]][[[[]]]][[[[]]]]]] * (∂z[[]][[]]]]
jossa ∂a]l/∂z[l[] on aktivointitoiminnon johdannainen. Jos tämä johdannainen on pienempi kuin 1, toistuva moninkertaistuminen vähentää gradienttia eksponentiaalisesti.
Gradient Exploding
Gradient räjähtää, kun gradientit kasvavat eksponentiaalisesti selkälisäyksen aikana. Tämä johtaa erittäin suuriin painopäivityksiin, jotka voivat aiheuttaa epävakautta ja eroja koulutuksessa.
Matematiikan, jos johdannaiset ovat suurempia kuin 1, kaltevuudet voivat kasvaa eksponentiaalisesti:
∂L/∂w][[ ... ..............................................................................................................................................................................................................................
Ratkaisut katoaviin ja räjähtäviin asteneihin
Näitä kysymyksiä voidaan lieventää useilla tekniikoilla:
- Painovalmistelu:[ Käyttämällä Xavierin tai Hänen alustusta auttaa säilyttämään vakaat kaltevuudet.
- Aktivointitoiminnot: [ ReLU ja sen muunnokset vähentävät riskiä katoamisesta.
- Valoluku Clipping:[] Rakenteiden enimmäisarvon rajoittaminen estää räjähdyksen.
- Normalisointi:[ Erä normalisoituminen vakauttaa oppimisprosessin.