Syvä neuroverkko voi kohdata haasteita koulutuksen aikana, erityisesti katoavan liukuväriongelman kanssa. Tämä ongelma syntyy, kun kaltevuudet tulevat hyvin pieniksi, mikä haittaa verkoston kykyä oppia tehokkaasti.

Kadonneen asteriskiongelman ymmärtäminen

Katoamisongelma vaikuttaa pääasiassa syvään verkkoon, jossa on monia kerroksia. Takaispropagaation aikana liukuvärit siirtyvät taaksepäin verkon läpi. Jos kaltevuudet vähenevät eksponentiaalisesti, aikaisemmat kerrokset oppivat hyvin hitaasti tai lopettavat oppimisen kokonaan. Tämä rajoittaa verkon kykyä mallintaa monimutkaisia toimintoja.

Asian käsittelyn muuttamistekniikat

Useilla menetelmillä voidaan vähentää katoavien kaltevuuksien vaikutusta:

  • Aktivointitoiminnot:[ Käyttämällä RELUn (Rektifioitu Linear Unit) kaltaisia toimintoja sigmoidin tai tanhin sijaan auttaa ylläpitämään vahvempia kaltevuuksia.
  • Painovalmistelu:[ Kunnolliset alustusmenetelmät, kuten Xavier tai He-alustaminen, estävät liukuvärien kutistumisen tai räjähtämisen aluksi.
  • Batch normalisointi:[ Normalisointikerros syötteet vakauttaa oppimista ja ylläpitää terveen liukuvärin virtaus.
  • Skip Connections:[ Arkkitehtuurit kuten ResNet ottaa käyttöön pikanäppäimiä, joiden avulla liukuvärit ohittavat tietyt kerrokset.
  • Valoluku:[]Koulutuksen aikana gradienttien koon rajoittaminen estää niiden liian pienenemisen tai liian suurentumisen.

Laskelmat ja matemaattiset näkymät

Takalisäyksen aikana gradientti kerroksessa l voidaan ilmaista seuraavasti:

]∂L/∂w][[ = ∂L/∂a]][[ × ∂a[]][[[]]]][[[]][[[]]]]

jossa L on tappio w[]l[[] ovat painoja ja []a[[]][[[]]] ovat aktivointeja. Ketjusääntö moninkertaistaa johdannaisia kerrosten välillä, mikä voi johtaa eksponentiaaliseen hajoamiseen, jos johdannaiset ovat vähemmän kuin yksi.

Aktivointitoiminnoissa, kuten sigmoidissa, johdannainen on:

]σ'(x) = σ(x) × (1 - σ(x)) []

Koska σ(x) vaihtelee 0 ja 1, johdannainen voi olla hyvin pieni, erityisesti suurille .x...x.. ...ja se voi osaltaan edistää katoavan kaltevuusongelman syntymistä.