그라디언트 밴싱 및 폭발은 교육 심 신경 네트워크에 공통적인 문제입니다. 그들은 학습 과정에 영향을 미치는 백 프로판트에서 너무 작거나 너무 크거나 너무 크게 될 때 발생합니다. 이러한 페니메나를 이해하는 것은 체중 업데이트와 잠재적 인 솔루션을 탐구하는 계산을 분석하는 것입니다.

그라디언트 밴싱

Gradient vanishing는 그 자체가 층을 통해 전파 된 백워드로 폭발적으로 감소 할 때 발생합니다. 이 결과는 매우 작은 무게 업데이트에서 네트워크가 천천히 배우고 altogether를 멈출 때 발생합니다.

Mathematically, 활성화 함수의 유래물이 1 이하인 경우에, 층 l]에 gradient는 다음과 같이 표현될 수 있습니다:

∂L/∂wl]]=(∂L/∂a]l) * (∂a]l/∂zl) * (∂zLT]l[FLT:][FLT:]]]]]]]

여기서 ∂al]/∂zl]는 활성화 함수의 유래물입니다. 이 유래물이 1 미만인 경우, 반복된 다중화는 그라디언트를 유발하는 그라디언트를 유발합니다.

Gradient 폭발

중력 폭발은 낙관자가 배부 중 폭발적으로 성장할 때 발생합니다. 이것은 훈련에서 불안정성과 다양성을 일으킬 수있는 매우 큰 무게 업데이트로 이어집니다.

수학적으로, 유래물이 1보다 더 큰 경우, 그리스는 exponentially 증가 할 수 있습니다 :

∂L/∂wl] ≈ (∂L/∂al+1) * (∂a]]l+1]]/∂zl+1]) * (∂z[FLT]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]

밴싱 및 폭발 Gradients에 대한 솔루션

몇몇 기술은 이 문제점을 완화할 수 있습니다:

  • 무장 초기화:Xavier나 He 초기화 같은 방법을 사용하여 안정적인 윤활제를 유지합니다.
  • Activation Functions: ReLU와 그 변형은 멸종 gradients의 위험을 감소시킵니다.
  • Gradient Clipping: gradients의 최대값을 제한하는 것은 폭발을 방지합니다.
  • 정상화: 정상적인화는 학습 과정을 안정화시킵니다.