Table of Contents
딥 신경 네트워크는 특히 멸균성 문제와 함께 훈련 중에 도전을 직면 할 수 있습니다. 이 문제는 그리스가 매우 작을 때 발생하며 네트워크의 능력을 효과적으로 배우는 데 도움이됩니다. 다양한 기술은이 문제를 해결하고 훈련 과정을 개선하기 위해 개발되었습니다.
밴싱 Gradient 문제 이해
밴싱 기온 문제 주로 많은 레이어와 깊은 네트워크에 영향을 미칩니다. 백 프로피케이션 중 그리스는 네트워크를 통해 백워드를 배웠습니다. 그랜디엔트가 폭발적으로 감소하면 이전 레이어는 매우 천천히 배우고 altogether를 배우게 됩니다. 이 제한은 네트워크의 용량을 모델의 복잡한 기능으로 제한합니다.
문제의 시작을 위한 기술
몇몇 방법은 멸종 gradients의 충격을 감소시킬 수 있습니다:
- Activation Functions: sigmoid 또는 tanh 대신 ReLU (Rectified Linear Unit)와 같은 기능을 사용하여 더 강한 윤활제를 유지합니다.
- 무장 초기화:]Xavier 또는 He 초기화와 같은 Proper 초기화 방법, 초기화 또는 초기화에서 유자를 방지.
- Batch Normalization: Normalizing layer inputs는 학습을 안정화시키고 건강한 기온변화도를 유지한다.
- Skip Connections: ResNet과 같은 아키텍처는 특정 레이어를 우회할 수 있는 gradients를 허용하는 단축키를 소개합니다.
- Gradient Clipping: 훈련 중에 그리스의 크기를 제한하는 것은 너무 작거나 너무 큰 것에서 그들을 방지합니다.
계산 및 수학 통찰력
층 l]에서 그라디언트는 다음과 같이 표현할 수 있습니다:
∂L/∂wl]=∂L/∂al × ∂al]/∂wl]
여기서 L]는 손실, w]l]은 무게, a]]l]]는 활성화입니다. 체인 규칙은 레이어의 다공성 유래물이며, 이는 하나보다 더 적은 경우의 폭발을 할 수 있습니다.
sigmoid 같이 활성화 기능을 위해, 유래물은:
σ'(x) = σ(x) × (1 - σ(x))]
σ(x)는 0과 1 사이 범위이므로, 특히 큰 |x|, 밴싱 글래드런 문제로 기여할 수 있습니다.