적절한 단계 크기를 선택하거나 학습 속도는 교육 심층적 네트워크에 필수적입니다. 그것은 신속하게 모델의 융합과 훈련 프로세스의 안정성을 영향을 미치는 영향에 영향을 미칩니다. 이 문서는 깊은 학습 모델에서 기온이 높은 단계 크기를 계산하는 실질적인 접근 방식을 제공합니다.

중력 Descent

Gradient descent는 모델의 무게를 크게 업데이 트함으로써 손실 기능을 최소화하기 위해 사용되는 최적화 알고리즘입니다. 단계 크기는 이러한 업데이트의 규모를 결정합니다. 너무 큰 단계 크기는 지나치게 발생할 수 있으며 매우 작은 것을 줄일 수 있습니다.

단계 크기를 계산

1개의 실제적인 방법은 손실 기능의 기온변화도의 Lipschitz 일정한을 사용하여 포함합니다. L로 이 일정한 경우에, 결정되거나 추정된, 단계 크기는 1/L로 놓일 수 있습니다. 이것은 훈련 도중 안정되어 있는 융해를 지킵니다.

L이 알 수없는 경우, 일반적인 접근법은 학습 속도 일정과 같은 선 검색 또는 사용의 치열한 방법을 수행하기 때문입니다. 이 기술은 훈련 진행 상황을 기반으로 단계 크기를 적응시킵니다.

연습 팁

  • 작은 학습률을 시작으로 점차 증가합니다.
  • 다이브레전스 또는 느린 융합을 감지하는 손실 기능을 모니터링합니다.
  • 단계 크기를 자동으로 조정하는 Adam 또는 RMSprop과 같은 적응 최적화를 사용합니다.
  • 학습률을 적용하면 진행되는 것과 같이 훈련을 하게 됩니다.