Table of Contents
深神经网络在培训过程中可能面临挑战,特别是渐变问题。 当梯度变得非常小,阻碍了网络有效学习的能力时,就会出现这一问题。 已经开发了各种技术来解决这一问题,改进培训过程。
理解消失的渐进问题
渐变问题主要影响许多层的深层网络。 在反向传播过程中, 梯度通过网络向后传播。 如果梯度指数下降, 早期的层会慢慢学习, 或者完全停止学习。 这限制了网络模拟复杂函数的能力 。
减缓这一问题的技术
几种方法可以帮助减少渐变的影响:
- 激活函数: 使用ReLU(已校正的线性单位)等函数,而不是sigmoid或tanh帮助维持更强的梯度.
- 重量初始化: 适当的初始化方法,如Xavier或He初始化,防止梯度最初缩水或爆炸.
- 批量正常化: 规范层输入稳定学习,保持健康的梯度流.
- 斯基普连接:[ ResNet这样的架构引入了快捷键,允许梯度绕过某些层.
- 高阶剪接:[] 限制训练时的梯度大小,防止其变小或太大.
计算和数学透视
反向传播时的层 l 梯度可以表示为:
QQL/QXW l ]= QL/QQA ]l ]] ]l / ⁇ w ]l ]].
其中L是损失,wl]是权重,al]是激活. 链规则将衍生物跨层倍增,如果衍生物少于一个,则会导致指数衰减.
对于像sigmoid这样的激活函数,衍生词是:
/'(x)=/(x)x(1-(x))]
由于 \\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\