选择适当的步径或学习率对于有效培训深层神经网络至关重要,它影响模型的聚合速度和影响培训过程的稳定性,这一条为在深层学习模型中计算梯度下降的步径提供了实用的方法。

理解渐渐的世系

渐变降度是一种优化算法,通过迭代更新模型的权重来将损失函数最小化。步数大小决定了这些更新的大小。一个太大的步数会导致过度射击,而一个很小的步数可能导致缓慢的趋同。

计算步数大小

一个实用的方法涉及使用损失函数梯度的Lipschitz常数。如果该常数(表示为L)是已知的或估计的,则步数可设定为1/L。 这保证了训练期间的稳定趋同。

在L未知的情况下,一个常见的方法是进行行搜索或使用诸如学习速率表等高压方法,这些技术根据培训进度调整步数大小.

实用提示

  • 以小学习率为起点,逐步提高学习率.
  • 监测损失功能,以检测差异或缓慢的趋同.
  • 使用亚当或RMSprop等适应性优化器自动调整步号大小.
  • 应用学习率衰减来完善培训,随着培训的进展.