Table of Contents
渐变降度是一种优化算法,通过迭代向最低点移动来将函数最小化,在机器学习中被广泛使用,通过调整参数来减少错误来优化模型,本条解释了在机器学习任务中应用渐变降度所涉及的一步步计算.
理解渐渐的世系算法
梯度下降的核心思想是更新模型参数,使其向损失函数负梯度的方向发展。这一过程一直持续到参数汇聚到最低点,最好是全球最低点。
逐步计算过程
假设我们有一个带有损失函数的简单线性回归模型,例如 Mean Squared Error(MSE). 应用梯度归流的步骤如下:
- 初始化参数(如权重和偏差),并带有小随机值.
- 使用当前参数计算预测输出 。
- 根据预测和实际数据计算损失函数值。
- 计算每个参数的损失函数的梯度。
- 更新每个参数,方法是减去学习率和相应的梯度的产物.
这一过程重复了一组重复,或直到损失的变化变得微不足道。
示例计算
考虑一个输入x=2和输出y=4]. 初始化重量w=0.5]和偏差b=0. 使用0.1的学习率.
计算预测: = wx + b = 0.5 * 2 + 0 = 1 ]
计算错误: error = ⁇ - y = 1 - 4 = -3 ]
计算梯度 :
渐变w.r.t.重量: ⁇ L/ ⁇ w = 2 * 错误 * x = 2 * (3) * 2 = -12 ]
渐变的 w.r.t 偏差: → L/ → = 2 * 错误= 2 * (3) = - 6 ]
更新参数 :
新重量: w=0.5 - 0.1 * (-12)=0.5+1.2=1.7
新偏差: b = 0 - 0.1 * (6) = 0 + 0.6 = 0.6 ]