Table of Contents
Gradient descent는 가장 낮은 지점으로 이동하여 기능을 최소화하기 위해 사용되는 최적화 알고리즘입니다. 그것은 매개 변수를 조정하여 모델을 최적화하여 오류를 줄일 수 있도록 널리 사용됩니다. 이 문서는 기계 학습 작업을 위해 기온이 높은 Descent 적용에 관련된 단계별 계산을 설명합니다.
Gradient Descent Algorithm에 대한 이해
gradient descent의 핵심 아이디어는 손실 기능의 부정적인 기온변화도의 방향으로 모델 매개 변수를 업데이트하는 것입니다. 이 과정은 최소한의 포인트에 집중할 때까지 계속됩니다. 이상적으로 글로벌 최소.
Step-by-Step 계산 과정
Suppose는 의미있는 Squared Error (MSE)와 같은 손실 기능이있는 간단한 선형 회귀 모델이 있습니다. gradient descent를 적용하기위한 단계는 다음과 같습니다.
- 매개변수를 초기화 (예:, 무게 및 바이아스) 작은 임의 값.
- 현재 매개 변수를 사용하여 예측된 출력을 계산합니다.
- 예측과 실제 데이터를 기반으로 손실 함수 값 계산.
- 각 매개 변수에 대한 손실 함수의 gradient를 계산합니다.
- 학습율과 대응적인 gradient의 제품을 빼서 각 매개변수를 업데이트하십시오.
이 프로세스는 반복의 세트 번호를 반복하거나 손실의 변화가 무시할 때까지.
예제 계산
입력 x = 2 과 출력 y = 4])를 가진 단일 데이터 포인트를 고려하십시오. 초기 무게 ]w = 0.5]]와 bias ]b = 0]. 0.1]의 학습 속도를 사용합니다.
계산 예측: 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4 1⁄4
Compute 오류: error = 1⁄4 - y = 1 - 4 = -3
그리스어를 계산:
Gradient w.r.t. 무게: ∂L/∂w = 2 * 오류 * x = 2 * (-3) * 2 = -12
Gradient w.r.t. bias: ∂L/∂b = 2 * 오류 = 2 * (-3) = -6
업데이트 매개 변수:
새로운 무게: w = 0.5 - 0.1 * (-12) = 0.5 + 1.2 = 1.7
새로운 바이어 : [[FLT :0]b = 0 - 0.1 * (-6) = 0 + 0.6 = 0.6[[FLT :1]]