Table of Contents
Gradient descent là một thuật toán tối ưu hóa được dùng để giảm thiểu một hàm bằng cách lặp đi lặp lại hướng tới điểm thấp nhất. Nó được sử dụng rộng rãi trong việc học tập tối ưu hóa mô hình máy bằng cách điều chỉnh tham số để giảm lỗi. Bài này giải thích các phép tính bước theo bước tham gia trong việc áp dụng gradient descent cho các công việc học tập máy.
Hiểu được thuật toán cấp cao
Ý tưởng cốt lõi của lớp và gốc là cập nhật các tham số mô hình theo hướng của các đổ dốc tiêu cực của hàm mất. quá trình này tiếp tục cho đến khi các tham số hội tụ đến một điểm tối thiểu, lý tưởng tối thiểu toàn cầu.
Tiến trình tính toán bậc hai
Giả sử chúng ta có một mô hình hồi quy tuyến tính đơn giản với một chức năng mất, như là có nghĩa là bình phương lỗi (MSE). Các bước để áp dụng gradient descent là như sau:
- Khởi tạo tham số (v. d., tạ và định kiến) với giá trị ngẫu nhiên nhỏ.
- Tính toán kết xuất đã dự đoán bằng các tham số hiện thời.
- Tính toán giá trị hàm mất dựa trên dự đoán và dữ liệu thực tế.
- Tính toán dốc của hàm mất với mỗi tham số.
- Cập nhật mỗi tham số bằng cách trừ đi sản phẩm của tốc độ học tập và chuyển đổi tương ứng.
Quá trình này lặp lại một số lần lặp lại hoặc cho đến khi sự thay đổi trong mất mát trở nên không đáng kể.
Tính mẫu
Hãy xem một điểm dữ liệu riêng lẻ x = 2 [FLT: 1] và đầu ra [FLT: 2] [FLT = 4 . Ban đầu trọng lượng w = 0.5 và xu hướng [FL:6] [FL:6] b [FL:].
Tính toán: [FLT:] = tốc độ + b = 0. 5 * 2 + 0 = 1 [FLT: 1]
Tính sai: Khủng bố = y = 1 - 4 = - 3
Tính & màu
Gradient w.r.t. trọng lượng: [FL/GL = 2 * lỗi * x = 2 * (-3) * 2 = - 12
Gradient w.r.t. xu hướng: [FL/GL = 2 * lỗi = 2 * (-3) = -6
& Xem trước
Trọng lượng mới: w = 0.5 - 1 * (12) = 0.5 + 1.7 )
Thành kiến mới: b = 0 - 0. 1 * (-6) = 0 + 0. 6 = 0. 6 [FLT: 1)