Gradient descent là một thuật toán tối ưu cơ bản được sử dụng trong đào tạo máy giám sát mô hình học tập. nó giúp giảm thiểu chức năng lỗi bởi các tham số mô hình lặp lại. hiểu làm thế nào để lấy và áp dụng phương pháp này là cần thiết cho đào tạo mô hình hiệu quả.

Độ phân giải:

Ý tưởng chính của gradient descent bao gồm tính toán gradient của hàm mất với tham số mô hình. đổ dốc này chỉ hướng tăng độ dốc. Để giảm thiểu mất mát, các tham số được cập nhật theo hướng ngược lại của dốc màu.

Về mặt toán học, quy tắc cập nhật tham số được diễn tả như:

Mới ) ) - [FLT:]

đại diện cho các tham số mô hình ) [FLT:] , và [FL:] [FLT:] [FLT:] [FLT:] [FL:5] [FLT: 5.] là dốc dốc của chức năng mất mát.

Đang áp dụng độ sáng Gradient

Để áp dụng và gốc, các bước sau thường được theo sau:

  • Khởi tạo tham số mô hình ngẫu nhiên hoặc với giá trị cụ thể.
  • Tính toán hàm mất dựa trên các tham số và dữ liệu đào tạo hiện thời.
  • Tính màu của sự mất mát với mỗi tham số.
  • Cập nhật các tham số bằng cách sử dụng quy tắc -unintelligible.
  • Lặp lại quá trình cho đến khi có sự hội tụ của mất mát hoặc một số số lần lặp lại.

Chọn mức độ học tập

Tốc độ học tập [FLT:] xác định kích cỡ của mỗi bước cập nhật. Một tỷ lệ nhỏ học tập có thể dẫn đến sự hội tụ chậm, trong khi một lớn có thể gây ra việc bắn quá mức tối thiểu. Chọn một tỷ lệ học tập thích hợp là quan trọng để đào tạo hiệu quả.