Chọn một bước phù hợp, hay một tốc độ học tập là thiết yếu để đào tạo các mạng lưới thần kinh sâu sắc một cách hiệu quả. nó ảnh hưởng đến việc mô hình hội tụ nhanh và ảnh hưởng đến sự ổn định của quá trình đào tạo. bài này cung cấp một phương pháp thực tế để tính toán kích thước bước để giảm dần các mô hình học sâu.

Hiểu độ sáng Gradient

Gradient descent là một thuật toán tối ưu hóa được dùng để giảm thiểu chức năng mất mát bằng cách lặp lại độ nặng của mô hình. Kích cỡ bước quyết định độ lớn của những bản cập nhật này. Một kích cỡ bước quá lớn có thể gây ra quá nhiều khả năng bắn, trong khi một rất nhỏ có thể dẫn đến sự hội tụ chậm.

Tính cỡ bước

Một phương pháp thực tế bao gồm sử dụng hằng số Lipschitz của chuyển đổi hàm mất. Nếu hằng số này, được gọi là L, hoặc ước tính, kích thước bước có thể được đặt là 1/L. Việc này đảm bảo sự hội tụ ổn định trong quá trình đào tạo.

Trong trường hợp mà L không biết, cách thông thường là tìm kiếm dòng hoặc sử dụng phương pháp tiên đoán như là học thời gian biểu.

Lời khuyên thực tế

  • Bắt đầu với một tốc độ học nhỏ và dần dần tăng nó.
  • Theo dõi chức năng mất tích để phát hiện sự khác biệt hoặc sự hội tụ chậm.
  • Sử dụng những nhà tối ưu thích nghi như Adam hoặc RMSprop để tự động điều chỉnh kích thước bước.
  • Áp dụng tỷ lệ học tập suy giảm để tinh luyện việc huấn luyện khi nó tiến bộ.