Table of Contents
Gradient descent là một thuật toán tối ưu cơ bản được sử dụng trong đào tạo mạng thần kinh. nó bao gồm việc thay đổi định tính tham số mô hình để giảm thiểu một chức năng mất mát. hiểu các tính toán đằng sau gradient descent và nhận ra các cạm bẫy phổ biến có thể cải thiện hiệu suất đào tạo và hiệu suất mô hình.
Tính cơ bản trong độ dốc
Trung tâm của lớp và gốc bao gồm tính toán các dốc của hàm mất về mỗi tham số. Quy tắc cập nhật thường được thể hiện như:
Mới ) ) - LL
đại diện cho các tham số ) ) , và [FL:] L [FLT:] [FLT:] [FLT:] [FL:5] là dòng dốc của chức năng bị mất.
Những cạm bẫy chung trong độ dốc Gradient
- Đang chọn một tỷ lệ học tập không thích hợp: tỷ lệ quá cao có thể gây ra sự phân biệt, trong khi quá thấp có thể tích tụ chậm.
- Bị mắc kẹt trong tiểu dụng cục bộ: thuật toán có thể giải quyết các điểm phụ, đặc biệt trong phong cảnh mất mát phức tạp.
- Việc ghi chép dữ liệu bình thường hoá:) tính năng chưa được sắp xếp có thể dẫn tới những cập nhật không ổn định và đào tạo chậm.
- Đang tự hỏi không đủ số lần lặp lại: có thể không chạy cập nhật đủ để mô hình không đạt hiệu suất tối ưu.
Chiến thuật để cải thiện độ dốc
Những kỹ thuật nâng cao như học tập thời biểu, động lực và tối ưu hóa thích nghi có thể giúp giảm thiểu những vấn đề thông thường.