Table of Contents
Gradient biến mất và nổ tung là những vấn đề phổ biến trong việc đào tạo mạng lưới thần kinh sâu. chúng xảy ra khi dốc dốc quá nhỏ hoặc quá lớn trong quá trình phát triển, ảnh hưởng đến quá trình học tập. hiểu được những hiện tượng này bao gồm việc phân tích những tính toán đằng sau các bản cập nhật trọng lượng và khám phá những giải pháp tiềm năng.
Gradient đang di chuyển
Gradient biến mất khi các dốc màu giảm theo cấp số nhân khi chúng được truyền ngược lại qua lớp. Kết quả là trong các bản cập nhật trọng lượng rất nhỏ, khiến mạng học rất chậm hoặc dừng lại học tập hoàn toàn.
Về mặt toán học, nếu hàm số khởi động là ít hơn 1, dốc dốc [FLT: 0] l [FLT: 1] có thể được biểu diễn như:
[FLT/WLT:1) ) ) = [FLL/GLT/G] ) * [FL:] [LT:10] [LT] [LLL:] [LLL:] [LLLL] [LLLL:] [LLLLL] [LLL:] [LLLL] [LLLL:] [LLLL] [LLLL:] [LLLLL] [LLLL]
l [FLT:] [FLT:] [FLT:] [FLT:] [FLT:] [bắt nguồn gốc của hàm kích hoạt]. Nếu đạo hàm này nhỏ hơn 1, phép nhân lặp đi lặp lại làm tăng i- vi (FLT:3]] ).] là đạo hàm của hàm kích hoạt. Nếu đạo hàm số nhân này là nhỏ hơn 1, phép nhân lặp đi lặp lại, thì phép nhân sẽ làm giảm theo cấp số mũ.
Phát nổ Gradient
Gradient nổ khi các dốc tăng theo cấp số nhân trong quá trình hỗ trợ. Điều này dẫn đến các bản cập nhật trọng lượng rất lớn, có thể gây ra sự bất ổn định và phân tách trong việc đào tạo.
Về mặt toán học, nếu đạo hàm liên quan lớn hơn 1, các lớp có thể tăng theo cấp số nhân:
[FLT/WLT:1) ) ) [FLLL/GL/GLL [FLT:]] [FL:4]] [FL:] [FL:] [FLT:] [FL] [FL] [FL]] [FL: 10] [FL] [FL]] [FL] [FL]] [FL]] [FL] [FL]] [L: 10] [L/L] [L] [L:] [L]] [LL]] [LL:]] [L]] [L] [L] [L]] [L] [LLL]]
Giải pháp cho việc di chuyển và khai thác dầu
Một số kỹ thuật có thể giảm thiểu những vấn đề này:
- Khởi động cân bằng:) Dùng phương pháp như Xavier hoặc ông ta khởi tạo giúp duy trì sự thăng bằng ổn định.
- Hàm hình thành: ReLU và biến thể của nó giảm nguy cơ biến mất dốc.
- Gradit Xoá: Giới hạn giá trị tối đa của các dốc ngăn chặn nổ.
- Không có nhiệt hóa:) Batch bình thường hóa ổn định tiến trình học tập.