Các mạng thần kinh sâu có thể đối mặt với những thách thức trong quá trình đào tạo, đặc biệt là với vấn đề biến mất dốc dốc. vấn đề này xảy ra khi lớp dốc trở nên rất nhỏ, cản trở khả năng học tập của mạng lưới.

Hiểu vấn đề đổ dầu đang di chuyển

Trong quá trình mở rộng, các lớp chuyển tiếp được truyền ngược lại qua mạng. Nếu các lớp chuyển tiếp giảm theo cấp số nhân, các lớp trước sẽ học rất chậm hoặc ngừng học tập hoàn toàn. Điều này giới hạn khả năng của mạng để mô hình chức năng phức tạp.

Kỹ thuật để xác định vấn đề

Một số phương pháp có thể giúp giảm tác động của việc biến mất dốc:

  • Hàm Hình thành:) Dùng các chức năng như ReLU (trích dẫn tuyến tính) thay vì igmoid hoặc tanh giúp duy trì dốc mạnh hơn.
  • Cách thức khởi tạo đúng đắn , như Xavier hoặc He startization, ngăn cản sự giảm bớt hoặc bùng nổ ban đầu.
  • Sự chuẩn hóa cơ bản: chuẩn hoá lớp đầu vào ổn định việc học và duy trì dòng chảy lành mạnh.
  • Kết nối máy móc: Các kiến trúc sư như ResNet giới thiệu các phím tắt cho phép Chuyển tiếp để vượt qua các lớp nhất định.
  • Chương trình Glraging:) giới hạn kích thước của dốc trong quá trình đào tạo ngăn cản chúng trở nên quá nhỏ hoặc quá lớn.

Tính toán và thấu hiểu toán học

Chuyển tiếp ở lớp l trong khi quay lại có thể được biểu hiện như:

) ) ) = [FLT/GLT:3] [FLT:] [FLT:] [FLT:] [FLT:]]

[FLT:] là sự mất mát, ) [FLT:] [FLT:] [FLT:] là các khối cân, và [FLT:] [FLT] [FLT:] [FLT:]] [luật số đạo hàm gấp], mà có thể dẫn đến số mũ ít hơn một.

Đối với chức năng kích hoạt như sigmoid, đạo hàm là:

[x] = x] × (1 - x) )

Vì x-làm cho khoảng cách giữa 0 và 1, đạo hàm có thể rất nhỏ, đặc biệt đối với BAR x-x-x-x-x-x-x, góp phần vào việc biến mất vấn đề dốc.