Jaringan saraf mendalam nutrick dapat menghadapi tantangan selama pelatihan, terutama dengan masalah gradien yang lenyap. isu ini terjadi ketika gradien menjadi sangat kecil, menghambat kemampuan jaringan untuk belajar secara efektif. berbagai teknik telah dikembangkan untuk mengatasi masalah ini dan meningkatkan proses pelatihan.

Memahami Problem Gradien yang Lenyap

Masalah gradien yang lenyap terutama mempengaruhi jaringan dalam dengan banyak lapisan. Selama backpropagasi, gradien dipropagasi mundur melalui jaringan. Jika gradien berkurang secara eksponensial, lapisan sebelumnya belajar sangat lambat atau berhenti belajar sama sekali. Ini membatasi kapasitas jaringan untuk memodelkan fungsi kompleks.

Teknik untuk Mengmigrasikan Sengketanya

Beberapa metode dapat membantu mengurangi dampak hilangnya gradien:

  • Fungsi-fungsi pengartian: Menggunakan fungsi seperti ReLU (Persatuan Linear Terakreditasi) daripada sigmoid atau tanh membantu mempertahankan gradien yang lebih kuat.
  • Perintah Berat: Metode inisialisasi yang tepat, seperti inisialisasi Xavier atau He, mencegah gradien menyusut atau meledak pada awalnya.
  • [[CharfLT:0]]Batch Normalisasi:] Normalisasi input lapisan menstabilkan pembelajaran dan mempertahankan aliran gradien sehat.
  • [[CUGNFLT:0]]Skip Sambungan: Arsitektur seperti ResNet memperkenalkan pintasan yang memungkinkan gradien untuk memotong lapisan tertentu.
  • Gradient Clipping: Membatasi ukuran gradien selama pelatihan mencegah mereka menjadi terlalu kecil atau terlalu besar.

Penghitungan dan Pemahaman Matematika

Gradien di lapisan l] selama backpropagasi dapat dinyatakan sebagai:

[[GALAL:0]] ⁇ L/ ⁇ wl = ⁇ L/ ⁇ al × ⁇ al/ ⁇ w]l]

Parameter di mana]L] adalah kerugian, wl adalah berat, dan a[l] adalah aktivasi. Aturan rantai multiplies turunan lintas lapisan, yang dapat mengarah ke peluruhan eksponensial jika turunan kurang dari satu.

Untuk fungsi pengaktifan seperti sigmoid, turunannya adalah:

[[GALAL:0]] IST'(x) = ⁇ (x) × (1 - ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇

Karena ⁇ (x) berkisar antara 0 dan 1, turunannya bisa sangat kecil, terutama untuk ⁇ uxAwux yang besar, berkontribusi pada masalah gradien yang lenyap.