Глибокі нейронні мережі можуть зіткнутися з проблемами під час тренувань, особливо з проблемами ванішування. Цей питання виникає, коли градієнти стають дуже малими, перешкоджаючи здатності мережі ефективно вчитися. Різні методи розроблені для вирішення цієї проблеми і вдосконалення процесу навчання.

Розуміння ванішної градієнтовної задачі

Уникаючи градієнтовної задачі в першу чергу впливає на глибокі мережі з багатьма шарами. Під час запоругації градієнти пропагують назад через мережу. Якщо градієнти дімінішу доцільно, то раніше шари вчать дуже повільно або зупиняються навчання в аттенгетері. Це обмежує спроможність мережі до моделі складних функцій.

Методика виходу з Мітгату

Кілька способів можна зменшити вплив ванішних градієнтів:

  • Оцілення функцій: Використання функцій, таких як ReLU (роздільований лінійний) замість сигмоїду або тан, допомагає більш міцним градієнтам.
  • Висотна ініціалізація: Методи ініціалізації, такі як Xavier або He, що ініціалізація, запобігає градієнтам з усадки або вибуху спочатку.
  • Нормалізація: Нормалізація вхідних шарів стабілізаторів навчання та підтримує здоровий градієнтний потік.
  • Skip Connections: Архітектура, як ResNet, вводить ярлики, які дозволяють отримати градієнти для обходу певних шарів.
  • Градієнт Клиплення: Обмеження розмірів градієнтів при навчанні запобігає їх перепаду занадто малим або занадто великим.

Розрахунок та математичні дослідження

Виражаний градієнтовний шар l] при запорагуванні може бути виражений як:

] ⁇ ] ⁇ ] = ⁇ L / ⁇ l] × ⁇ l / ⁇ wl

l] є вагами, wl]] ]all] є активаціями. Правило ланцюжка багатоповерхівки по шарам, які можуть призвести до екстреного розпаду, якщо похідні менше одного.

Для функцій активації, таких як сигмоїд, похідна:

σ'(x) = σ(x) × (1 - σ(x))]

З σ(x) коливається від 0 і 1, похід може бути дуже невеликою, особливо для великих очок , що сприяє пошкодженню градієнтної проблеми.