Технології сучасного виробництва
Вирішення проблеми з гасінням градієнтів: методи та розрахунки для глибоких мереж
Table of Contents
Глибокі нейронні мережі можуть зіткнутися з проблемами під час тренувань, особливо з проблемами ванішування. Цей питання виникає, коли градієнти стають дуже малими, перешкоджаючи здатності мережі ефективно вчитися. Різні методи розроблені для вирішення цієї проблеми і вдосконалення процесу навчання.
Розуміння ванішної градієнтовної задачі
Уникаючи градієнтовної задачі в першу чергу впливає на глибокі мережі з багатьма шарами. Під час запоругації градієнти пропагують назад через мережу. Якщо градієнти дімінішу доцільно, то раніше шари вчать дуже повільно або зупиняються навчання в аттенгетері. Це обмежує спроможність мережі до моделі складних функцій.
Методика виходу з Мітгату
Кілька способів можна зменшити вплив ванішних градієнтів:
- Оцілення функцій: Використання функцій, таких як ReLU (роздільований лінійний) замість сигмоїду або тан, допомагає більш міцним градієнтам.
- Висотна ініціалізація: Методи ініціалізації, такі як Xavier або He, що ініціалізація, запобігає градієнтам з усадки або вибуху спочатку.
- Нормалізація: Нормалізація вхідних шарів стабілізаторів навчання та підтримує здоровий градієнтний потік.
- Skip Connections: Архітектура, як ResNet, вводить ярлики, які дозволяють отримати градієнти для обходу певних шарів.
- Градієнт Клиплення: Обмеження розмірів градієнтів при навчанні запобігає їх перепаду занадто малим або занадто великим.
Розрахунок та математичні дослідження
Виражаний градієнтовний шар l] при запорагуванні може бути виражений як:
] ⁇ ] ⁇ ] = ⁇ L / ⁇ l] × ⁇ l / ⁇ wl
l] є вагами, wl]] ]all] є активаціями. Правило ланцюжка багатоповерхівки по шарам, які можуть призвести до екстреного розпаду, якщо похідні менше одного.
Для функцій активації, таких як сигмоїд, похідна:
σ'(x) = σ(x) × (1 - σ(x))]
З σ(x) коливається від 0 і 1, похід може бути дуже невеликою, особливо для великих очок , що сприяє пошкодженню градієнтної проблеми.