Table of Contents
強迫的な問題は、深いニューラルネットワークを訓練する共通の課題です。 勾配が小さくなると、ネットワークが効果的に学習することを防ぎます。 原因とソリューションを理解することは、モデルのパフォーマンスとトレーニングの安定性を向上させることができます。
フィッシング・グラデーションの理解
フィッシング勾配の問題は、主にバックプロパゲーション中に深いネットワークで発生します。 エラー信号は、多くのレイヤーを後方に移動するにつれて、勾配は指数関数的に減少することができます。 これは、以前のレイヤーで非常に遅い学習や学習しません。
一般的な原因
- 小さな範囲に入力をスカッシュするシグマイドやタンなどの活性化機能の使用。
- 多くの層の深いネットワークのアーキテクチャ。
- 不適切な重量の初期化。
実用的なソリューション
いくつかの技術は、フィッシングの勾配を緩和し、トレーニング結果を向上させることができます。
活発化機能
ReLU(Rectified Linear Unit)またはそのバリアントでシグマイドまたはタンを交換すると、勾配のフローを維持するのに役立ちます。これらの機能は、小さな範囲に入力をスカッシュせず、グラデーションがより効果的に通過することを可能にします。
重量の初期化
XavierやHeの初期化などの適切な初期化方法を使用して、トレーニングの開始時に、研磨や爆発を防ぐことができます。
ネットワークアーキテクチャ
残留接続を実装したり、接続をスキップしたりすることで、グラデーションが特定のレイヤーを迂回し、バックプロパゲーション中に強度を維持することができます。