ディープニューラルネットワークは、特に、熟練した問題で、トレーニング中に課題に直面しることができます。この問題は、グラデーションが非常に小さくなると、ネットワークの能力を効果的に学習するときに起こります。この問題に対処するために様々な技術が開発され、トレーニングプロセスを改善しました。

有意な問題の理解

驚くべき勾配の問題は、主に多くの層と深いネットワークに影響を与えます。 バック提案中に、勾配はネットワークを介して後方を伝播します。 勾配が指数関数的に減少した場合、以前の層は非常にゆっくりと学習するか、学習を完全に停止します。 これは、複雑な機能をモデル化するネットワークの能力を制限します。

課題を緩和するためのテクニック

いくつかの方法は、消火性勾配の影響を減らすことができます。

  • 活性関数:[]] sigmoidやtanhの代わりにReLU(Rectified Linear Unit)などの機能を使用して、より強力な勾配を維持するのに役立ちます。
  • []ウェイト初期化:[ XavierやHeの初期化などの適切な初期化メソッドは、勾配が縮小または初期化を防止します。
  • バッチ正規化:]]レイヤー入力を正規化して学習を安定させ、健康な勾配の流れを維持します。
  • スキップ接続:[] 特定のレイヤーをバイパスするグラデーションを可能にするショートカットを導入するResNetのようなアーキテクチャ。
  • グラデーション・クリッピング:] トレーニング中にグラデーションのサイズを制限することで、小さくても大きすぎてもよい。

計算と数学的洞察

バックプロパゲーション中にレイヤー[]lでグラデーションを表現できます。

] ⁇ L/ ⁇ ]]l] = ⁇ L/ ⁇ ]l× ⁇ a]l]/ ⁇ l]

Lは損失、w]lは体重であり、]a[]]]l[]]は活性化です。 チェーンルールはレイヤーを横断して複数の誘導体を乗用し、これは、指数関数よりも少ない誘導体を誘導することができます。

ジミノイドのような活発化機能のために、派生物はあります:

[σ'(x) = σ(x) × (1 - σ(x)]]

σ(x)は0~1の範囲で、特に大型の |x| に対して、非常に小型で、バニシング勾配の問題に寄与することができます。