Table of Contents
適切なステップサイズを選択するか、学習率は、効果的なディープニューラルネットワークのトレーニングに不可欠です。 モデルは、素早く変化し、トレーニングプロセスの安定性に影響を及ぼす影響に影響します。 この記事では、ディープラーニングモデルの勾配度のためのステップサイズを計算するための実用的なアプローチを提供します。
勾配の白熱を理解する
勾配降下は、モデルの体重を反復的に更新することによって損失機能を最小限に抑えるために使用される最適化アルゴリズムです。ステップサイズは、これらの更新の倍率を決定します。あまりにも大きなステップサイズは、過剰な撮影を引き起こす可能性がありますが、非常に小さなものはゆっくりとした収束につながる可能性があります。
ステップ サイズを計算する
一つの実用的な方法は、損失関数の勾配のLipschitz定数を使用して関与しています。 この定数がLとして宣言されている場合、既知または推定され、ステップサイズは1 / Lとして設定することができます。 これは、トレーニング中に安定した収斂を保証します。
Lが不明な場合、学習率のスケジュールなどのヒューリスティックメソッドを行なうための一般的なアプローチです。これらの技術は、トレーニングの進捗に基づいてステップサイズを適応させます。
実用的なヒント
- 小さな学習率で始めて徐々に増加させます。
- 失点を検出したり、失禁を遅らせるために損失機能を監視します。
- 適応型オプティマイザをアダムやRMSpropなどの組み合わせで、ステップサイズを自動的に調整します。
- 学習率のデケイを学習率で学習し、学習を進行させるようにします。