マシン学習モデルが、ノイズやアウターなど、トレーニングデータを学習する際、さらには、新しいデータに一般化する能力を低下させる効果が高まります。 過度の検出と予防は、堅牢なモデルを開発するために不可欠です。

過度の利益の兆候

トレーニングと検証のパフォーマンスの違いは、多くの場合、過度に機能します。モデルがトレーニングデータに非常によく機能するが、不測のデータでは不十分である場合、過度に影響する可能性があります。

過度の検出技術

検証データセットのモデルのパフォーマンスを監視することで、過度な機能を特定できます。一般的な方法は次のとおりです。

  • トレーニングと検証の精度をエポックよりもプロット
  • 別々のテストデータに対する性能メトリックの評価
  • クロスバリデーション技術の使用

過度の苦難を防ぐ戦略

予防策はモデルの一般化を改善するのを助けます。 主な戦略は次のとおりです。

  • 正規化:]])L1やL2正規化などの複雑性をモデル化するための罰則を適用します。
  • ]剪定:]]] 大幅に貢献しない枝を除去することにより、決定木を簡素化する。
  • ] ほぼ停止:[]] 検証性能が改善を止めるときにハリングトレーニング。
  • []データ集計:[]] トレーニングデータを多様性に増加させ、過度の増大を削減します。
  • 抜粋:] 神経系ネットワークのトレーニング中にランダムに分解します。