Table of Contents
マシン学習モデルが、ノイズやアウターなど、トレーニングデータを学習する際、さらには、新しいデータに一般化する能力を低下させる効果が高まります。 過度の検出と予防は、堅牢なモデルを開発するために不可欠です。
過度の利益の兆候
トレーニングと検証のパフォーマンスの違いは、多くの場合、過度に機能します。モデルがトレーニングデータに非常によく機能するが、不測のデータでは不十分である場合、過度に影響する可能性があります。
過度の検出技術
検証データセットのモデルのパフォーマンスを監視することで、過度な機能を特定できます。一般的な方法は次のとおりです。
- トレーニングと検証の精度をエポックよりもプロット
- 別々のテストデータに対する性能メトリックの評価
- クロスバリデーション技術の使用
過度の苦難を防ぐ戦略
予防策はモデルの一般化を改善するのを助けます。 主な戦略は次のとおりです。
- 正規化:]])L1やL2正規化などの複雑性をモデル化するための罰則を適用します。
- ]剪定:]]] 大幅に貢献しない枝を除去することにより、決定木を簡素化する。
- ] ほぼ停止:[]] 検証性能が改善を止めるときにハリングトレーニング。
- []データ集計:[]] トレーニングデータを多様性に増加させ、過度の増大を削減します。
- 抜粋:] 神経系ネットワークのトレーニング中にランダムに分解します。