マシン学習モデルが、ノイズやアウターなど、トレーニングデータを学習するときに過度に発生します。これにより、新しいデータに一般化する能力が低下します。 過度に対処することは、18個のデータセットでうまく機能する堅牢なモデルを作成するのに不可欠です。

過度の利益を理解する

モデルは、利用可能なデータ量に相対的に複雑すぎると、過度のフィットが起こります。 これにより、トレーニングデータの正確性が高まり、テストデータのパフォーマンスが低下するのではなく、トレーニングデータのノイズをキャプチャします。

過度の苦しみを防ぐ技術

マシン学習モデルの過度を削減するために、いくつかの方法が採用できます。

  • [:[]:モデルパラメータをチューニングするためのデータと検証セットを分割する。
  • 正規化:]]] L1やL2正規化などの複雑性のためのペナルティを追加します。
  • []:]]]の実行は、電源を提供しない枝を除去することにより、決定の木のようなモデルを簡素化します。
  • ]アーリーストッピング:[]]検証データの性能が低下し始めるとハリングトレーニング。
  • 抜粋:] 神経系ネットワークのトレーニング中にランダムに神経を非アクティブに。

実用的な例

これらの技術の導入により、モデルの一般化が大幅に向上します。例えば、線形回帰における正規化を適用することで、モデルの適合ノイズを防止する係数が減少します。ニューラルネットワークのドロップアウトを使用して、特定のニューロンへの依存を回避し、より良い学習を促進するのに役立ちます。

技術の正しい組み合わせを選択すると、データとモデルの種類によって異なります。 検証データの定期的な評価は、過度を特定し、それに応じて戦略を調整するために不可欠です。