Table of Contents
機能強化と改良は、機械学習モデルの一般的な問題です。 それらは、トレーニングデータから未公表のデータに一般化するモデルの能力に影響を与えます。 数学的基礎を理解することは、より良いモデルの設計と適切なソリューションの選択に役立ちます。
数学基礎
モデルが基礎的なパターンだけでなく、トレーニングデータのノイズを学習したときに過度の影響が起こります。数学的に、それは低トレーニングエラーが、新しいデータに対する高いエラーになります。モデルがデータの構造をキャプチャしすぎず、両方のトレーニングとテストデータに関する高いエラーにつながる場合に、不足が起こります。
バイアス・バリアンス・トレードオフは、これらの現象を説明しています。高バイアスモデルは、高分散モデルが過度に傾向がある一方で、影響力は高まります。バランスのと偏差は、最適なモデル性能のために不可欠です。
数学的指標
四角形エラー(MSE)や断線評価などのメトリックは、過度の不適切な点と過小評価を識別するのに役立ちます。 トレーニングと検証エラーの間の重要なギャップは、過度を示しています。 逆に、データセットの両方の高エラーは、過小評価を示唆しています。
ソリューションと技術
いくつかのメソッドは、過度かつ過小評価を処理します。 L1 や L2 などの正規化技術は、複雑性をモデル化するための罰則を追加します。 断続は、高パラメータの調整に役立ちます。 モデルを簡素化すると、複雑性が増加し、過小評価を緩和することができます。
- 正規化
- クロス検証
- 機能選択
- モデル複雑さの調節
- データ集計