Table of Contents
マシン学習モデルのバイアスと分散を理解することは、その性能を向上させるために不可欠です。 これらのコンポーネントを推定すると、モデルがデータに適しているか、または過度のかどうかを識別するのに役立ちます。 この記事では、実際のシナリオでバイアスと分散を評価するための実用的な方法を提供します。
バイアスとバリエーションとは?
バイアスは、単純化されたモデルで現実的な問題について近似することによって導入されたエラーを指します。 変化は、異なるデータセットで訓練されたときにモデルの予測がどれだけ変化するかを示しています。 これらの2のバランスは、モデルの精度を最適化するのに役立ちます。
バイアスを刺激する
偏差を推定するために、モデルの予測値と検証セットの真の値を比較します。高エラーは、多くの場合、過度の影響を受けている高いバイアスを示しています。クロスバリデーションを使用して、複数のデータ分割を横断するエラーを検証することで、より信頼性の高い推定値を得ることができます。
刺激的な変化
変化は、さまざまなサブセットのデータで複数のモデルを訓練し、予測の変動性を測定することによって評価することができます。 大きな違いは、高分散を示唆し、それは過度の利益につながる可能性があります。 ブートストラップサンプリングのような技術は、このプロセスを容易にします。
実用的方法
- [:十字重合:[]モデルの安定性および推定偏差を評価するためにk折の横断validationを使用して下さい。
- Bootstrap Sampling:[ 予測の分散性を評価するために複数のトレーニングセットを生成します。
- []カーブをクリアする:[]])データセットのサイズに対するプロットのトレーニングと検証エラーでバイアスと分散を診断します。
- [モデル複雑性:]] エラーの変化を観察するためのより単純なまたはより複雑なモデルによる実験。