Table of Contents
クロスバリデーションは、機械学習モデルの性能を評価するために使用される技術です。モデルがどの程度うまくいかないデータで実行するかを推定することでモデルパラメータを調整するのに役立ちます。このプロセスは、データセットを複数の部品に分割し、モデルをいくつかの部分で訓練し、他の人にテストすることを含みます。この記事では、モデルチューニング中にクロスバリデーションエラーのステップバイステップ計算について説明します。
ステップ1:データパーティション
データのセットは、折れと呼ばれる「k」の等しい部分に分けられます。'k'の一般的な選択肢は5か10です。各折目はバリデーションとして設定され、残りの折目はトレーニングセットを形成します。このプロセスは、すべてのデータポイントがトレーニングと検証の両方に使用されます。
ステップ2:モデルのトレーニングと検証
各折り目は、残りの 'k-1' の折り目でモデルを訓練します。その後、現在の折り目で検証されます。 エラーは、バリデーションの折り目で実際の値と比較してモデルの予測に基づいて計算されます。 このステップは、すべての折り目を繰り返します。
ステップ3:エラー計算
各折り目からエラーが記録されます。一般的なエラーメトリックには、四角形エラー(MSE)または絶対エラー(MAE)を意味します。 横断バリデーションエラーは、モデルのパフォーマンスの推定値を提供する、すべての折り目でこれらのエラーの平均です。
ステップ4:最終的な間違いの推定
相互検証プロセスから得られる平均的なエラーは、モデルが新しい、未発表のデータでどのように実行するかの推定値として機能します。この値は、チューニング中に最適なモデルパラメータの選択を導きます。