監督された学習は、ラベル付きデータに関するトレーニングモデルを含む広く使用されている機械学習アプローチです。しかし、開業医は、多くの場合、モデルのパフォーマンスと信頼性に影響を与えることができる一般的な落とし穴に遭遇します。これらの問題を理解し、適切な計算を適用することで、影響を軽減することができます。

過度と不足

モデルは、ノイズを含むトレーニングデータがあまりよく学習したときに、過度の機能が起こり、新しいデータに対する低体化を引き起こします。モデルが過層パターンをキャプチャするのがあまり単純でないと、不足が起こります。トレーニングや検証エラー率などの計算は、これらの問題を特定するのに役立ちます。

例えば、訓練エラー(E[]train]])と検証エラー(E]val])を比較すると、Etrainが、E[が高くなると非常に低い。 逆に、両方の提案の高エラーが高くなります。

クラス・インバランス

クラスの不均衡は、いくつかのクラスがデータセットに表わされると発生し、偏見モデルにつながります。クラス分布の割合を計算することで、不均衡を識別できます。

データセットにクラスAと100からBまでの900個の標本が1000個あります。クラス分布の割合は以下です。

授業 A:(900/1000) * 100 = 90%

授業B:100/1000 * 100 = 10%

モデル性能評価

精度、精度、リコール、F1スコアなどのメトリックは、モデルのパフォーマンスを評価するために不可欠です。 計算には、混在マトリックスコンポーネントが含まれます。

  • 真の正性(TP)
  • 偽の肯定的な (FP)
  • 偽の負債 (FN)

例えば、精度は次のように計算されます。

精密=TP/(TP + FP)

ノイジーデータ処理

ノイズデータでは、モデルのトレーニングを歪めることができます。ノイズ対シグナル比などの計算は、データの品質を定量化するのに役立ちます。

データセットは1000の合計のサンプルから100のうるさいサンプルを含んでいるとします。騒音の比率はあります:

騒音比=(騒音サンプルの数)/(合計サンプル)=100/1000=0.1または10%