プリンシパルコンポーネント解析(PCA)は、できるだけ多くの分散を防いでいる間、データの次元を削減するために使用される統計技術です。 これは、相関変数のセットを、主成分と呼ばれる非相関変数のより小さなセットに変換します。 この方法は、データ分析、機械学習、パターン認識で広く使用されています。

PCAの数学的基礎

PCAのコアは、変数間の関係をキャプチャするデータの共和行列を計算することを含みます。この行列の永和値と永続化因子は計算されます。 eigenvectorsは、各主コンポーネントによって捕獲された分散の量を示す一方で、最大の分散の方向を決定します。

PCAの数学的に実行する手順は次のとおりです。

  • ゼロ平均値とユニットの分散値を持つデータを標準化します。
  • 標準化されたデータの共和行行列を計算します。
  • 共和性行列の均衡と均衡を計算します。
  • 降順にeigenvaluesに基づいてeigenvectorをソートします。
  • 選択したEIGENVEctorsにデータをプロジェクトし、主要なコンポーネントを取得します。

PCAのアプリケーション

PCAは複雑なデータセットを簡素化し、根本的なパターンを明らかにするために、さまざまな分野で使用されています。 画像処理、遺伝学、財務、および音声認識で特に役立ちます。 データ寸法を削減することにより、PCAは計算効率と視覚化を改善するのに役立ちます。

共通の適用は下記のものを含んでいます:

  • データのノイズを低減
  • 2Dまたは3Dプロットで高次元データを視覚化。
  • 機械学習アルゴリズムの事前処理
  • 特徴の抽出および選択。