Table of Contents
プリンシパルコンポーネント解析(PCA)は、できるだけ多くの分散を防いでいる間、データの次元を削減するために使用される統計技術です。 これは、相関変数のセットを、主成分と呼ばれる非相関変数のより小さなセットに変換します。 この方法は、データ分析、機械学習、パターン認識で広く使用されています。
PCAの数学的基礎
PCAのコアは、変数間の関係をキャプチャするデータの共和行列を計算することを含みます。この行列の永和値と永続化因子は計算されます。 eigenvectorsは、各主コンポーネントによって捕獲された分散の量を示す一方で、最大の分散の方向を決定します。
PCAの数学的に実行する手順は次のとおりです。
- ゼロ平均値とユニットの分散値を持つデータを標準化します。
- 標準化されたデータの共和行行列を計算します。
- 共和性行列の均衡と均衡を計算します。
- 降順にeigenvaluesに基づいてeigenvectorをソートします。
- 選択したEIGENVEctorsにデータをプロジェクトし、主要なコンポーネントを取得します。
PCAのアプリケーション
PCAは複雑なデータセットを簡素化し、根本的なパターンを明らかにするために、さまざまな分野で使用されています。 画像処理、遺伝学、財務、および音声認識で特に役立ちます。 データ寸法を削減することにより、PCAは計算効率と視覚化を改善するのに役立ちます。
共通の適用は下記のものを含んでいます:
- データのノイズを低減
- 2Dまたは3Dプロットで高次元データを視覚化。
- 機械学習アルゴリズムの事前処理
- 特徴の抽出および選択。