プリンシパルコンポーネント解析(PCA)は、その分散のほとんどを保持しながら、データの次元を削減するために使用される統計技術です。 それは、データ分析、機械学習、パターン認識で広く使用されています。 NumPyやSciPyのようなライブラリを備えたPCAを実装することで、基礎的なデータ構造の効率的な計算と理解を可能にします。

プリンシパルコンポーネント分析の理解

PCAは、相関変数の集合を、主成分と呼ばれる小数の無関係変数に変換します。これらのコンポーネントは、最初の数が元のデータセットに存在するバリエーションのほとんどを保持するように注文されます。このプロセスは、コワリエンス行列を計算し、その均衡と英訳者を見つけ、主要なコンポーネントにデータを投影することを含みます。

NumPy と SciPy で PCA を実装

PCAを実行するには、データを標準化して起動し、コバリンス行列を計算します。次に、この行列の eigenvalues と eigenvectors を見つけます。 eigenvectors は、最大分散の方向を表し、 eigenvalues は各方向の分散量を示します。 最後に、選択した eigenvectors にデータをプロジェクトして、主要なコンポーネントを取得します。

PCA導入のステップ

  • ゼロ平均値とユニットの分散値を持つデータを標準化します。
  • ]np.covを使用して共和行列を計算します。
  • scipy.linalg.eigh で計算するeigenvalues とeigenvectors。
  • 降順にeigenvaluesに基づいてeigenvectorをソートします。
  • 選択したEIGENVEctorsにデータをプロジェクトし、寸法を削減します。