Table of Contents
プリンシパルコンポーネント解析(PCA)は、その分散のほとんどを保持しながら、データの次元を削減するために使用される統計技術です。 それは、データ分析、機械学習、パターン認識で広く使用されています。 NumPyやSciPyのようなライブラリを備えたPCAを実装することで、基礎的なデータ構造の効率的な計算と理解を可能にします。
プリンシパルコンポーネント分析の理解
PCAは、相関変数の集合を、主成分と呼ばれる小数の無関係変数に変換します。これらのコンポーネントは、最初の数が元のデータセットに存在するバリエーションのほとんどを保持するように注文されます。このプロセスは、コワリエンス行列を計算し、その均衡と英訳者を見つけ、主要なコンポーネントにデータを投影することを含みます。
NumPy と SciPy で PCA を実装
PCAを実行するには、データを標準化して起動し、コバリンス行列を計算します。次に、この行列の eigenvalues と eigenvectors を見つけます。 eigenvectors は、最大分散の方向を表し、 eigenvalues は各方向の分散量を示します。 最後に、選択した eigenvectors にデータをプロジェクトして、主要なコンポーネントを取得します。
PCA導入のステップ
- ゼロ平均値とユニットの分散値を持つデータを標準化します。
- ]np.covを使用して共和行列を計算します。
- scipy.linalg.eigh で計算するeigenvalues とeigenvectors。
- 降順にeigenvaluesに基づいてeigenvectorをソートします。
- 選択したEIGENVEctorsにデータをプロジェクトし、寸法を削減します。