Principal 구성 요소 분석 (PCA)는 데이터의 차원을 유지하면서 데이터의 치수를 감소시키기 위해 사용되는 통계 기술입니다. 그것은 데이터 분석, 기계 학습 및 패턴 인식에 널리 사용됩니다. NumPy 및 SciPy와 같은 라이브러리가있는 PCA를 구현하면 정밀 계산 및 이해를 가능하게합니다.

Principal 구성 요소 분석

PCA는 구성 요소라고 불리는 비correlated 변수의 작은 숫자로 구성되는 변수를 변환합니다. 이 구성 요소는 원래 데이터셋에서 존재하는 변형의 대부분을 유지하도록 명령합니다. 이 과정은 covariance matrix를 계산하고, eigenvalues 및 eigenvectors를 찾는 데 필요한 데이터를 생성하고, 주요 구성 요소에 데이터를 프로젝트합니다.

NumPy와 SciPy를 가진 PCA 구현

PCA를 수행하려면 데이터를 표준화하여 시작하십시오. covariance matrix를 준수하십시오. 다음이 행렬의 eigenvalues 및 eigenvectors를 찾으십시오. eigenvectors는 최대 가변 방향을 나타냅니다. eigenvalues는 각 방향의 variance의 양을 나타냅니다. 마지막으로, 선택한 eigenvectors에 데이터를 프로젝트는 주요 구성 요소를 얻기 위해.

PCA 구현 단계

  • 0의 의미와 단위 차이를 가진 자료를 표준화하십시오.
  • np.cov를 사용하여 covariance matrix를 계산합니다.
  • Compute eigenvalues and eigenvectors with scipy.linalg.eigh.
  • eigenvectors를 정렬하여 eigenvalues를 거친 후속 순서.
  • 선택된 eigenvectors에 데이터를 Project로 변경하여 치수를 재개합니다.