Table of Contents
Principal Component Analysis (PCA)는 가능한 한 많은 차이가 있을 때 데이터의 치수를 줄이기 위해 사용되는 통계 기술입니다. 그것은 주요 구성 요소라고 비례적인 변수의 작은 집합으로 관련 변수의 집합을 변환합니다. 이 방법은 데이터 분석, 기계 학습 및 패턴 인식에서 널리 사용됩니다.
PCA의 수학 재단
PCA의 핵심은 변수 간의 관계를 캡처하는 데이터의 공동 변수 매트릭스를 계산하는 것을 포함한다. 이 매트릭스의 Eigenvalues 및 eigenvectors는 그 후 계산됩니다. eigenvectors는 최대 가변의 방향을 결정하고, eigenvalues는 각 주요 구성 요소에 의해 캡처 된 다양한 양을 나타냅니다.
PCA 수학적으로 수행 단계는 다음과 같습니다.
- 0의 의미와 단위 차이를 가진 자료를 표준화하십시오.
- 표준화 된 데이터의 covariance matrix를 Compute.
- eigenvalues와 covariance matrix의 eigenvectors를 계산합니다.
- eigenvectors를 정렬하여 eigenvalues를 거친 후속 순서.
- 선택한 eigenvectors에 데이터를 프로젝트하여 주요 구성 요소를 얻을 수 있습니다.
PCA의 신청
PCA는 복잡한 데이터셋을 단순화하고 언더리닝 패턴을 밝혀내는 다양한 분야에서 사용됩니다. 이미지 처리, 유전학, 금융 및 연설 인식에 특히 유용합니다. 데이터 크기를 감소시키면 PCA는 계산 효율과 시각화를 향상시킵니다.
일반적인 신청은 다음을 포함합니다:
- 데이터의 소음 감소.
- 2D 또는 3D 플로트의 높은 치수 데이터를 시각화합니다.
- 기계 학습 알고리즘을 위한 사전 처리.
- 특징 추출 및 선택.