차원 감소 방법은 중요 정보를 보존하면서 다양한 기능을 줄여주는 복잡한 데이터셋을 단순화하는 데 도움이되지 않는 학습에 필수적인 도구입니다. 이러한 기술은 데이터 분석이 더 관리할 수 있도록 계산 효율과 시각화를 개선합니다.

Principal 구성 요소 분석 (PCA)

PCA는 널리 사용되는 치수 감소 기술 중 하나입니다. 그것은 주요 구성 요소라는 비correlated 변수의 새로운 세트로 원래 기능을 변환합니다. 이 구성 요소는 데이터에서 최대 가변을 캡처합니다.

PCA는 이미지 자료 또는 유전자 표정 자료와 같은 많은 correlated 특징을 가진 자료 세트에 있는 차원을 감소시키기를 위해 효과적입니다. 그것은 또한 2개 3 차원에 있는 높은 차원 자료를 시각화하는 것을 유용합니다.

t-Distributed Stochastic 이웃 에버딩 (t-SNE)

t-SNE는 2개 또는 3개의 차원으로 맵핑하여 높은 차원 데이터를 시각화하는 비선형 기술입니다. 클러스터를 더 명백하게 만들기 위해 로컬 구조를 보존하는 것을 강조합니다.

t-SNE는 이미지 인식, genomics 및 고객 세그먼트와 같은 응용 분야에서 일반적으로 사용됩니다. 그것은 적절하게 집중되지만 복잡한 데이터 배포의 통찰력있는 시각화를 제공합니다.

획일한 매니폴드 대금 및 투상 (UMAP)

UMAP은 t-SNE과 비교된 글로벌 데이터 구조의 더 빠른 계산과 더 나은 보존을 제공하는 새로운 비선형 기술입니다. 그것은 큰 데이터 세트에 적합하며 의미있는 시각화를 제공합니다.

UMAP은 바이오인포그래픽과 이미지 분석 등 다양한 분야에서 사용되고 있으며, 데이터 패턴과 관계를 효과적으로 탐구합니다.

Unsupervised Learning의 사례 사용

치수 감소 방법은 클러스터링, anomaly detection 및 데이터 시각화에 적용됩니다. 그들은 데이터 구조의 더 나은 이해를 촉진하는 인허가 데이터 그룹화 및 아웃리에를 식별하는 데 도움이됩니다.

  • Data 시각화
  • 기능 추출
  • 소음 감소
  • 기계 학습 모델에 대한 사전 처리