특징 선택과 차원 감소는 감독된 학습에 있는 근본적인 기술입니다. 그들은 모형 성과를 개량하고, 과잉을 감소시키고, 계산 비용을 감소시킵니다. 이 가이드는 이 기술을 효과적으로 적용하기를 위한 일반적인 방법 및 제일 연습의 개요를 제공합니다.

특징 선택 기술

기능 선택은 원본 데이터셋에서 관련 특징의 하위 세트를 선택해야 합니다. 모델과 해석성을 단순화합니다. 일반적인 방법은 필터, 래퍼 및 임베디드 기술을 포함합니다.

필터 방법

필터 방법 평가 기능에 따라 통계 측정과 상관 관계 정보. 그들은 빠르고 높은 차원 데이터를 위해 적합.

포장 방법

다른 잠수함에 훈련 모델에 의해 선택 및 최고의 성능을 조합 선택. 그들은 더 정확하지만 적절하게 집중.

임베디드 방법

임베디드 방법에는 모델 트레이닝 내에서의 기능 선택이 통합되어 Lasso regression와 같은 중요한 기능을 곱합니다.

차원 감소 기술

치수 감소는 데이터가 낮은 치수 공간으로 변환되며, 필수 정보를 보존합니다. 높은 치수 데이터를 처리 할 때 기능이 매우 상관 또는 상관 관계가 높을 때 유용합니다.

Principal 구성 요소 분석 (PCA)

PCA는 대부분의 variance를 설명하는 주요 구성 요소에 데이터를 투영하여 치수를 감소시킵니다. 그것은 시각화 및 소음 감소에 널리 사용됩니다.

t-Distributed Stochastic 이웃 에버딩 (t-SNE)

t-SNE는 2개 또는 3개의 차원에서 높은 차원 자료를 시각화하는 기술입니다. 그것은 국부적으로 구조를 강조하고 클러스터링 분석에 유용합니다.

가장 좋은 연습

기능 선택 또는 치수 감소를 적용 할 때, 다음 모범 사례를 고려하십시오.

  • 기술 선택하기 전에 데이터와 문제를 이해합니다.
  • 기능 선택의 영향을 평가하기 위해 교차 유효성을 사용합니다.
  • 더 나은 결과를 위한 여러 가지 방법을 결합합니다.
  • 정보 손실에 납득 할 수있는 과감한,