기능 스케일링은 기계 학습 알고리즘을 위한 데이터를 준비하는 데 중요한 단계입니다. 모델 성능과 융합 속도를 향상시키기 위해 기능 값의 범위를 조정하는 것이 포함됩니다. 수학 기반을 이해하는 것은 다른 데이터셋에 적합한 기술을 선택하는 데 도움이됩니다.

기능 확장의 수학 재단

기능 스케일링 방법은 데이터의 배포를 수정하는 수학 변환에 근거합니다. 일반적인 기술은 정상적인화 및 표준화가 포함됩니다. 일반적으로 공식을 사용하여 특정 범위에 대한 정상화 재 스케일 기능 [0, 1] :

정상 값 = (x - min) / (max - min)

표준화는 0과 1의 표준 편차를 가지고 데이터를 변환합니다.

표준 값 = (x - μ) / σ]

기능 확장을위한 실용적인 기술

기능 확장은 데이터와 알고리즘을 기반으로 올바른 방법을 선택해야 합니다. 예를 들어, k-nearest 이웃과 신경 네트워크와 같은 알고리즘은 정상화에서 혜택을 누릴 수 있으며 선형 회귀와 논리 회귀는 종종 표준화를 사용합니다.

일반적인 기술은 다음과 같습니다 :

  • Min-Max 확장
  • Z-Score 표준화
  • 스트레칭
  • MaxAbs 확장

교육 데이터에 대한 스케일링 매개 변수를 적합하고 데이터 누설을 방지하기 위해 테스트 데이터에 동일한 변환을 적용하는 것이 중요합니다.