Data preprocessing은 크게 모델 성능에 영향을 줄 수 있는 초시적 학습의 중요한 단계입니다. 그것은 정확도와 효율성을 향상시킬 수있는 교육 알고리즘에 적합한 형식으로 원료 데이터를 변환하는 것을 포함합니다.

Data Preprocessing의 중요성

효과적인 사전 처리는 누락된 값, 소음 감소, 및 정상화 데이터를 처리하는 데 도움이됩니다. 이 단계는 학습 알고리즘이 깨끗하고 일관된 입력을 수신하며 더 나은 예측을 제공합니다.

Data Preprocessing의 일반적인 기술

  • Handling Missing Data:] 의미, 미디어, 또는 모드를 가진 누락된 값을 채우기.
  • Normalization: 0과 1과 같은 특정 범위에 확장 기능
  • Categorical variable: 1열 인코딩 또는 라벨 인코딩을 사용하여 수치 값으로 변환 카테고리.
  • 특징:차원을 줄이기 위한 관련 기능을 선택.

Data Preprocessing의 계산

계산은 많은 전처리 기술에 참여하고 있습니다. 예를 들어, 정상화는 종종 최소 최대 스케일링을 사용하며 계산됩니다.

확장 값 = (원래값 - 분) / (최대 - 분)

마찬가지로, 누락 된 데이터를 처리하는 것은 의미를 계산 할 수 있습니다.

mean = 값의 합계 / 값의 수