Table of Contents
Data preprocessing은 효과적인 심 신경 네트워크 개발의 중요한 단계입니다. Properly 준비된 자료는 모델 정확도와 훈련 효율성을 향상시킬 수 있습니다. 이 문서는 딥러닝 응용 프로그램에 대한 사전 처리 데이터에 사용되는 실용적인 기술을 설명합니다.
데이터 청소
청소 데이터는 제거 또는 수정 inaccurate, inconsistent, 또는 불완전한 데이터 포인트를 포함합니다. 이 단계는 모델이 신뢰할 수있는 정보로부터 배우는 것을 보장합니다. 기술에는 누락 된 값을 처리하고 중복 제거하고 오류를 수정합니다.
정상화 및 표준화
정상적인화는 특정 범위에 데이터, 종종 [0, 1], 훈련 중 빠른 융합에 도움이. 표준화는 0의 의미를 가지고 데이터와 하나의 표준 편차를 변환합니다. 두 방법 모두 모델 안정성과 성능을 향상시킵니다.
기술연구소
원시 데이터의 의미있는 기능을 사용하여 모델 학습을 향상시킬 수 있습니다. 기술에는 인코딩 categorical 변수, 추출 날짜 / 시간 기능 및 상호 작용 용어를 포함합니다. 기능 선택은 또한 치수 및 소음을 감소시킵니다.
데이터 Augmentation
데이터 낙태는 인공적으로 변화하는 적용을 통해 교육 데이터 세트의 크기를 증가시킵니다. 일반적인 방법은 플립, 회전, 또는 자르기 이미지, 데이터 포인트에 대한 소음을 추가합니다. 이 기술은 과잉을 방지하고 일반화 개선을 돕습니다.