Table of Contents
Unsupervised Learning은 모델이 라벨이 붙은 결과없이 데이터를 식별하는 기계 학습 유형입니다. 강력한 동안 결과의 품질에 영향을 줄 수있는 여러 가지 도전을 제시합니다. 일반적인 pitfalls를 이해하고 실제 데이터와 관련하여 실제 데이터에 대한 주소는 효과적인 구현에 필수적입니다.
Unsupervised Learning의 일반적인 Pitfalls
한 가지 빈번한 문제는 부적절한 기능을 선택. Irrelevant 또는 noisy 기능은 가난한 클러스터링 또는 치수 감소 결과에 선도하는 의미있는 패턴을 손상시킬 수 있습니다. 또 다른 일반적인 문제는 클러스터 또는 구성 요소의 잘못된 숫자를 선택하여 과잉 또는 하향을 일으킬 수 있습니다.
또한 데이터 품질은 크게 결과를 초래합니다. 값, 아웃렛 및 인접 데이터는 학습 프로세스를 찡그림시킬 수 있습니다. 소음과 치수의 저주도 모델 성능을 방해하는 것과 동일한 과제입니다.
Real Data와 이러한 문제를 수정하는 방법
기능 선택 문제 해결하기 위해 도메인 지식과 기능 엔지니어링을 사용하여 관련 변수를 식별합니다. Principal Component Analysis (PCA)와 같은 기술은 치수 및 소음을 줄이고 모델 선명도를 개선합니다.
클러스터의 최적의 수를 결정하는 것은 다른 구성에 걸쳐 모델 성능을 평가하는 팔꿈치 방법 또는 실루엣 분석과 같은 방법을 통해 달성 될 수 있습니다.
데이터 품질 관리는 누락된 값, 제거 아웃 런, 및 정상화 데이터를 처리하여 데이터셋을 청소하는 데 사용됩니다. 실제 데이터 통합은 모델이 더 정확한 결과를 이끌어내는 것보다 의미있는 패턴을 배워줍니다.
Real Data를 사용하는 모범 사례
항상 데이터를 검증하기 전에 unsupervised 알고리즘을 적용하십시오. 데이터 배포를 이해하고 anomalies를 식별하기 위해 시각화 도구를 사용합니다. 새로운 데이터와 함께 정기적으로 업데이트 모델은 재발성 및 정확성을 유지합니다.
- 도메인 전문성을 바탕으로 한 기능 엔지니어링
- Model Parameter를 선택하기 위한 Validation 기법을 사용
- 깨끗하고 사전 처리 데이터
- 초기에 문제를 감지하는 데이터 시각화
- 실제 데이터 업데이트와 함께 Iterate 및 refine 모델