Table of Contents
Mutual 정보는 두 변수 사이의 의존도를 평가하기 위해 사용되는 통계 측정입니다. 기능 선택에서 대상 변수에 대한 가장 관련 정보가 있는 기능을 식별하는 데 도움이됩니다. 이 방법은 가장 유익한 기능을 선택하여 모델 성능을 개선하기 위해 기계 학습에서 널리 사용됩니다.
Mutual Information이란?
Mutual information quantifies a amount of information covered about one random variable through another. 그것은 다른 하나의 변수의 지식 주어진 한 변수의 불확실한 감소를 측정. 높은 상호 정보 값은 변수 사이의 더 강한 의존성을 나타냅니다.
캘리포니아
계산은 변수의 확률 분포를 포함한다. 공식은 공동 확률 분포 및 변수의 개별 확률 분포를 기반으로합니다. 일반적인 공식은 다음과 같습니다.
I(X;Y) = Σ Σ p(x,y) 로그 (p(x,y) / (p(x) p(y)))]
위치:
- p(x,y)는 X와 Y의 공동 확률입니다.
- p(x)[ 과 ]p(y)]는 대개 확률입니다.
기능 선택에 있는 신청
기능 선택에서 상호 정보 도움말은 대상 변수에 가장 관련이 있음을 결정합니다. 더 높은 상호 정보 점수가 더 많은 정보를 고려하고 모델 교육에 우선 순위를 매기는 기능입니다. 이 과정은 차원을 줄이고 모델 효율성을 향상시킵니다.
일반적인 방법은 각 기능과 대상 사이의 상호 정보를 계산하는 다음 점수에 근거한 최고 기능을 선택. 이 접근법은 특히 높은 차원 데이터를 처리하는 데 유용합니다.