Table of Contents
활성화 기능은 중추적 네트워크에 필수적인 구성 요소이며, 모델이 복잡한 패턴을 배우기 위해 비선형성을 도입했습니다. 적절한 활성화 기능을 선택하면 모델의 성능과 훈련 효율에 크게 영향을 줄 수 있습니다. 이 문서는 알 수 있는 선택에 도움이 되는 일반적인 활성화 기능의 양적 개요를 제공합니다.
일반적인 활성화 기능
몇몇 활성화 기능은 신경 네트워크에서 널리 이용됩니다, 유일한 재산으로 각각. 그들의 quantitative 특성 이해는 특정한 일을 위한 제일 기능을 선정하는 것을 돕습니다.
성능 미터
활성화 기능을 평가하기위한 키 미터는 다음과 같습니다 :
- Gradient 흐름: 함수는 backpropagation 동안 gradients를 propagates 하는 방법을 결정합니다.
- 출력 범위: 다른 데이터 배포를 모델의 활성화 능력에 영향을 미칩니다.
- Computational Efficiency: 교육 속도와 자원 사용.
Quantitative 비교
아래는 속성에 따라 인기있는 활성화 기능의 비교입니다.
- ReLU:]는 음 입력과 선형을 위한 0을 출력합니다. 그것은 긍정적인 값에 대한 1의 글래드런트를 가지고 있으며, 딥 네트워크에 효율적으로 작업합니다.
- Sigmoid: 0과 1.의 출력을 생성하는 큰 입력 규모에 대한 기온이 감소, 이는 학습을 느리게 할 수 있습니다.
- Tanh: -1과 1. 사이 출력하지만, 0으로 중심, 일부 경우에의 융합을 개선.
- Leaky ReLU:는 "dying ReLU"문제를 줄이기 위해 부정적인 입력을 위해 작은 글래드를 허용한다.
올바른 활성화 기능 선택
선택은 특정 응용 프로그램 및 모델 아키텍처에 따라 다릅니다. 양적 분석은 ReLU와 그 변형이 일반적으로 더 빠른 훈련과 깊은 네트워크에서 더 나은 기온이 흐르는 흐름을 촉진한다는 것을 나타냅니다. Sigmoid와 tanh는 출력 층 또는 특정 작업에 적합 할 수 있습니다 경계 출력.