음성 인식 시스템은 음성을 작성한 텍스트로 변환합니다. 그들은 정확한 비문을 생성하기 위해 오디오 신호를 캡처하기 시작 여러 단계를 포함합니다. 이 문서는 최종 음성 인식 시스템을 설계하는 데 관련된 주요 구성 요소를 개요.

Signal 처리

이 과정은 마이크를 통해 오디오 신호를 캡처하는 데 시작됩니다. 이 신호는 소음을 제거하고 품질을 향상시킬 수 있습니다. 필터링 및 정상화와 같은 기술은 기능 추출을위한 오디오를 준비합니다.

기능 적출

기능들은 가공된 오디오에서 모델링에 적합한 형태로 연설을 나타내는 것입니다. 일반적인 기능은 Mel-frequency cepstral 계수(MFCCs) 및 spectrograms를 포함합니다. 이 기능은 연설 소리에 대한 필수 정보를 캡처합니다.

모델링 및 디코딩

신경 네트워크와 같은 딥 학습 모델은 기능의 패턴을 인식하기 위해 훈련됩니다. 어쿠스틱 모델은 폰메트 또는 하위 탭을 예측하고 언어 모델은 단어의 시퀀스를 예측하는 데 도움이되는 반면. 디코딩 알고리즘은이 모델을 결합하여 가장 유연한 비문을 생성합니다.

산출 발생

최종 단계는 읽기 쉬운 텍스트로 모델 예측을 변환하는 것입니다. 포스트 처리 기술 정확한 오류 및 transcription의 정확도를 향상시킵니다. 출력은 인식 된 연설으로 사용자에게 제시됩니다.