Ang mga sistemang pagkilala ng pagsasalita ay gumagawa sa mga sinasalitang wika na maging nasusulat na teksto. ang mga ito ay kinasasangkutan ng maramihang yugto, simula sa pag-iipon ng mga signal na audio hanggang sa paglikha ng mga tumpak na transcription. binabalangkas ng artikulong ito ang mga pangunahing bahagi na kasangkot sa pagdidisenyo ng isang sistemang pang-to-end na pagkilala sa pagsasalita.

Pagposenyas

Ang proseso ay nagsisimula sa pag - ilit ng mga signal sa mikropono para maalis ang ingay at madagdagan ang kalidad nito.

Pag - aalis ng Katangian

Ang mga katangian ay nakukuha mula sa prinosesong audio upang kumatawan sa talumpati sa isang anyong angkop sa pagmomodelo. ang mga karaniwang katangian ay kinabibilangan ng Mel-frequency cepstral coficts (MFCs) at spectrograms.Ang mga tampok na ito ay kumukuha ng mahahalagang impormasyon tungkol sa mga tunog ng pagsasalita.

Pagmumodelo at Pag - aalis ng Halaga

Ang mga masusing modelo ng pag-aaral, tulad ng mga neural network, ay sinasanay upang makilala ang mga padron sa mga tampok. ang mga modelong acoustic ay humuhula ng mga phoneme o subword unit, habang ang mga modelong wika ay tumutulong sa paghula ng mga salitang pagkakasunod-sunod. ang mga modelong ito ay pinagsasama upang lumikha ng pinakaposibleng transcription.

Ilabas ang Henerasyon

Ang huling hakbang ay kinasasangkutan ng pagbago sa mga modelong prediksiyon tungo sa nababasang teksto. Post-processing na mga pamamaraan ang pag-aayos ng mga pagkakamali at pagpapabuti ng katumpakan ng transcripsyon. Ang output ay saka inihaharap sa gumagamit bilang kinikilalang talumpati.