Mga Robotiko at mga Sistema ng Matalinong Paggamit
Pagdidisenyo ng Pangwakas na Pagpapahalaga sa Pagsasalita Sistema: mula sa Signal Proseso Tungo sa Teksto Ilabas
Table of Contents
Ang mga sistemang pagkilala ng pagsasalita ay gumagawa sa mga sinasalitang wika na maging nasusulat na teksto. ang mga ito ay kinasasangkutan ng maramihang yugto, simula sa pag-iipon ng mga signal na audio hanggang sa paglikha ng mga tumpak na transcription. binabalangkas ng artikulong ito ang mga pangunahing bahagi na kasangkot sa pagdidisenyo ng isang sistemang pang-to-end na pagkilala sa pagsasalita.
Pagposenyas
Ang proseso ay nagsisimula sa pag - ilit ng mga signal sa mikropono para maalis ang ingay at madagdagan ang kalidad nito.
Pag - aalis ng Katangian
Ang mga katangian ay nakukuha mula sa prinosesong audio upang kumatawan sa talumpati sa isang anyong angkop sa pagmomodelo. ang mga karaniwang katangian ay kinabibilangan ng Mel-frequency cepstral coficts (MFCs) at spectrograms.Ang mga tampok na ito ay kumukuha ng mahahalagang impormasyon tungkol sa mga tunog ng pagsasalita.
Pagmumodelo at Pag - aalis ng Halaga
Ang mga masusing modelo ng pag-aaral, tulad ng mga neural network, ay sinasanay upang makilala ang mga padron sa mga tampok. ang mga modelong acoustic ay humuhula ng mga phoneme o subword unit, habang ang mga modelong wika ay tumutulong sa paghula ng mga salitang pagkakasunod-sunod. ang mga modelong ito ay pinagsasama upang lumikha ng pinakaposibleng transcription.
Ilabas ang Henerasyon
Ang huling hakbang ay kinasasangkutan ng pagbago sa mga modelong prediksiyon tungo sa nababasang teksto. Post-processing na mga pamamaraan ang pag-aayos ng mga pagkakamali at pagpapabuti ng katumpakan ng transcripsyon. Ang output ay saka inihaharap sa gumagamit bilang kinikilalang talumpati.