Table of Contents
Puhetunnistusjärjestelmät muuntavat puhutun kielen kirjalliseksi tekstiksi. Niissä on useita vaiheita, alkaen äänisignaalien tallentamisesta tarkkojen transkriptioiden tuottamiseen. Tässä artikkelissa kuvataan puheentunnistusjärjestelmän suunnitteluun liittyviä keskeisiä osia.
Signaalin käsittely
Prosessi alkaa ottamalla äänisignaaleja mikrofonien kautta. Nämä signaalit käsitellään poistaa melua ja parantaa laatua. Tekniikat, kuten suodatus ja normalisointi valmistelevat äänen ominaisuus poisto.
Ominaisuusuutot
Ominaisuudet on uutetaan käsitelty ääni edustaa puhetta muodossa sopii mallinnus. Yhteisiä ominaisuuksia ovat Mel-taajuus cepstral kertoimet (MFCC) ja spektrogrammit. Nämä ominaisuudet kaappaavat olennaista tietoa puheääniä.
Mallinnus ja purku
Syväoppiset mallit, kuten hermoverkot, on koulutettu tunnistamaan ominaisuuksia. Akustiset mallit ennustavat fonemeja tai salasanayksiköitä, kun taas kielimallit auttavat ennustamaan sanasekvenssejä. Dekoodausalgoritmit yhdistävät nämä mallit tuottaa todennäköisin transkriptio.
Tuotoksen tuottaminen
Viimeinen vaihe on muuntaa malli ennustukset luettavaksi tekstiksi. Post-processing tekniikoita korjata virheitä ja parantaa tarkkuutta transkription. Tulos esitetään käyttäjälle tunnustettu puhe.