Puhetunnistusjärjestelmät muuntavat puhutun kielen kirjalliseksi tekstiksi. Niissä on useita vaiheita, alkaen äänisignaalien tallentamisesta tarkkojen transkriptioiden tuottamiseen. Tässä artikkelissa kuvataan puheentunnistusjärjestelmän suunnitteluun liittyviä keskeisiä osia.

Signaalin käsittely

Prosessi alkaa ottamalla äänisignaaleja mikrofonien kautta. Nämä signaalit käsitellään poistaa melua ja parantaa laatua. Tekniikat, kuten suodatus ja normalisointi valmistelevat äänen ominaisuus poisto.

Ominaisuusuutot

Ominaisuudet on uutetaan käsitelty ääni edustaa puhetta muodossa sopii mallinnus. Yhteisiä ominaisuuksia ovat Mel-taajuus cepstral kertoimet (MFCC) ja spektrogrammit. Nämä ominaisuudet kaappaavat olennaista tietoa puheääniä.

Mallinnus ja purku

Syväoppiset mallit, kuten hermoverkot, on koulutettu tunnistamaan ominaisuuksia. Akustiset mallit ennustavat fonemeja tai salasanayksiköitä, kun taas kielimallit auttavat ennustamaan sanasekvenssejä. Dekoodausalgoritmit yhdistävät nämä mallit tuottaa todennäköisin transkriptio.

Tuotoksen tuottaminen

Viimeinen vaihe on muuntaa malli ennustukset luettavaksi tekstiksi. Post-processing tekniikoita korjata virheitä ja parantaa tarkkuutta transkription. Tulos esitetään käyttäjälle tunnustettu puhe.