Konuşma tanıma sistemleri, yazılı metine dönüştürür. Birden çok aşamayı içerir, ses sinyalleri doğru transkriptleri oluşturmak için başlayarak.Bu makale, son derece-son konuşma sistemini tasarlayan temel bileşenleri özetlemektedir.

Signal Processing

Süreç mikrofonlar aracılığıyla ses sinyalleri yakalamayla başlar. Bu sinyaller daha sonra gürültüyü kaldırmak ve kaliteyi artırmak için işlenir. filtreleme ve normalleştirme gibi teknikler özelliği çıkarma için ses hazırlar.

Özel Ekstraksiyon

Özellikler, konuşmayı modelleme için uygun bir şekilde temsil etmek için işlenmiş sesten çıkar. Common features include Mel-frets (MFCCs) and spectrograms. Bu özellikler konuşma sesleri hakkında temel bilgileri yakalar.

Modelleme ve Decoding

Sinir ağları gibi derin öğrenme modelleri, özelliklerindeki kalıpları tanımaya eğitilmiştir. Acoustic modeller telefonmes veya altword birimleri tahmin ederken, dil modelleri kelime dizilerini tahmin etmeye yardımcı olur.Decoding algoritmaları bu modelleri en olası transkripsiyon oluşturmak için birleştirir.

Çıktı

Son adım, model tahminlerini okunabilir metine dönüştürmeyi içerir. Post-processing teknikleri doğru hataları ve transkriptiyonun doğruluğunu geliştirmektir. çıktı daha sonra kullanıcının tanınmış konuşma olarak sunuldu.