Konuşma tanıma sistemleri, yazılı metine dönüştürür. Birden çok aşamayı içerir, ses sinyalleri doğru transkriptleri oluşturmak için başlayarak.Bu makale, son derece-son konuşma sistemini tasarlayan temel bileşenleri özetlemektedir.
Signal Processing
Süreç mikrofonlar aracılığıyla ses sinyalleri yakalamayla başlar. Bu sinyaller daha sonra gürültüyü kaldırmak ve kaliteyi artırmak için işlenir. filtreleme ve normalleştirme gibi teknikler özelliği çıkarma için ses hazırlar.
Özel Ekstraksiyon
Özellikler, konuşmayı modelleme için uygun bir şekilde temsil etmek için işlenmiş sesten çıkar. Common features include Mel-frets (MFCCs) and spectrograms. Bu özellikler konuşma sesleri hakkında temel bilgileri yakalar.
Modelleme ve Decoding
Sinir ağları gibi derin öğrenme modelleri, özelliklerindeki kalıpları tanımaya eğitilmiştir. Acoustic modeller telefonmes veya altword birimleri tahmin ederken, dil modelleri kelime dizilerini tahmin etmeye yardımcı olur.Decoding algoritmaları bu modelleri en olası transkripsiyon oluşturmak için birleştirir.
Çıktı
Son adım, model tahminlerini okunabilir metine dönüştürmeyi içerir. Post-processing teknikleri doğru hataları ve transkriptiyonun doğruluğunu geliştirmektir. çıktı daha sonra kullanıcının tanınmış konuşma olarak sunuldu.