Hệ thống nhận diện giọng nói chuyển đổi ngôn ngữ nói sang văn bản. Chúng bao gồm nhiều giai đoạn, bắt đầu từ việc ghi lại tín hiệu âm thanh để tạo bản sao chính xác. Bài này vạch ra các thành phần then chốt liên quan đến việc thiết kế hệ thống nhận diện giọng nói kết thúc.

Tiến trình xử lý tín hiệu

Quá trình bắt đầu bằng việc lấy tín hiệu âm thanh qua micro. Những tín hiệu này được xử lý để gỡ bỏ nhiễu và tăng chất lượng. Những kỹ thuật như lọc và chuẩn bị âm thanh để lấy tính năng.

Rút ra tính năng

Tính năng được chiết xuất từ âm thanh được xử lý để đại diện giọng nói dưới dạng thích hợp cho mô hình. Tính năng thông thường bao gồm hệ số tần số Mel (MFCCs) và các chữ số quang phổ. Những tính năng này thu thông tin thiết yếu về âm thanh.

Làm gương và giải mã

Mô hình chữ nhật dự đoán số hoặc đơn vị chữ, trong khi mô hình ngôn ngữ giúp dự đoán chuỗi từ.

Thế hệ xuất

Bước cuối cùng bao gồm chuyển đổi dự đoán mô hình thành văn bản có thể đọc được. Các kỹ thuật xử lý sau khi sửa lỗi và cải thiện độ chính xác của việc chuyển đổi. Kết quả được trình bày cho người dùng sau đó là bài phát âm được công nhận.