Table of Contents
سیستم های تشخیص گفتار زبان گفتاری را به متن نوشته شده تبدیل می کنند، آنها شامل مراحل متعدد، شروع از گرفتن سیگنال های صوتی برای تولید رونویسی دقیق است.این مقاله اجزای کلیدی درگیر در طراحی یک سیستم تشخیص گفتار نهایی به پایان می رسد.
پردازش سیگنال
این فرآیند با گرفتن سیگنال های صوتی از طریق میکروفون شروع می شود، این سیگنال ها سپس پردازش می شوند تا سر و صدا را حذف کرده و تکنیک های کیفیت مانند فیلترینگ و عادی سازی صدا را برای استخراج ویژگی آماده کنند.
استخراج
ویژگی ها از صوتی پردازش شده استخراج می شوند تا سخنرانی را به شکل مناسب برای مدل سازی نشان دهند.ویژگی های مشترک شامل ضریب های سزارین ملا- فرکانس (MFCCs) و طیفograms است.این ویژگی ها اطلاعات ضروری در مورد صداها سخنرانی را ثبت می کنند.
مدل سازی و رمزگشایی
مدل های یادگیری عمیق، مانند شبکه های عصبی، آموزش دیده اند تا الگوهای موجود در ویژگی ها را تشخیص دهند. مدل های آکوستیک پیش بینی می کنند که تلفن ها یا واحدهای زیر کلمه، در حالی که مدل های زبان به پیش بینی توالی های کلمه کمک می کنند. الگوریتم های Decode این مدل ها را برای تولید محتمل ترین رونویسی ترکیب می کنند.
نسل خروجی
گام نهایی شامل تبدیل پیش بینی های مدل به متن قابل خواندن است. تکنیک های پردازش پس از پردازش خطا درست و بهبود دقت رونویسی. خروجی سپس به کاربر به عنوان سخنرانی شناخته شده ارائه می شود.