音声認識システムは、音声をテキストに変換します。音声信号をキャプチャして正確なトランスクリプションを生成することから始めて、複数のステージが組み込まれています。この記事では、エンドツーエンドの音声認識システムの設計に関与する重要なコンポーネントについて説明します。

信号処理

プロセスは、マイクロフォンを介してオーディオ信号をキャプチャして始まります。 これらの信号は、ノイズを除去し、品質を向上させるために処理されます。 フィルタリングや正規化などの技術は、機能抽出のためのオーディオを準備します。

特徴の抽出

機能は、モデル化に適した形式でスピーチを表現するために、処理されたオーディオから抽出されます。 一般的な機能は、Mel-frequency cepstral係数(MFCC)とspectrogramsを含みます。 これらの機能は、スピーチの音に関する重要な情報をキャプチャします。

モデリングとデコード

神経ネットワークなどのディープラーニングモデルは、機能のパターンを認識するために訓練されています。 音響モデルは、言語モデルが単語のシーケンスを予測するのに役立ちますが、phonemesまたはサブワードユニットを予測します。 解読アルゴリズムは、これらのモデルを組み合わせて、最も有望なトランスクリプションを生成します。

出力生成

最終ステップはモデル予測を読み取り可能なテキストに変換することを含みます。 ポスト処理技術は正しいエラーを修正し、転写の精度を向上させる。 出力は、認識されたスピーチとしてユーザーに提示されます。