JP4987203B2

Distributed real time speech recognition system

Abstract

This record has no abstract on file.

JP4987203B2, drawing sheet 1
Sheet 1 of 32

Term

Term ended

Expired 10 November 2020, 5.9 years ago.

  1. Priority
  2. Filed
  3. Granted
  4. Expired
  5. Today

23 claims: 1 independent, 22 dependent

  1. 1
    クライアントコンピューティング装置に一体化されて、一乃至複数の発声単語で構成された文を含む連続 発声 音声を受信し、関連する発声音声信号を発生するサウンド処理回路と、 クライアントコンピューティング装置の一部を構成し、前記 発声 音声信号からベクトル係数の組である第一の組の音声信号を発生する第一の信号処理回路と、 サーバーコンピューティング装置の一部を構成する第二の信号処理回路と、 前記クライアントコンピューティング装置に結合されたものであって、前記第一の組の音声信号をフォーマット化し、通信チャンネルを通じて、音声発生時にリアルタイムに、前記第二の信号処理回路へ送信する送信回路とを有し、 前記送信回路では、前記第一の組の音声信号が断続することなく連続して送信され、前記第二の信号処理回路では、連続して受信した前記第一の組の音声信号に基づいてベクトル係数の組である第二の組の音声信号が生成され、 前記第一の組の音声信号と前記第二の組の音声信号を生成するのに必要とされる信号処理機能が、前記第一の信号処理回路と前記第二の信号処理回路のそれぞれにおいて利用可能とされた計算リソースに基づいて、前記送信回路で送受信可能な交信チャンネルを通じ前記第一の信号処理回路と前記第二の信号処理回路に割り当てられ、 前記信号処理機能に基づいて、前記第一の信号処理回路での前記第一の 組の 音声信号の生成と、前記第二の信号処理回路における単語の認識動作及び文の認識動作とが協働して行われることを特徴とする音声認識装置。
  2. 2
    前記第一の信号処理回路で生成される前記第一の組の音声信号が、分散認識システムの処理に基づくデータコンテントを含み、 前記第二の信号処理回路では、前記第一の組の音声信号と前記第二の組の音声信号とから複合音声 信号 を発生し、 前記第二の信号処理回路に、前記複合音声 信号 を使用して 発声 音声の単語の認識を行う単語認識回路が設けられている請求項1記載の音声認識装置。
  3. 3
    前記第二の信号処理回路に、連続 発声 音声に含まれる文を認識する文認識回路を有する請求項2に記載の音声認識装置。
  4. 4
    前記文認識回路では、予め定義された多数の文から可能性のある文の候補の組を識別し、可能性のある文の候補の組の各エントリを前記連続 発声 音声に含まれた文と比較して、各エントリの一致を判定する請求項3に記載の音声認識装置。
  5. 5
    前記文認識回路が、認識された単語上で動作する自然語エンジンを含む請求項4に記載の音声認識装置。
  6. 6
    連続 発声 音声に含まれる文は、名詞句を調べることによって可能性のある文の候補の組と比較される請求項5に記載の音声認識装置。
  7. 7
    可能性のある文の候補の組は、ユーザによって与えられた動作環境に応じて前記文認識回路によってロードされるコンテックスト辞書によって決定される請求項4に記載の音声認識装置。
  8. 8
    前記第一の信号処理回路が、前記連続 発声 音声を格納する記憶手段と、連続 発声 音声に対応する音声信号を捕捉する手段と、連続 発声 音声に含まれる前記一乃至複数の単語に相関させるには不十分な音声からある程度認識された音声 信号 を発生する第一の処理手段と、を有し、 前記第二の信号処理回路が、ある程度認識された音声 信号 から一乃至複数の単語に相関された認識可能な音声 信号 を発生する第二の処理 手段、を 有し、 前記第一及び第二の信号処理回路の処理動作に基づいて、一乃至複数の単語に相関された音声情報が得られる請求項1ないし7のいずれかに記載の音声認識装置。
  9. 9
    前記送信回路は、前記第一と第二の信号処理回路を結合する非永久データ送信接続手段である請求項1ないし8のいずれかに記載の音声認識装置。
  10. 10
    前記非永久データ送信接続手段は、交換された回路又はパケット交換接続手段である請求項9に記載の音声認識装置。
  11. 11
    前記非永久データ送信接続手段は、インターネットのネットワークを含んでいる請求項9に記載の音声認識装置。
  12. 12
    前記非永久データ送信接続手段は、ワイヤレス通信チャンネルである請求項9に記載の音声認識装置。
  13. 13
    前記第一の信号処理回路の処理動作が、連続 発声 音声からスペクトルパラメータベクトル を 抽出する動作を含む請求項1ないし12のいずれかに記載の音声認識装置。
  14. 14
    前記第一の信号処理回路の処理動作が、前記スペクトルパラメータベクトルに関するMFCC係数を得るため に、 Mel周波数転送処理によりスペクトルパラメータベクトルを分解する動作を含んでいる請求項13に記載の音声認識装置。
  15. 15
    ある程度認識された音声 信号 は、スペクトルパラメータベクトルより得られるMFCC係数とデルタ及び加速係数を含む観察ベクトルO t で構成される請求項13に記載の音声認識装置。
  16. 16
    ある程度認識された音声 信号 は、観察ベクトルO t を含み、前記第二の信号処理動作は、音声 信号 シンボルにより一連の観察ベクトルO t をマッピングするためのビタビ復号動作を含んでいる請求項8に記載の音声認識装置。
  17. 17
    前記第二の信号処理回路の処理動作が、前記音声 信号 シンボルを一乃至複数の単語テキストに変換する変換動作を含んでいる請求項1ないし16のいずれかに記載の音声認識装置。
  18. 18
    前記第二の信号処理回路の処理動作が、一乃至複数の単語のいずれ が、 前記一乃至複数の単語テキストに対応しているかを判定するクエリーを実行する請求項17記載の音声認識装置。
  19. 19
    前記第二の信号処理回路の処理動作が、一乃至複数の単語テキストのいずれが音声情報に対応しているかを判定するための環境変数を用いる請求項8に記載の音声認識装置。
  20. 20
    前記第一の信号 処理 回路では、前記 発声 音声信号から前記 発声 音声の単語の認識を可能 にする ためにそれ自体では不十分な第一の音声 信号 の組を発生し、 第一の組の音声信号を 前記送信回路の通信チャンネルの通信プロトコルと互換 性を有する フォーマット となるように 生成するとともに、サーバーコンピューティング装置に送信し、 前記第二の信号処理回路で、前記 発声 音声信号の単語を抽出する単語認識エンジンによって使用するのに十分な情報を含む第二の組の音声信号を生成し、 前記第一の組の音声信号と前記第二の組の音声信号を用いて分散音声認識が行なわれる請求項1記載の音声認識装置。
  21. 21
    前記第二の音声信号の音声 信号 が、前記第一の組の音声信号から 取り出された 音声 信号 に基づいて計算される請求項20に記載の音声認識装置。
  22. 22
    前記第一と第二の信号処理回路の信号処理の分担として、前記第一の信号処理回路は、前記 発声 音声信号から単語認識エンジンによって使用可能な形式に変換するために必要な信号処理動作の約1/2未満の処理を行うように割り当てられる請求項1に記載の音声認識装置。
  23. 23
    前記第一の信号処理回路は、第二の組の音声信号を発生するために必要な信号処理演算によって前記第二の信号処理回路を補助するように構成される請求項1に記載の音声認識装置。
Independent claims23