JP4875752B2

Recognition of speech in editable audio streams

Abstract

This record has no abstract on file.

Term

Projected expiry 23 November 2027.

  1. Priority
  2. Filed
  3. Granted
  4. Today
  5. Projected expiry

23 claims: 7 independent, 16 dependent

  1. 1
    コンピュータで実現される方法であって、(A)話者の第1の音声を表す第1の部分的なオーディオストリームを生成するステップと、(B)前記第1の部分的なオーディオストリームを、前記第1の部分的なオーディオストリームが一部分であるディクテーションストリームの開始時間に相対する第1の開始時間と関連付けるステップと、(C)前記第1の部分的なオーディオストリームの終了後に続く前記話者の第2の音声を表す第2の部分的なオーディオストリームを生成するステップと、(D)前記第2の部分的なオーディオストリームを、前記第2の部分的なオーディオストリームが一部分である前記ディクテーションストリームの開始時間に相対する第2の開始時間と関連付けるステップであって、 巻き戻しの時間に対応する量によって、 前記ディクテーションストリームの開始時間に相対する、前記第1の部分的なオーディオストリームの第1の終了時間 よりも早くなるように前記第2の開始時間を設定することが可能である、 ステップと、(E)自動音声認識機器で、(1)前記第1の部分的なオーディオストリームを受信するステップと、(2)前記第1の開始時間に基づいた場所で、前記第1の部分的なオーディオストリームを有効ディクテーションストリームに書き込むステップと、(3)前記第2の部分的なオーディオストリームを受信するステップと、(4)前記第2の開始時間に基づいた場所で、前記第2の部分的なオーディオストリームを前記有効ディクテーションストリームに書き込むステップと、(5)前記(E)(4)のステップを完了する前に前記有効ディクテーションのトランスクリプトを生成するために、前記有効ディクテーションの少なくとも一部分に自動音声認識処理を適用するステップと、を含むことを特徴とする方法。
  2. 2
    前記(E)(5)のステップは、前記(E)(3)のステップの完了の前に出力を作るために、前記有効ディクテーションの少なくとも一部分に自動音声認識処理を適用するステップを含むことを特徴とする請求項1に記載の方法。
  3. 3
    前記(E)(2)のステップは、前記(C)のステップが完了する前に完了することを特徴とする請求項1に記載の方法。
  4. 4
    前記(E)(1)のステップは、前記(A)のステップが完了する前に、開始されることを特徴とする請求項1に記載の方法。
  5. 5
    前記(D)のステップは、挿入される他の部分的なオーディオストリームの時間に対応する量によって、前記第1の終了時間から前記第2の開始時間を増加させるように設定すること がさらに 可能であることを特徴とする請求項1に記載の方法。
  6. 6
    前記(E)(1)のステップは、ネットワーク上の前記第1の部分的なオーディオストリームを受信するステップを含むことを特徴とする請求項1に記載の方法。
  7. 7
    (F)前記(C)のステップの前に、前記ディクテーションストリーム上で編集操作を指定する前記話者からの入力を受信するステップと、(G)前記編集操作入力に応答して前記第1の部分的なオーディオストリームを終了し、前記第2の部分的なオーディオストリームを開始するステップと、をさらに含むことを特徴とする請求項1に記載の方法。
  8. 8
    前記(F)のステップは、前記ディクテーションストリームの相対的開始時間は、新規相対的開始時間に変更されるということを指定する前記話者からの第1の入力を受信するステップと、前記ディクテーションストリームが前記新規相対的開始時間で再開されるということを指定する前記話者からの第2の入力を受信するステップと、を含み、 前記第2の部分的なオーディオストリームの前記第2の開始時間は、前記第1の部分的なオーディオストリームの前記第1の開始時間よりも、前記ディクテーションストリームにおける開始時間に相対して早いことを特徴とする請求項7に記載の方法。
  9. 9
    前記(E)(5)のステップは、前記有効ディクテーションの少なくとも一部分を再生するステップを含むことを特徴とする請求項1に記載の方法。
  10. 10
    前記(E)(5)のステップは、前記(E)(4)のステップが完了した後にのみ、前記トランスクリプトをユーザへ表示するステップをさらに含むことを特徴とする請求項1に記載の方法。
  11. 11
    前記(E)(4)のステップは、(E)(4)(a)前記第2の部分的なオーディオストリームの前記第2の開始時間の既定の閾値内である時間で、前記有効ディクテーション内の沈黙の間としての言葉の一時停止を識別するステップと、(E)(4)(b)前記(E)(4)(a)のステップで識別された時間で、前記第2の部分的なオーディオストリームを前記有効ディクテーションに書き込むステップと、を含むことを特徴とする請求項10に記載の方法。
  12. 12
    (F)前記第1の部分的なオーディオストリームと関連付けられる文脈情報を識別するステップと、(G)前記第1の部分的なオーディオストリームの前記第1の開始時間を前記文脈情報と関連付けるステップと、(H)前記自動音声認識機器で、前記第1の部分的なオーディオストリームの前記第1の開始時間と関連する前記文脈情報を受信するステップと、をさらに含むことを特徴とする請求項1に記載の方法。
  13. 13
    前記(E)(5)のステップは、前記第1の部分的なオーディオストリームおよび前記文脈情報を反映する出力を作るために、前記第1の部分的なオーディオストリームおよび前記文脈情報に自動音声認識処理を適用するステップを含むことを特徴とする請求項12に記載の方法。
  14. 14
    前記(F)のステップは、前記文脈情報を識別する前記話者からの入力を受信するステップを含むことを特徴とする請求項12に記載の方法。
  15. 15
    前記文脈情報は、画像を含むことを特徴とする請求項12に記載の方法。
  16. 16
    装置であって、 話者の第1の音声を表す第1の部分的なオーディオストリームを生成するための第1の部分的なオーディオストリーム生成手段と、 前記第1の部分的なオーディオストリームを、前記第1の部分的なオーディオストリームが一部分であるディクテーションストリームにおける開始時間に相対する第1の開始時間と関連付けるための、第1の相対的時間手段と、 前記第1の部分的なオーディオストリームの終了後に続く前記話者の第2の音声を表す第2の部分的なオーディオストリームを生成するための第2の部分的なオーディオストリーム生成手段と、 前記第2の部分的なオーディオストリームを、前記第2の部分的なオーディオストリームが一部分である前記ディクテーションストリームにおける開始時間に相対する第2の開始時間と関連付け、 巻き戻しの時間に対応する量によって、 前記ディクテーションストリームの開始時間に相対する、前記第1の部分的なオーディオストリームの終了時間 よりも早くなるように前記第2の開始時間を 設定することが可能である、第2の相対的時間手段と、 自動音声認識機器であって、 前記第1の部分的なオーディオストリームを受信するための第1の受信手段と、 前記第1の開始時間に基づいた場所で、前記第1の部分的なオーディオストリームを有効ディクテーションストリームに書き込むための第1の書き込み手段と、 前記第2の部分的なオーディオストリームを受信するための第2の受信手段と、 前記第2の開始時間に基づいた場所で、前記第2の部分的なオーディオストリームを前記有効ディクテーションストリームに書き込むための第2の書き込み手段と、 前記第2の部分的なオーディオストリームの書き込みが完了する前に、前記有効ディクテーションのトランスクリプトを生成するために、前記有効ディクテーションの少なくとも一部分に自動音声認識処理を適用するための自動音声認識処理手段と、を含む自動音声認識機器と、を含むことを特徴とする装置。
  17. 17
    前記音声認識手段は、前記第2の部分的なオーディオストリームの受信が完了する前に、前記有効ディクテーションのトランスクリプトを生成するために、前記有効ディクテーションの少なくとも一部分に自動音声認識処理を適用するための手段を含むことを特徴とする請求項16に記載の装置。
  18. 18
    前記第1の書き込み手段は、前記第2の部分的なオーディオストリームの生成が完了する前に、前記第1の部分的なオーディオストリームを書き込むための手段を含むことを特徴とする請求項16に記載の装置。
  19. 19
    前記第1の受信手段は、前記第1の部分的なオーディオストリームの生成が完了する前に、前記第1の部分的なオーディオストリームの受信を開始するための手段を含むことを特徴とする請求項16に記載の装置。
  20. 20
    コンピュータで実行される方法であって、(A)話者の第1の音声を表す第1の部分的なオーディオストリームを生成するステップと、(B)前記第1の部分的なオーディオストリームを、前記第1の部分的なオーディオストリームが一部分であるディクテーションストリームにおける開始時間に相対する第1の開始時間と関連付けるステップと、(C)前記第1の部分的なオーディオストリームの終了後に続く前記話者の第2の音声を表す第2の部分的なオーディオストリームを生成するステップと、(D)前記第2の部分的なオーディオストリームを、前記第2の部分的なオーディオストリームが一部分である前記ディクテーションストリームにおける開始時間に相対する第2の開始時間と関連付ける ステップであって、巻き戻しの時間に対応する量によって、前記ディクテーションストリームの開始時間に相対する、前記第1の部分的なオーディオストリームの第1の終了時間よりも早くなるように前記第2の開始時間を設定することが可能である、 ステップと、(E)自動音声認識機器で、(1)ネットワーク上の前記第1の部分的なオーディオストリームを受信するステップと、(2)前記第1の開始時間に基づいた場所で、前記第1の部分的なオーディオストリームを有効ディクテーションストリームに書き込むステップと、(3)前記ネットワーク上で前記第2の部分的なオーディオストリームを受信するステップと、(4)前記第2の開始時間に基づいた場所で、前記第2の部分的なオーディオストリームを前記有効ディクテーションストリームに書き込むステップと、(5)前記(E)(4)のステップの完了の前に前記有効ディクテーションのトランスクリプトを生成するために、前記有効ディクテーションの少なくとも一部分に自動音声認識処理を適用するステップと、を含むことを特徴とする方法。
  21. 21
    (F)前記(C)のステップの前に、前記ディクテーションストリームの一時停止を指定する前記話者からの第1の入力を受信するステップと、前記ディクテーションストリームの再開を指定する前記話者からの第2の入力を受信するステップと、をさらに含むことを特徴とする請求項20に記載の方法。
  22. 22
    装置であって、 話者の第1の音声を表す第1の部分的なオーディオストリームを生成するための第1の生成手段と、 前記第1の部分的なオーディオストリームを、前記第1の部分的なオーディオストリームが一部分であるディクテーションストリームにおける開始時間に相対する第1の開始時間と関連付けるための、第1の関連付け手段と、 前記第1の部分的なオーディオストリームの終了後に続く前記話者の第2の音声を表す第2の部分的なオーディオストリームを生成するための第2の生成手段と、 前記第2の部分的なオーディオストリームを、前記第2の部分的なオーディオストリームが一部分であるディクテーションストリームにおける開始時間に相対する第2の開始時間と関連付け、 巻き戻しの時間に対応する量によって、前記ディクテーションストリームの開始時間に相対する、前記第1の部分的なオーディオストリームの終了時間よりも早くなるように前記第2の開始時間を設定することが可能である 、第2の関連付け手段と、 自動音声認識機器であって、 ネットワーク上の前記第1の部分的なオーディオストリームを受信するための第1の受信手段と、 前記第1の開始時間に基づいた場所で、前記第1の部分的なオーディオストリームを有効ディクテーションストリームに書き込むための第1の書き込み手段と、 前記ネットワーク上の前記第2の部分的なオーディオストリームを受信するための第2の受信手段と、 前記第2の開始時間に基づいた場所で、前記第2の部分的なオーディオストリームを前記有効ディクテーションストリームに書き込むための第2の書き込み手段と、 前記第2の部分的なオーディオストリームの書き込みの完了の前に、前記有効ディクテーションのトランスクリプトを生成するために、前記有効ディクテーションの少なくとも一部分に自動音声認識処理を適用するための自動音声認識処理手段と、を含む自動音声認識機器と、を含むことを特徴とする装置。
  23. 23
    前記第2の部分的なオーディオストリームの生成の前に、前記ディクテーションストリームの一時停止を指定する、前記話者からの第1の入力を受信するための第3の受信手段と、 前記ディクテーションストリームの再開を指定する前記話者からの第2の入力を受信するための第4の受信手段と、をさらに含むことを特徴とする請求項22に記載の装置。
Independent claims23