JP5000647B2

Multi-sensory speech enhancement using a speech-state model

Abstract

This record has no abstract on file.

JP5000647B2, drawing sheet 1
Sheet 1 of 72

Term

Term ended

Expired 13 June 2026, 0.3 years ago.

  1. Priority
  2. Filed
  3. Granted
  4. Expired
  5. Today

13 claims: 6 independent, 7 dependent

  1. 1
    雑音低減音声信号の一部を表す雑音低減値の推定値を決定する方法であって、 代替センサを使用して代替センサ信号を生成するステップと、 気導マイクロホン信号を生成するステップと、 前記代替センサ信号および前記気導マイクロホン信号を使用して、周波数成分のセットのそれぞれに関する音声状態の別個の尤度を推定し、かつ前記別個の尤度を結合して前記音声状態の前記尤度を形成することによって、音声状態S t の尤度L(S t )を推定するステップと、 前記音声状態の前記尤度を使用して として前記雑音低減値 を推定するステップであって、 ここでπ S は状態についての事後値であり、 によって与えられ、 ここで、 であり、 ここで、 であり、 であり、ここで、M * は、Mの複素共役であり、X t は雑音低減値であり、Y t は前記気導マイクロホン信号のフレームtに関する値であり、B t は前記代替センサ信号のフレームtに関する値であり、 は気導マイクロホンにおけるセンサ雑音の分散値であり、 は代替センサにおけるセンサ雑音の分散値であり、 は周囲雑音であり、Gは周囲雑音への前記代替センサのチャネル応答であり、Hはクリーン音声信号への前記代替センサの前記チャネル応答であり、Sは全ての音声状態の前記セットであり、 は音声状態を与えられた雑音低減値の確率をモデル化する分布に関する分散値である、 推定するステップとを備えることを特徴とする方法。
  2. 2
    音声状態の前記尤度の前記推定値を使用して、前記気導マイクロホン信号のフレームが音声を含むかどうか判断するステップをさらに備えることを特徴とする請求項1に記載の方法。
  3. 3
    音声を含まないと判断される前記気導マイクロホン信号のフレームを使用して雑音源の分散値を決定し、前記雑音源の前記分散値を使用して前記低減値を推定するステップをさらに備えることを特徴とする請求項2に記載の方法。
  4. 4
    前のフレームの雑音低減値の推定値と現在のフレームの前記気導マイクロホン信号のフィルタリング済みバージョンとの線形結合として前記分布の前記分散値を推定するステップをさらに含むことを特徴とする請求項1に記載の方法。
  5. 5
    前記気導マイクロホン信号の前記フィルタリング済みバージョンは、周波数に依存するフィルタを使用して形成されることを特徴とする請求項4に記載の方法。
  6. 6
    前記気導マイクロホン信号の前記フィルタリング済みバージョンは、信号対雑音比に依存するフィルタを使用して形成されることを特徴とする請求項4に記載の方法。
  7. 7
    前記雑音低減値の前記推定値を使用することによって反復を実施して、前記雑音低減値の新しい推定を形成するステップをさらに備えることを特徴とする請求項1に記載の方法。
  8. 8
    コンピュータ によって実行されると コンピュータ に以下のステップを実行させるコ プログラム を 記録した コンピュータ 読み取り可能な 記憶媒体であって、 コンピュータに、 代替センサを使用して生成された代替センサ信号を 生成 するステップと、 気 導マイクロホン信号を 生成 するステップと、 前記代替センサ信号および前記気導マイクロホン信号を使用して、周波数成分のセットのそれぞれに関する音声状態の別個の尤度を推定し、かつ前記別個の尤度を結合して前記音声状態の前記尤度を形成することによって、音声状態S t の尤度L(S t )を推定するステップと、 前記音声状態の前記尤度を使用して として前記雑音低減値 を推定するステップであって、 ここでπ S は状態についての事後値であり、 によって与えられ、 ここで、 であり、 ここで、 であり、 であり、ここで、M * は、Mの複素共役であり、X t は雑音低減値であり、Y t は前記気導マイクロホン信号のフレームtに関する値であり、B t は前記代替センサ信号のフレームtに関する値であり、 は気導マイクロホンにおけるセンサ雑音の分散値であり、 は代替センサにおけるセンサ雑音の分散値であり、 は周囲雑音であり、Gは周囲雑音への前記代替センサのチャネル応答であり、Hはクリーン音声信号への前記代替センサの前記チャネル応答であり、Sは全ての音声状態の前記セットであり、 は音声状態を与えられた雑音低減値の確率をモデル化する分布に関する分散値である、 推定するステップと を実行させる プログラム を 記録した ことを特徴とするコンピュータ 読み取り可能な 記憶媒体。
  9. 9
    音声状態の前記尤度の前記推定値を使用して、前記気導マイクロホン信号のフレームが音声を含むかどうか判断 するステップを含むことを特徴とする請求項8に記載のコンピュータ 読み取り可能な 記憶媒体。
  10. 10
    音声を含まないと判断される前記気導マイクロホン信号のフレームを使用して雑音源の分散値を決定し、前記雑音源の前記分散値を使用して前記低減値を推定するステップ を含むことを特徴とする請求項 9 に記載 の コンピュータ 読み取り可能な 記憶媒体。
  11. 11
    前のフレームの雑音低減値の推定値と現在のフレームの前記気導マイクロホン信号のフィルタリング済みバージョンとの線形結合として前記分布の前記分散値を推定するステップをさらに含む ことを特徴とする 請求項8に記載のコンピュータ読み取り可能な記憶媒体 。
  12. 12
    前記気導マイクロホン信号の前記フィルタリング済みバージョンは、周波数に依存するフィルタを使用して形成される ことを特徴とする請求項11に記載の コンピュータ読み取り可能な記憶媒体 。
  13. 13
    前記気導マイクロホン信号の前記フィルタリング済みバージョンは、信号対雑音比に依存するフィルタを使用して形成される ことを特徴とする請求項11に記載の コンピュータ読み取り可能な記憶媒体 。
Independent claims13