JP7465992B2

Audio data processing method and apparatus, and device and storage medium

Abstract

This record has no abstract on file.

JP7465992B2, drawing sheet 1
Sheet 1 of 21

Term

15.5 yearsleft in the term

Expires 22 March 2042.

  1. Priority
  2. Filed
  3. Granted
  4. Today
  5. Expires

17 claims: 15 independent, 2 dependent

  1. 1
    オーディオデータ処理装置によるオーディオデータ処理方法であって、 オリジナルオーディオデータを分解し、人声オーディオデータ及び背景オーディオデータを取得することと、前記人声オーディオデータに対して電気音響化処理を行い、電気音響人声データを取得することと、前記電気音響人声データと前記背景オーディオデータを合成して、目標オーディオデータを取得することと、を含 み 前記人声オーディオデータに対して電気音響化処理を行い、電気音響人声データを取得することは、 前記人声オーディオデータのオリジナルの基本周波数を抽出することと、 前記オリジナル基本周波数を補正し、第一基本周波数を取得することと、 予め定められた電気音響パラメータに基づいて、前記第一基本周波数を調整し、第二基本周波数を取得することと、 前記第二基本周波数に対して量子化処理を行い、第三基本周波数を取得することと、 前記第三基本周波数に基づいて、前記電気音響人声データを決定することと、を含み、 前記オリジナル基本周波数を補正し、第一基本周波数を取得することは、 前記人声オーディオデータを複数のオーディオセグメントに分けることと、 前記複数のオーディオセグメントにおける各オーディオセグメントに対して、前記オーディオセグメントのエネルギー及びゼロクロスレートを決定することと、 前記エネルギー及びゼロクロスレートに基づいて、前記オーディオセグメントが濁音オーディオセグメントであるか否かを決定することと、 線形補間アルゴリズムを利用して、前記濁音オーディオセグメントの基本周波数を補正することと、を含む オーディオデータ処理方法。
  2. 2
    前記オリジナルオーディオデータを分解し、背景オーディオデータ及び人声オーディオデータを取得することは、前記オリジナルオーディオデータに対応するオリジナルメルスペクトルデータを決定することと、ニューラルネットワークを用いて前記オリジナルメルスペクトルデータに対応する背景メルスペクトルデータ及び人声メルスペクトルデータを決定することと、前記背景メルスペクトルデータに基づいて、前記背景オーディオデータを生成し、かつ前記人声メルスペクトルデータに基づいて、前記人声オーディオデータを生成することと、を含む請求項1に記載の方法。
  3. 3
    前記オーディオセグメントに複数のサンプリングポイントが設置され、前記オーディオセグメントのエネルギーを決定することは、前記オーディオセグメントにおける各サンプリングポイントの数値に基づいて、前記オーディオセグメントのエネルギーを決定することを含む請求項 1 に記載のオーディオデータ処理方法。
  4. 4
    前記オーディオセグメントは複数のサンプリングポイントを含み、前記オーディオセグメントのゼロクロスレートを決定することは、前記オーディオセグメントにおける隣接する二つのサンプリングポイント毎の数値の符号が互いに逆であるか否かを決定することと、前記オーディオセグメントにおける隣接するサンプリングポイントが異なる符号である回数が全てのサンプリングポイントの個数を占める割合を決定し、前記ゼロクロスレートとすることと、を含む請求項 1 に記載の方法。
  5. 5
    前記予め定められた電気音響パラメータは、電気音響程度パラメータ及び/又は電気音響トーンパラメータを含み、前記予め定められた電気音響パラメータに基づいて、前記第一基本周波数を調整し、第二基本周波数を取得することは、前記濁音オーディオセグメントの基本周波数に基づいて、基本周波数分散及び/又は基本周波数平均値を決定することと、前記電気音響程度パラメータ及び前記基本周波数分散に基づいて、補正基本周波数分散を決定し、及び/又は、前記電気音響トーンパラメータ及び前記基本周波数平均値に基づいて、補正基本周波数平均値を決定することと、前記補正基本周波数分散及び/又は補正基本周波数平均値に基づいて、前記第一基本周波数を調整し、前記第二基本周波数を取得することと、を含む請求項 1 に記載の方法。
  6. 6
    前記第二基本周波数に対して量子化処理を行い、第三基本周波数を取得することは、以下の式に基づいて周波数範囲を決定することを含み、 ここで、前記scale は、前記周波数範囲であり、前記F0’ は、前記第二基本周波数であり、前記周波数範囲に基づいて、以下の式に基づいて前記第三基本周波数を決定し、 ここで、前記F0’’ は、前記第三基本周波数である請求項 1、 3~ 5 のいずれか一項に記載の方法。
  7. 7
    前記人声オーディオデータ及び前記第一基本周波数に基づいて、スペクトルエンベロープ及び非周期パラメータを決定することをさらに含み、ここで、前記第三基本周波数に基づいて、前記電気音響人声データを決定することは、前記第三基本周波数、前記スペクトルエンベロープ及び前記非周期パラメータに基づいて、前記電気音響人声データを決定することを含む請求項 1、 3~ 5 のいずれか一項に記載の方法。
  8. 8
    オリジナルオーディオデータを分解し、人声オーディオデータ及び背景オーディオデータを取得するための分解モジュールと、前記人声オーディオデータに対して電気音響化処理を行い、電気音響人声データを取得するための電気音響処理モジュールと、前記電気音響人声データと前記背景オーディオデータを合成し、目標オーディオデータを取得するための合成モジュールと、を含 み 前記電気音響処理モジュールは、 前記人声オーディオデータのオリジナル基本周波数を抽出するための抽出サブモジュールと、 前記オリジナル基本周波数を補正し、第一基本周波数を取得するための補正サブモジュールと、 予め定められた電気音響パラメータに基づいて、前記第一基本周波数を調整し、第二基本周波数を取得するための調整サブモジュールと、 前記第二基本周波数に対して量子化処理を行い、第三基本周波数を取得するための量子化サブモジュールと、 前記第三基本周波数に基づいて、前記電気音響人声データを決定するための電気音響決定サブモジュールと、を含み、 前記補正サブモジュールは、 前記人声オーディオデータを複数のオーディオセグメントに分けるためのセグメント化ユニットと、 前記複数のオーディオセグメントにおける各オーディオセグメントに対して、前記オーディオセグメントのエネルギーを決定するためのエネルギー決定ユニットと、 前記複数のオーディオセグメントにおける各オーディオセグメントに対して、前記オーディオセグメントのゼロクロスレートを決定するためのゼロクロスレート決定ユニットと、 前記エネルギー及びゼロクロスレートに基づいて、前記オーディオセグメントのタイプが濁音オーディオセグメントであるか否かを決定するための濁音判断ユニットと、 線形補間アルゴリズムを用いて、前記濁音オーディオセグメントの基本周波数を補正するための補正ユニットと、を含む オーディオデータ処理装置。
  9. 9
    前記分解モジュールは、前記オリジナルオーディオデータに対応するオリジナルメルスペクトルデータを決定するためのメルスペクトル決定サブモジュールと、ニューラルネットワークを用いて前記オリジナルメルスペクトルデータに対応する背景メルスペクトルデータ及び人声メルスペクトルデータを決定するための分解サブモジュールと、前記背景メルスペクトルデータに基づいて、前記背景オーディオデータを生成し、前記人声メルスペクトルデータに基づいて、前記人声オーディオデータを生成するための生成サブモジュールと、を含む請求項 8 に記載の装置。
  10. 10
    前記オーディオセグメントに複数のサンプリングポイントが設置され、前記エネルギー決定ユニットは、さらに、前記オーディオセグメントにおける各サンプリングポイントの数値に基づいて、前記オーディオセグメントのエネルギーを決定する請求項 8 に記載の装置。
  11. 11
    前記オーディオセグメントは複数のサンプリングポイントを含み、前記ゼロクロスレート決定ユニットは、さらに、前記オーディオセグメントにおける隣接する二つのサンプリングポイント毎の数値の符号が互いに逆であるか否かを決定し、前記オーディオセグメントにおける隣接するサンプリングポイントが異なる符号である回数が全てのサンプリングポイントの個数を占める割合を決定し、前記ゼロクロスレートとする請求項 8 に記載の装置。
  12. 12
    前記予め定められた電気音響パラメータは、電気音響程度パラメータ及び/又は電気音響トーンパラメータを含み、前記調整サブモジュールは、前記濁音オーディオセグメントの基本周波数に基づいて、基本周波数分散及び/又は基本周波数平均値を決定するための第一決定ユニットと、前記電気音響程度パラメータ及び前記基本周波数分散に基づいて、補正基本周波数分散を決定し、及び/又は、前記電気音響程度パラメータ及び前記基本周波数平均値に基づいて、補正ベース周波数平均値を決定するための第二決定ユニットと、前記補正基本周波数分散及び/又は補正基本周波数平均値に基づいて、前記第一基本周波数を調整し、前記第二基本周波数を取得するための調整ユニットと、を含む請求項 8 に記載の装置。
  13. 13
    前記量子化サブモジュールは、周波数範囲決定ユニットおよび第三基本周波数決定ユニットを含み、前記周波数範囲決定ユニットは、以下の式に基づいて周波数範囲を決定するために用いられ、 ここで、前記scale は、前記周波数範囲であり、前記F0’ は、前記第二基本周波数であり、前記第三基本周波数決定ユニットは、前記周波数範囲に基づいて、以下の式に基づいて前記第三基本周波数を決定するために用いられ、 ここで、前記F0’’ は、前記第三基本周波数である請求項 8、10 ~ 12 のいずれか一項に記載の装置。
  14. 14
    前記人声オーディオデータ及び前記第一基本周波数に基づいて、スペクトルエンベロープ及び非周期パラメータを決定するための決定モジュールをさらに含み、ここで、前記電気音響決定サブモジュールは、さらに、前記第三基本周波数、前記スペクトルエンベロープ及び前記非周期パラメータに基づいて、前記電気音響人声データを決定する請求項 8、10 ~ 12 のいずれか一項に記載の装置。
  15. 15
    少なくとも一つのプロセッサと、前記少なくとも一つのプロセッサと通信接続されたメモリとを含み、前記メモリは、前記少なくとも一つのプロセッサにより実行可能な命令を記憶し、前記少なくとも一つのプロセッサが請求項1- 7 のいずれか一項に記載の方法を実行することができるように、前記命令は前記少なくとも一つのプロセッサにより実行される、電子機器。
  16. 16
    コンピュータ命令を記憶した非一時的なコンピュータ可読記憶媒体であって、前記コンピュータ命令は 、コ ンピュータに請求項1- 7 のいずれか一項に記載の方法を実行させるために用いられる記憶媒体。
  17. 17
    プロセッサにより実行される時に請求項1- 7 のいずれか一項に記載の方法を実現する命令を含むコンピュータプログラム。
Independent claims17