Nova Patents
JP2014519082A

Video generation based on text

Abstract

Solution.A method of generating a video string of a person based on a character string is disclosed. The method is a step of generating a human video sequence by the processing device in order to model a visual and audible human emotional expression based on the reception of a character string. A method comprising the step of using a voice model of the person's voice to generate a voice portion of the person. The emotional expression in the visual portion of the video sequence is modeled on the prior knowledge of the person. For example, prior knowledge includes photographs and videos of the person taken in real life. [Selection diagram] Fig. 10

JP2014519082A, drawing sheet 1
Sheet 1 of 14

Term

5.6 yearsto projected expiry

Projected expiry 4 May 2032, counted from filing; an application has no term until it is granted.

  1. Priority
  2. Filed
  3. Published
  4. Today
  5. Projected expiry

24 claims: 8 independent, 16 dependent

  1. 1
    処理装置に文字列を入力するステップと、 視覚的かつ可聴的な、人の感情表現をモデル化するために、前記処理装置により、前記文字列に基づいて前記人の映像列を生成するステップであって、前記映像列の音声部分を生成するために、前記人の音声の音声モデルを用いることを有するステップとを含む方法。
  2. 2
    前記処理装置は、携帯装置であり、前記文字列は、ショートメッセージサービス(SMS)を介して第二携帯装置から入力され、 人の映像列を生成する前記ステップは、前記携帯装置と前記第二携帯装置に記録された共有情報に基づいて人の映像列を前記携帯装置により生成することを含む請求項1に記載の方法。
  3. 3
    前記文字列は、少なくとも一つの言葉を含む言葉群を有し、前記映像列は、前記人が映像列の中で言葉を発声して見えるように生成される請求項1に記載の方法。
  4. 4
    前記文字列は、発声を表現する文字を有し、前記映像列は、前記人が映像列の中で言葉を発声して見えるように生成される請求項1に記載の方法。
  5. 5
    前記文字列は、言葉と該言葉の指標とを有しており、前記指標は、前記映像列の中で前記人が前記言葉を発声して見えるとき、前記映像列の中で前記人の感情表現を同時に表示し、前記指標は、規定の指標群であり、前記規定の指標群の各指標は、異なる感情表現に関連する請求項1に記載の方法。
  6. 6
    映像列を生成する前記ステップは、前記文字列と前記人の事前知識に基づいて、視覚的かつ可聴的な、前記人の感情表現をモデル化するために、前記処理装置により人の映像列を生成することを含む請求項1に記載の方法。
  7. 7
    映像列を生成する前記ステップは、前記文字列の言葉を前記人の顔の特徴にマッピングするステップと、前記人の顔の特徴を背景上にレンダリングするステップとを含む請求項1に記載の方法。
  8. 8
    前記言葉は、前記言葉のための一又は複数の指標に基づいて前記顔の特徴にマッピングされ、前記指標は、前記映像列の中で前記人が前記言葉を発声して見えるとき、前記映像列の中で前記人の感情表現を同時に表示する請求項7に記載の方法。
  9. 9
    前記顔の特徴は、特定の前記人に適用される特定の顔の特徴を含む請求項7に記載の方法。
  10. 10
    映像列を生成する前記ステップは、前記人の顔の特徴に適合する前記人の体のジェスチャーを生成することを含む請求項7に記載の方法。
  11. 11
    映像列を生成する前記ステップは、前記人の音声に基づく音声モデルを用いて、前記文字列内の言葉に基づいて前記人の音声を表現する音声列を生成することを含む請求項1に記載の方法。
  12. 12
    文字列の受信は、リアルタイムで文字列を受信することを含み、 映像列を生成する前記ステップは、視覚的かつ可聴的な、前記人の感情表現をモデル化するために、前記文字列に基づいて人の映像列をリアルタイムで生成するステップを含み、該ステップは、前記映像列の音声部分を生成するために前記人の音声の音声モデルを用いることを含む請求項1に記載の方法。
  13. 13
    処理装置に文字列を入力するステップと、 視覚的な、人の感情表現をモデル化するために、前記処理装置により、前記文字列に基づいて前記人の映像列を生成するステップであって、前記映像列の各フレームの顔部が前記人の複数の推測画像の結合により表現されるステップと、 可聴的な、人の感情表現をモデル化するために、前記人の音声の音声モデルを用いて、前記文字列に基づいて前記人の音声列を前記処理装置により生成するステップと、 前記処理装置を用いて、前記映像列と音声列とを結合することにより前記人の映像列を生成するステップであって、前記映像列と音声列が前記文字列に基づいて同期されるステップとを含む方法。
  14. 14
    前記映像列の各フレームの顔部は、前記人の複数の推測画像の線形結合により表現され、前記人の複数の推測画像における各推測画像は、前記人の平均画像からの偏差に対応する請求項13に記載の方法。
  15. 15
    前記文字列に基づいて前記人の映像列を生成する前記ステップは、前記映像列の各フレームを2以上の領域に分割することを含み、少なくとも一つの前記領域は、前記人の推測画像の結合により表現されている請求項13に記載の方法。
  16. 16
    前記人の音声の前記音声モデルは、前記人の音声サンプルから作られる複数の音声の特徴を含み、前記複数の音声の特徴の各音声の特徴は、文字に対応する請求項13に記載の方法。
  17. 17
    前記複数の音声の特徴における各音声の特徴は、言葉、又は、音素、発声に対応する請求項16に記載の方法。
  18. 18
    前記人の音声の音声モデルは、前記人の音声サンプルから作られる複数の音声の特徴と、前記文字列に従う第二の人の音声と、前記人の音声の波形と第二の人の音声の波形との一致とを含み、前記人の音声特徴は、前記人の音声の波形と第二の人の音声の波形との前記一致に基づいて、前記第二の人の音声にマッピングされる請求項13に記載の方法。
  19. 19
    前記人の音声の音声モデルは、前記人の音声サンプルから作られる複数の音声の特徴と、前記文字列に従って、文字を音声に変換するモデルにより生成される音声と、前記人の音声の波形と文字を音声に変換するモデルの音声の波形との一致とを含み、前記人の音声特徴は、前記人の音声の波形と文字を音声に変換するモデルの音声の波形との前記一致に基づいて、前記モデルの音声にマッピングされる請求項13に記載の方法。
  20. 20
    文字列を生成するステップであって、前記文字列は、人の感情の範囲を視覚的かつ可聴的に表現するために、前記人の音声に基づく音声モデルを用いて生成される映像列の中で人が発声する一又は複数の言葉を表現するように構成されるステップと、 前記文字列内の言葉に関連する指標を特定するステップであって、前記指標は、規定の指標群の一つであり、各指標が前記人の異なる感情表現を示すように構成されるステップと、 前記指標を前記文字列に組み込むステップと、 前記映像列を生成するように構成される装置に前記文字列を送信するステップとを含む方法。
  21. 21
    指標を特定する前記ステップは、前記文字列内の言葉に関連する項目群の一覧から一項目を選択するステップを含み、前記一覧の各項目は、前記人の感情表現を示す指標である請求項20に記載の方法。
  22. 22
    指標を特定する前記ステップは、自動音声認識(ASR)装置を用いて、前記文字列内の言葉を話す話者の音声列に基づいて、前記文字列内の言葉に関連する指標を特定するステップを含む請求項20に記載の方法。
  23. 23
    非個人の複数の項目の情報を処理装置に記憶するステップと、 前記処理装置の前記非個人の複数の項目の事前情報に基づいて、前記非個人の複数の項目のための映像列を生成するステップであって、前記非個人の各項目が独立して管理可能に構成されるステップとを含む方法。
  24. 24
    前記非個人の複数の項目は、前記映像列の中で他の要素に関連して制約される請求項23に記載の方法。
Independent claims24