Nova Patents
KR20180098654A

Adaptive text-to-speech outputs

Abstract

In some implementations, the language proficiency of a user of the client device is determined by one or more computers. The one or more computers then determine a text segment for output by the text-to-speech module based on the determined language proficiency of the user. After determining a text segment for output, one or more computers generate audio data comprising a synthesized utterance of the text segment. The audio data including the synthesized utterance of the text segment is then provided to the client device for output. An improved user interface is provided through better text-to-speech conversion.

KR20180098654A, drawing sheet 1
Sheet 1 of 7

Term

10.3 yearsto projected expiry

Projected expiry 29 December 2036, counted from filing; an application has no term until it is granted.

  1. Priority
  2. Filed
  3. Published
  4. Today
  5. Projected expiry

35 claims: 12 independent, 23 dependent

  1. 1
    하나 이상의 컴퓨터들에 의해 수행되는 방법으로서, 상기 하나 이상의 컴퓨터들에 의해, 클라이언트 디바이스의 사용자의 언어 능숙도를 결정하는 단계;상기 하나 이상의 컴퓨터들에 의해, 상기 사용자의 상기 결정된 언어 능숙도에 기초하여 텍스트-투-스피치 모듈에 의한 출력을 위한 텍스트 세그먼트를 결정하는 단계;상기 하나 이상의 컴퓨터들에 의해, 상기 텍스트 세그먼트의 합성된 발언을 포함하는 오디오 데이터를 생성하는 단계;상기 하나 이상의 컴퓨터들에 의해, 상기 텍스트 세그먼트의 상기 합성된 발언을 포함하는 상기 오디오 데이터를 상기 클라이언트 디바이스에 제공하는 단계를 포함하는 것을 특징으로 하는 방법.
  2. 2
    청구항 1에 있어서, 상기 클라이언트 디바이스는 텍스트-투-스피치 인터페이스를 사용하는 모바일 어플리케이션을 디스플레이하는 것을 특징으로 하는 방법.
  3. 3
    청구항 1 또는 2에 있어서, 상기 사용자의 상기 언어 능숙도를 결정하는 단계는 상기 사용자에 의해 제출된 이전의 쿼리들에 적어도 기초하여 상기 사용자의 언어 능숙도를 추론하는 것을 포함하는 것을 특징으로 하는 방법.
  4. 4
    임의의 선행하는 청구항에 있어서, 상기 텍스트-투-스피치 모듈에 의한 출력을 위한 상기 텍스트 세그먼트를 결정하는 단계는:다수의 텍스트 세그먼트들을 상기 사용자에 대한 텍스트-투-스피치 출력을 위한 후보들로서 식별하는 것, 상기 다수의 텍스트 세그먼트들은 상이한 레벨의 언어 복잡도를 가지며;및 상기 클라이언트 디바이스의 사용자의 상기 결정된 언어 능숙도에 적어도 기초하여 상기 다수의 텍스트 세그먼트들 중에서 선택하는 것을 포함하는 것을 특징으로 하는 방법.
  5. 5
    청구항 4에 있어서, 상기 다수의 텍스트 세그먼트들 중에서 선택하는 것은:상기 다수의 텍스트 세그먼트들 각각에 대해 언어 복잡도 스코어를 결정하는 것;및 상기 클라이언트 디바이스의 사용자의 상기 언어 능숙도를 기술하는 기준 스코어와 가장 잘 매칭되는 상기 언어 복잡도 스코어를 가지는 상기 텍스트 세그먼트를 선택하는 것을 포함하는 것을 특징으로 하는 방법.
  6. 6
    임의의 선행하는 청구항에 있어서, 상기 텍스트-투-스피치 모듈에 의한 출력을 위한 상기 텍스트 세그먼트를 결정하는 단계는:상기 사용자에 대한 텍스트-투-스피치 출력을 위한 텍스트 세그먼트를 식별하는 것;상기 텍스트-투-스피치 출력에 대한 상기 텍스트 세그먼트의 복잡도 스코어를 계산하는 것;및 상기 사용자의 상기 결정된 언어 능숙도 및 상기 텍스트-투-스피치 출력을 위한 텍스트 세그먼트의 상기 복잡도 스코어에 적어도 기초하여 상기 사용자에 대한 상기 텍스트-투-스피치 출력을 위한 상기 텍스트 세그먼트를 수정하는 것을 포함하는 것을 특징으로 하는 방법.
  7. 7
    청구항 6에 있어서, 상기 사용자에 대한 상기 텍스트-투-스피치 출력을 위한 상기 텍스트 세그먼트를 수정하는 것은:상기 사용자의 상기 결정된 언어 능숙도에 적어도 기초하여 상기 사용자에 대한 종합적(overall) 복잡도 스코어를 결정하는 것;상기 사용자에 대한 상기 텍스트-투-스피치 출력을 위한 상기 텍스트 세그먼트 내에서 개별 부분들에 대한 복잡도 스코어를 결정하는 것;상기 사용자에 대한 상기 종합적 복잡도 스코어보다 큰 복잡도 스코어들을 가지는 상기 텍스트 세그먼트 내의 하나 이상의 개별 부분들을 식별하는 것;및 복잡도 스코어들을 상기 종합적 복잡도 스코어 미만으로 감소시키기 위해 상기 텍스트 세그먼트 내에서 상기 하나 이상의 개별 부분들을 수정하는 것을 포함하는 것을 특징으로 하는 방법.
  8. 8
    청구항 6에 있어서, 상기 사용자에 대한 상기 텍스트-투-스피치 출력을 위한 상기 텍스트 세그먼트를 수정하는 것은:상기 사용자와 연관된 컨텍스트를 표시하는 데이터를 수신하는 것;상기 사용자와 연관된 상기 컨텍스트에 대한 종합적 복잡도 스코어를 결정하는 것;상기 텍스트 세그먼트의 상기 복잡도 스코어가 상기 사용자와 연관된 상기 컨텍스트에 대한 상기 종합적 복잡도 스코어를 초과함을 결정하는 것;및 상기 복잡도 스코어를 상기 사용자와 연관된 상기 컨텍스트에 대한 상기 종합적 복잡도 스코어 미만으로 감소시키기 위해 상기 텍스트 세그먼트를 수정하는 것을 포함하는 것을 특징으로 하는 방법.
  9. 9
    시스템으로서, 하나 이상의 컴퓨터들; 및 명령어들이 저장된 상기 하나 이상의 컴퓨터들에 연결된 비일시적 컴퓨터 판독가능 매체를 포함하며, 상기 명령어들은 상기 하나 이상의 컴퓨터들에 의해 실행될 때, 상기 하나 이상의 컴퓨터들로 하여금 동작들을 수행하게 하며, 상기 동작들은:상기 하나 이상의 컴퓨터들에 의해, 클라이언트 디바이스의 사용자의 언어 능숙도를 결정하는 동작;상기 하나 이상의 컴퓨터들에 의해, 상기 사용자의 상기 결정된 언어 능숙도에 기초하여 텍스트-투-스피치 모듈에 의한 출력을 위한 텍스트 세그먼트를 결정하는 동작;상기 하나 이상의 컴퓨터들에 의해, 상기 텍스트 세그먼트의 합성된 발언을 포함하는 오디오 데이터를 생성하는 동작;상기 하나 이상의 컴퓨터들에 의해, 상기 텍스트 세그먼트의 상기 합성된 발언을 포함하는 상기 오디오 데이터를 상기 클라이언트 디바이스에 제공하는 동작을 포함하는 것을 특징으로 하는 시스템.
  10. 10
    청구항 9에 있어서, 상기 클라이언트 디바이스는 텍스트-투-스피치 인터페이스를 사용하는 모바일 어플리케이션을 디스플레이하는 것을 특징으로 하는 시스템.
  11. 11
    청구항 9 또는 10에 있어서, 상기 사용자의 상기 언어 능숙도를 결정하는 동작은 상기 사용자에 의해 제출된 이전의 쿼리들에 적어도 기초하여 상기 사용자의 언어 능숙도를 추론하는 것을 포함하는 것을 특징으로 하는 시스템.
  12. 12
    청구항 9 내지 10 중 어느 한 항에 있어서, 상기 텍스트-투-스피치 모듈에 의한 출력을 위한 상기 텍스트 세그먼트를 결정하는 동작은:다수의 텍스트 세그먼트들을 상기 사용자에게 텍스트-투-스피치 출력을 위한 후보들로서 식별하는 것, 상기 다수의 텍스트 세그먼트들은 상이한 레벨의 언어 복잡도를 가지며;및 상기 클라이언트 디바이스의 사용자의 상기 결정된 언어 능숙도에 적어도 기초하여 상기 다수의 텍스트 세그먼트들 중에서 선택하는 것을 포함하는 것을 특징으로 하는 시스템.
  13. 13
    청구항 12에 있어서, 상기 다수의 텍스트 세그먼트들 중에서 선택하는 것은:상기 다수의 텍스트 세그먼트들 각각에 대해 언어 복잡도 스코어를 결정하는 것;및 상기 클라이언트 디바이스의 사용자의 상기 언어 능숙도를 기술하는 기준 스코어와 가장 잘 매칭되는 상기 언어 복잡도 스코어를 가지는 상기 텍스트 세그먼트를 선택하는 것을 포함하는 것을 특징으로 하는 시스템.
  14. 14
    청구항 9 내지 13 중 어느 한 항에 있어서, 상기 텍스트-투-스피치 모듈에 의한 출력을 위한 상기 텍스트 세그먼트를 결정하는 동작은:상기 사용자에 대한 텍스트-투-스피치 출력을 위한 텍스트 세그먼트를 식별하는 것;상기 텍스트-투-스피치 출력에 대한 상기 텍스트 세그먼트의 복잡도 스코어를 계산하는 것;및 상기 사용자의 상기 결정된 언어 능숙도 및 상기 텍스트-투-스피치 출력을 위한 텍스트 세그먼트의 상기 복잡도 스코어에 적어도 기초하여 상기 사용자에 대한 상기 텍스트-투-스피치 출력을 위한 상기 텍스트 세그먼트를 수정하는 것을 포함하는 것을 특징으로 하는 시스템.
  15. 15
    청구항 14에 있어서, 상기 사용자에 대한 상기 텍스트-투-스피치 출력을 위한 상기 텍스트 세그먼트를 수정하는 것은:상기 사용자의 상기 결정된 언어 능숙도에 적어도 기초하여 상기 사용자에 대한 전체적 복잡도 스코어를 결정하는 것;상기 사용자에 대한 상기 텍스트-투-스피치 출력을 위한 상기 텍스트 세그먼트 내에서 개별 부분들에 대한 복잡도 스코어를 결정하는 것;상기 사용자에 대한 상기 종합적 복잡도 스코어보다 큰 복잡도 스코어들을 가지는 상기 텍스트 세그먼트 내의 하나 이상의 개별 부분들을 식별하는 것;및 복잡도 스코어들을 상기 종합적 복잡도 스코어 미만으로 감소시키기 위해 상기 텍스트 세그먼트 내에서 상기 하나 이상의 개별 부분들을 수정하는 것을 포함하는 것을 특징으로 하는 시스템.
  16. 16
    하나 이상의 컴퓨터들에 의해 수행되는 방법으로서, 상기 사용자와 연관된 컨텍스트를 표시하는 데이터를 수신하는 단계;상기 사용자와 연관된 상기 컨텍스트에 대한 종합적 복잡도 스코어를 결정하는 단계;상기 사용자에 대한 텍스트-투-스피치 출력을 위한 텍스트 세그먼트를 식별하는 단계;상기 텍스트 세그먼트의 복잡도 스코어가 상기 사용자와 연관된 상기 컨텍스트에 대한 상기 종합적 복잡도 스코어를 초과함을 결정하는 단계;및 상기 복잡도 스코어를 상기 사용자와 연관된 상기 컨텍스트에 대한 상기 종합적 복잡도 스코어 미만으로 감소시키기 위해 상기 텍스트 세그먼트를 수정하는 단계를 포함하는 것을 특징으로 하는 방법.
  17. 17
    청구항 16에 있어서, 상기 사용자와 연관된 상기 컨텍스트에 대한 상기 종합적 복잡도 스코어를 결정하는 단계는:상기 사용자가 상기 컨텍스트에 있었던 것으로 결정된 경우 상기 사용자에 의해 이전에 제출된 쿼리들 내에 포함된 용어들을 식별하는 것;및 상기 식별된 용어들에 적어도 기초하여 상기 사용자와 연관된 상기 컨텍스트에 대한 종합적 복잡도 스코어를 결정하는 것을 포함하는 것을 특징으로 하는 방법.
  18. 18
    청구항 16 또는 17에 있어서, 상기 사용자와 연관된 상기 컨텍스트를 표시하는 상기 데이터는 상기 사용자에 의해 이전에 제출되었던 쿼리들을 포함하는 것을 특징으로 하는 방법.
  19. 19
    청구항 16 내지 18 중 어느 한 항에 있어서, 상기 사용자와 연관된 상기 컨텍스트를 표시하는 상기 데이터는 상기 사용자와 연관된 현재 위치를 표시하는 GPS 신호를 포함하는 것을 특징으로 하는 방법.
  20. 20
    청구항 16 내지 19 중 어느 한 항에 있어서, 상기 사용자와 연관된 상기 컨텍스트를 표시하는 상기 데이터는 상기 사용자의 모바일 디바이스로부터의 센서 데이터를 포함하는 것을 특징으로 하는 방법.
  21. 21
    하나 이상의 프로세싱 디바이스들에 의해 수행되는 방법으로서, 상기 하나 이상의 프로세싱 디바이스들에 의해, 디바이스에 대한 음성 입력의 복잡도 레벨을 결정하는 단계;상기 하나 이상의 프로세싱 디바이스들에 의해, 상기 음성 입력에 응답하여, 출력을 위한 메시지를 결정하는 단계, 상기 메시지는 상기 음성 입력과 연관된 상기 결정된 복잡도에 기초하여 결정되며;상기 하나 이상의 프로세싱 디바이스들에 의해, 상기 메시지의 합성된 발언을 포함하는 오디오 데이터를 생성하는 단계;및;상기 하나 이상의 프로세싱 디바이스들에 의해, 상기 음성 입력에 응답하여, 상기 합성된 발언을 포함하는 상기 오디오 데이터를 출력을 위해 제공하는 단계를 포함하는 것을 특징으로 하는 방법.
  22. 22
    청구항 21에 있어서, 상기 음성 입력의 상기 복잡도 레벨은 상기 음성 입력의 언어 복잡도를 포함하는 것을 특징으로 하는 방법.
  23. 23
    청구항 21 또는 22에 있어서, 상기 디바이스에 상기 음성 입력을 제출한 사용자의 언어 능숙도를 결정하는 단계를 더 포함하며;상기 메시지를 결정하는 단계는 상기 디바이스에 상기 음성 입력을 제출한 상기 사용자의 언어 능숙도에 기초하는 것을 특징으로 하는 방법.
  24. 24
    청구항 21 내지 23 중 어느 한 항에 있어서, 출력을 위한 상기 메시지를 결정하는 단계는:상기 음성 입력에 응답하여 출력을 위한 기본 메시지(baseline message)를 획득하는 것;및 상기 디바이스에 대한 상기 음성 입력에 대한 상기 결정된 복잡도 레벨에 기초하여 상기 기본 메시지의 복잡도 레벨을 증가시킴으로써 조절된 메시지를 생성하는 것을 포함하는 것을 특징으로 하는 방법.
  25. 25
    청구항 21에 있어서, 출력을 위한 상기 메시지를 결정하는 단계는:상기 음성 입력에 응답하여 출력을 위한 기본 메시지(baseline message)를 획득하는 것;및 상기 디바이스에 대한 상기 음성 입력에 대한 상기 결정된 복잡도 레벨에 기초하여 상기 기본 메시지의 복잡도 레벨을 감소시킴으로써 조절된 메시지를 생성하는 것을 포함하는 것을 특징으로 하는 방법.
  26. 26
    청구항 21에 있어서, 상기 디바이스는 텍스트-투-스피치 인터페이스를 사용하는 모바일 어플리케이션를 실행하는 것을 특징으로 하는 방법.
  27. 27
    하나 이상의 컴퓨터들에 의해 수행되는 방법으로서, 상기 하나 이상의 컴퓨터들에 의해, (i) 특정한 음성 입력이 제1 사용자에 의해 제공되었고 및 (ii) 상기 특정한 음성 입력이 상기 제1 사용자와는 상이한 제2 사용자에 의해 제공되었다는 것을 표시하는 데이터를 획득하는 단계;상기 하나 이상의 컴퓨터들에 의해, (i) 상기 제1 사용자에 대한 제1 언어 능숙도 스코어 및 상기 제2 사용자에 대한 제2 언어 능숙도 스코어를 결정하는 단계, 상기 제1 언어 능숙도 스코어가 상기 제2 언어 능숙도 스코어보다 높은 레벨의 언어 능숙도를 표시하며;상기 하나 이상의 컴퓨터들에 의해, (i) 상기 제1 언어 능숙도 스코어에 기초하여 제1 메시지의 합성된 발언을 포함하는 제1 오디오 데이터 및 (ii) 상기 제2 언어 능숙도 스코어에 기초하여 제2 메시지의 합성된 발언을 포함하는 제2 오디오 데이터를 생성하는 단계, 상기 제1 메시지는 상기 제2 메시지보다 높은 언어 복잡도를 가지며;및 상기 하나 이상의 컴퓨터들에 의해, (i) 상기 특정한 음성 입력에 응답하여 상기 제1 사용자의 클라이언트 디바이스에 상기 제1 오디오 데이터를 그리고 (ii) 상기 특정한 음성 입력에 응답하여 상기 제2 사용자의 클라이언트 디바이스에 상기 제2 오디오 데이터를 제공하는 단계를 포함하는 것을 특징으로 하는 방법.
  28. 28
    청구항 27에 있어서, 상기 제1 오디오 데이터를 생성하는 단계는 상기 제1 언어 능숙도 스코어에 기초하여 상기 제1 메시지의 텍스트를 결정하는 것을 포함하며, 상기 제2 오디오 데이터를 생성하는 단계는 상기 제2 언어 능숙도 스코어에 기초하여 상기 제2 메시지의 텍스트를 결정하는 것을 포함하는 것을 특징으로 하는 방법.
  29. 29
    청구항 27 또는 28에 있어서, 상기 제1 사용자의 상기 제1 언어 능숙도 및 상기 제2 사용자의 상기 제2 언어 능숙도 스코어를 결정하는 단계는 상기 제1 사용자 및 상기 제2 사용자에 의해 제출된 각각의 이전의 쿼리들에 적어도 기초하여 상기 제1 사용자 및 제2 사용자의 각각의 언어 능숙도를 추론하는 것을 포함하는 것을 특징으로 하는 방법.
  30. 30
    청구항 27 내지 29 중 어느 한 항에 있어서, 상기 제1 오디오 데이터를 생성하는 단계는:상기 제1 사용자에 대한 텍스트-투-스피치 출력을 위한 텍스트 세그먼트를 식별하는 것;상기 텍스트 세그먼트의 복잡도 스코어를 계산하는 것;및 상기 제1 사용자의 상기 제1 언어 능숙도 스코어 및 상기 텍스트-투-스피치 출력을 위한 텍스트 세그먼트의 상기 복잡도 스코어에 적어도 기초하여 상기 제1 사용자에 대한 상기 텍스트-투-스피치 출력을 위한 상기 텍스트 세그먼트를 수정하는 것을 포함하는 것을 특징으로 하는 방법.
  31. 31
    청구항 30에 있어서, 상기 제1 사용자에 대한 상기 텍스트-투-스피치 출력을 위한 상기 텍스트 세그먼트를 수정하는 것은:상기 제1 사용자의 상기 제1 언어 능숙도에 적어도 기초하여 상기 제1 사용자에 대한 종합적(overall) 복잡도 스코어를 결정하는 것;상기 제1 사용자에 대한 상기 텍스트-투-스피치 출력을 위한 상기 텍스트 세그먼트 내에서 개별 부분들에 대한 복잡도 스코어를 결정하는 것;상기 제1 사용자에 대한 상기 종합적 복잡도 스코어보다 큰 복잡도 스코어들을 가지는 상기 텍스트 세그먼트 내의 하나 이상의 개별 부분들을 식별하는 것;및 복잡도 스코어들을 상기 종합적 복잡도 스코어 미만으로 감소시키기 위해 상기 텍스트 세그먼트 내에서 상기 하나 이상의 개별 부분들을 수정하는 것을 포함하는 것을 특징으로 하는 방법.
  32. 32
    청구항 30 또는 31에 있어서, 상기 제1 사용자에 대한 상기 텍스트-투-스피치 출력을 위한 상기 텍스트 세그먼트를 수정하는 것은:상기 제1 사용자와 연관된 컨텍스트를 표시하는 데이터를 수신하는 것;상기 제1 사용자와 연관된 상기 컨텍스트에 대한 종합적 복잡도 스코어를 결정하는 것;상기 텍스트 세그먼트의 상기 복잡도 스코어가 상기 제1 사용자와 연관된 상기 컨텍스트에 대한 상기 종합적 복잡도 스코어를 초과함을 결정하는 것;및 상기 복잡도 스코어를 상기 제1 사용자와 연관된 상기 컨텍스트에 대한 상기 종합적 복잡도 스코어 미만으로 감소시키기 위해 상기 텍스트 세그먼트를 수정하는 것을 포함하는 것을 특징으로 하는 방법.
  33. 33
    청구항 27 내지 32 중 어느 한 항에 있어서, 상기 제1 오디오 데이터 및 상기 제2 오디오 데이터를 제공하는 단계는:상기 하나 이상의 컴퓨터들에 의해, (i) 컴퓨터 네트워크를 통해 상기 제1 오디오 데이터를 상기 제1 사용자의 상기 클라이언트 디바이스에 그리고 (ii) 컴퓨터 네트워크를 통해 상기 제2 오디오 데이터를 상기 제2 사용자의 상기 클라이언트 디바이스에 제공하는 것을 포함하는 것을 특징으로 하는 방법.
  34. 34
    하나 이상의 프로세싱 디바이스들 및 명령어들을 저장하는 하나 이상의 기계 판독가능 저장 디바이스들을 포함하는 시스템으로서, 상기 명령어들은 상기 하나 이상의 프로세싱 디바이스들에 의해 수행될 때, 상기 시스템으로 하여금 청구항 1 내지 9 또는 16 내지 33 중 어느 한 항의 방법을 수행하게 하는 것을 특징으로 하는 시스템.
  35. 35
    명령어들을 저장하는 하나 이상의 기계 판독가능 저장 디바이스들로서, 상기 명령어들은 하나 이상의 프로세싱 디바이스들에 의해 수행될 때, 상기 하나 이상의 프로세싱 디바이스들로 하여금 청구항 1 내지 9 또는 16 내지 33 중 어느 한 항의 방법을 수행하게 하는 것을 특징으로 하는 기계 판독가능 저장 디바이스.
Independent claims35