RU2294565C2

Method and system for dynamic adaptation of speech synthesizer for increasing legibility of speech synthesized by it

Abstract

FIELD: method and system for adaptation of speech synthesizer using data received in real time scale. ^ SUBSTANCE: during realization of method and system for dynamically modifying synthesized speech on basis of inputted text and a set of values of dynamic control parameters, synthesized speech is generated. Then on basis of input signal, characterizing legibility of speech by listener perceiving it, data received in real time scale are generated, on basis of which one or several values of dynamic control parameters are modified. ^ EFFECT: increased legibility of synthesized speech. ^ 3 cl, 6 dwg

Term

Term ended

Expired 7 March 2022, 4.6 years ago.

  1. Priority
  2. Filed
  3. Granted
  4. Expired
  5. Today

30 claims: 3 independent, 27 dependent

  1. 1
    Способ модификации синтезированной речи, заключающийся в том, что на основе вводимого текста и множества значений параметров динамического управления генерируют синтезированную речь, на основе входного сигнала, характеризующего разборчивость речи воспринимающим ее слушателем, формируют поступающие в реальном масштабе времени данные и на основе этих поступающих в реальном масштабе времени данных модифицируют одно или несколько значений параметров динамического управления, в результате чего повышается разборчивость синтезированной речи, причем, по меньшей мере, один из параметров динамического управления определяют как просодический параметр, используемый для синтеза вводимого текста.
  2. 2
    Способ по п.1, в котором поступающие в реальном масштабе времени данные формируют на основе фонового шума, присутствующего в окружающем пространстве, в котором воспроизводится синтезированная речь.
  3. 3
    Способ по п.2, в котором фоновый шум преобразуют в электрический сигнал, из базы данных, в которой хранятся модели шумовых помех, выбирают одну или несколько моделей шумовых помех и на основе электрического сигнала и моделей шумовых помех определяют характеристики фонового шума, представляя их в виде поступающих в реальном масштабе времени данных.
  4. 4
    Способ по п.3, в котором электрический сигнал для определения его временных характеристик подвергают анализу во временной области.
  5. 5
    Способ по п.3, в котором электрический сигнал для определения его частотных характеристик подвергают анализу в частотной области.
  6. 6
    Способ по п.3, в котором стадия определения характеристик фонового шума предусматривает выполнение операций, выбранных из группы, преимущественно включающей выявление в фоновом шуме помех высокого уровня, выявление в фоновом шуме помех низкого уровня, выявление в фоновом шуме кратковременных помех, выявление в фоновом шуме длительных помех, выявление в фоновом шуме изменяющихся помех, выявление в фоновом шуме постоянных помех, определение пространственного местонахождения источников фонового шума, выявление потенциальных источников фонового шума и выявление речи в фоновом шуме.
  7. 7
    Способ по п.1, в котором получают поступающие в реальном масштабе времени данные, на основе поступающих в реальном масштабе времени данных определяют релевантные характеристики синтезированной речи, имеющие соответствующие относящиеся к ним параметры динамического управления, и значения параметров динамического управления изменяют в соответствии с регулировочными значениями, внося таким путем необходимые изменения в релевантные характеристики синтезированной речи.
  8. 8
    Способ по п.7, в котором в качестве релевантных характеристик синтезированной речи изменяют релевантные характеристики, описывающие особенности говорящего.
  9. 9
    Способ по п.8, в котором в качестве релевантных характеристик синтезированной речи изменяют релевантные характеристики, описывающие особенности голоса.
  10. 10
    Способ по п.9, в котором изменяемыми характеристиками являются параметры, выбранные из группы, преимущественно включающей темп речи, тембр, громкость, параметрическую ассимиляцию звуков, частоту формант и ширину полосы частот формант, образование звуков в голосовой щели, смещение энергетического спектра речи, пол, возраст и индивидуальность.
  11. 11
    Способ по п.8, в котором в качестве релевантных характеристик синтезированной речи изменяют релевантные характеристики, описывающие стиль речи.
  12. 12
    Способ по п.11, в котором изменяемыми характеристиками являются параметры, выбранные из группы, преимущественно включающей динамическую просодию и артикуляцию.
  13. 13
    Способ по п.7, в котором в качестве релевантных характеристик синтезированной речи изменяют релевантные характеристики, описывающие эмоциональность.
  14. 14
    Способ по п.13, в котором изменяемой характеристикой является актуальность воспроизводимого в виде синтезированной речи сообщения.
  15. 15
    Способ по п.7, в котором в качестве релевантных характеристик синтезированной речи изменяют релевантные характеристики, описывающие особенности выговора.
  16. 16
    Способ по п.15, в котором изменяемыми характеристиками являются параметры, выбранные из группы, преимущественно включающей произношение и артикуляцию.
  17. 17
    Способ по п.7, в котором в качестве релевантных характеристик синтезированной речи изменяют релевантные характеристики, описывающие особенности содержащейся в синтезированной речи информации.
  18. 18
    Способ по п.17, в котором изменяемыми характеристиками являются параметры, выбранные из группы, преимущественно включающей повтор, плеоназм и лексику.
  19. 19
    Способ по п.1, в котором для создания эффекта изменения пространственного местоположения источника синтезированной речи используют полифоническую обработку звука на основе поступающих в реальном масштабе времени данных.
  20. 20
    Способ по п.1, в котором поступающие в реальном масштабе времени данные формируют на основе информации, вводимой слушателем.
  21. 21
    Способ по п.1, в котором синтезированную речь используют для воспроизведения голосовых сообщений в автомобиле.
  22. 22
    Способ модификации одного или нескольких параметров динамического управления синтезатором речи, заключающийся в том, что получают поступающие в реальном масштабе времени данные, на основе этих поступающих в реальном масштабе времени данных определяют релевантные характеристики синтезированной речи, имеющие соответствующие относящиеся к ним параметры динамического управления, и значения параметров динамического управления изменяют в соответствии с регулировочными значениями, внося таким путем необходимые изменения в релевантные характеристики синтезированной речи.
  23. 23
    Способ по п.22, в котором в качестве релевантных характеристик синтезированной речи изменяют релевантные характеристики, описывающие особенности говорящего.
  24. 24
    Способ по п.23, в котором в качестве релевантных характеристик синтезированной речи изменяют релевантные характеристики, описывающие особенности голоса.
  25. 25
    Способ по п.23, в котором в качестве релевантных характеристик синтезированной речи изменяют релевантные характеристики, описывающие стиль речи.
  26. 26
    Способ по п.22, в котором в качестве релевантных характеристик синтезированной речи изменяют релевантные характеристики, описывающие эмоциональность.
  27. 27
    Способ по п.22, в котором в качестве релевантных характеристик синтезированной речи изменяют релевантные характеристики, описывающие особенности выговора.
  28. 28
    Способ по п.22, в котором в качестве релевантных характеристик синтезированной речи изменяют релевантные характеристики, описывающие особенности содержащейся в синтезированной речи информации.
  29. 29
    Система адаптации синтезатора речи, имеющая преобразующий текст в речь синтезатор, который на основе вводимого текста и множества значений параметров динамического управления генерирует синтезированную речь, систему аудиоввода, которая на основе фонового шума, присутствующего в окружающем пространстве, в котором воспроизводится синтезированная речь, формирует поступающие в реальном масштабе времени данные, и функционально связанное с этими синтезатором и системой аудиоввода устройство управления адаптацией, которое на основе поступающих в реальном масштабе времени данных модифицирует одно или несколько значений параметров динамического управления, что обеспечивает уменьшение взаимных помех между фоновым шумом и синтезированной речью.
  30. 30
    Система адаптации по п.29, в которой система аудиоввода имеет преобразователь акустического сигнала в электрический.
Independent claims30