ES2709523T3

Method and system for scaling ducking of speech-relevant channels in multi-channel audio

Abstract

Procedure to filter a multichannel audio signal that has a voice channel and at least one channel without voice, to improve the intelligibility of the voice determined by the signal, in which said procedure includes the steps of: (a) determine at least one attenuation control value indicative of a measure of similarity between the voice related content determined by the voice channel and the voice related content determined by at least one voiceless channel of the signal of multichannel audio; and (b) attenuate at least one voiceless channel of the multichannel audio signal in response to at least one attenuation control value.

Term

4.4 yearsto projected expiry

Projected expiry 28 February 2031, counted from filing; an application has no term until it is granted.

  1. Priority
  2. Filed
  3. Published
  4. Today
  5. Projected expiry

17 claims: 4 independent, 13 dependent

  1. 1
    REIVINDICACIONES 1. Procedimiento para filtrar una senal de audio multicanal que tiene un canal de voz y al menos un canal sin voz, para mejorar la inteligibilidad de la voz determinada por la senal, en el que dicho procedimiento incluye las etapas de:(a) determinar al menos un valor de control de atenuacion indicativo de una medida de similitud entre el contenido relacionado con la voz determinado por el canal de voz y el contenido relacionado con la voz determinado por al menos un canal sin voz de la senal de audio multicanal;y (b) atenuar al menos un canal sin voz de la senal de audio multicanal en respuesta al por lo menos un valor de control de atenuacion.
  2. 2
    Procedimiento segun la reivindicacion 1, en el que cada valor de control de atenuacion determinado en la etapa (a) es indicativo de una medida de similitud entre el contenido relacionado con la voz determinado por el canal de voz y el contenido relacionado con la voz determinado por un canal sin voz de la senal de audio, y la etapa (b) incluye una etapa de atenuar dicho canal sin voz en respuesta a cada uno de dichos valores de control de atenuacion.
  3. 3
    Procedimiento segun la reivindicacion 1, en el que la etapa (a) incluye una etapa de derivar un canal sin voz derivado a partir del por lo menos un canal sin voz de la senal de audio, y el al menos un valor de control de atenuacion es indicativo de una medida de similitud entre el contenido relacionado con la voz determinado por el canal de voz y el contenido relacionado con la voz determinado por el canal sin voz derivado.
  4. 4
    Procedimiento segun la reivindicacion 3, en el que el canal sin voz derivado es derivado combinando un primer canal sin voz de la senal de audio multicanal y un segundo canal sin voz de la senal de audio multicanal.
  5. 5
    Procedimiento segun la reivindicacion 3, en el que la senal de audio multicanal tiene al menos dos canales sin voz, y la etapa (b) incluye la etapa de atenuar algunos, pero no todos, de los canales sin voz en respuesta al por lo menos un valor de control de atenuacion.
  6. 6
    Procedimiento segun la reivindicacion 3, en el que la senal de audio multicanal tiene al menos dos canales sin voz, y la etapa (b) incluye la etapa de atenuar todos los canales sin voz en respuesta al por lo menos un valor de control de atenuacion.
  7. 7
    Procedimiento segun la reivindicacion 1, en el que la etapa (b) comprende escalar una senal de control de atenuacion no procesada para el canal sin voz en respuesta al por lo menos un valor de control de atenuacion.
  8. 8
    Procedimiento segun la reivindicacion 1, en el que la etapa (a) incluye la etapa de generar una senal de control de atenuacion indicativa de una secuencia de valores de control de atenuacion, en el que cada uno de los valores de control de atenuacion es indicativo de una medida de similitud en un tiempo diferente entre el contenido relacionado con la voz determinado por el canal de voz y el contenido relacionado con la voz determinado por el al menos un canal sin voz de la senal de audio multicanal, y la etapa (b) incluye las etapas de:escalar una senal de control de ganancia de atenuacion en respuesta a la senal de control de atenuacion para generar una senal de control de ganancia escalada;y aplicar la senal de control de ganancia escalada para atenuar al menos un canal sin voz de la senal de audio multicanal.
  9. 9
    Procedimiento segun la reivindicacion 8, en el que la etapa (a) incluye una etapa de comparar una primera secuencia de caractensticas relacionadas con la voz, indicativas del contenido relacionado con la voz determinada por el canal de voz, con una segunda secuencia de caractensticas relacionadas con la voz indicativas del contenido relacionado con la voz determinada por el al menos un canal sin voz de la senal de audio multicanal para generar la senal de control de atenuacion, y cada uno de los valores de control de atenuacion indicados por la senal de control de atenuacion es indicativo de una medida de similitud en un tiempo diferente entre la primera secuencia de caractensticas relacionadas con la voz y la segunda secuencia de caractensticas relacionadas con la voz.
  10. 10
    Procedimiento segun la reivindicacion 1, en el que cada uno de dichos valores de control de atenuacion esta relacionado monotonicamente con la probabilidad de que el al menos un canal sin voz de la senal de audio multicanal sea indicativo de contenido mejorador de voz, en el que dicho contenido mejorador de voz comprende contenido que mejora la inteligibilidad u otra cualidad percibida del contenido de voz determinado por el canal de voz.
  11. 11
    Procedimiento para filtrar una senal de audio multicanal que tiene un canal de voz y al menos un canal sin voz, para mejorar la inteligibilidad de la voz determinada por la senal, en el que dicho procedimiento incluye las etapas de:(a) comparar una caractenstica del canal de voz y una caractenstica del canal sin voz para generar al menos un valor de atenuacion para controlar la atenuacion del canal sin voz con relacion al canal de voz;y (b) ajustar el al menos un valor de atenuacion en respuesta al por lo menos un valor de probabilidad de mejora de voz para generar al menos un valor de atenuacion ajustado para controlar la atenuacion del canal sin voz con relacion al canal de voz.
  12. 12
    Procedimiento segun la reivindicacion 11, en el que el al menos un valor de probabilidad de mejora de voz es una secuencia de valores de comparacion, y el procedimiento incluye una etapa de:determinar la secuencia de valores de comparacion comparando una primera secuencia de caractensticas relacionadas con la voz, indicativa del contenido relacionado con la voz determinada por el canal de voz, con una segunda secuencia de caractensticas relacionadas con la voz, indicativa del contenido relacionado con la voz determinada por el canal sin voz, en el que cada uno de los valores de comparacion es una medida de similitud en un tiempo diferente entre la primera secuencia de caractensticas relacionadas con la voz y la segunda secuencia de caractensticas relacionadas con la voz.
  13. 13
    Procedimiento segun la reivindicacion 11, en el que cada uno de dichos valores de atenuacion generado en la etapa (a) es un primer factor indicativo de una cantidad de atenuacion del canal sin voz necesario para limitar la relacion de la potencia de senal en el canal sin voz a la potencia de la senal en el canal de voz de manera que exceda un umbral predeterminado, escalado por un segundo factor relacionado monotonicamente con la probabilidad de que el canal de voz sea indicativo de voz.
  14. 14
    Procedimiento segun la reivindicacion 11, en el que cada uno de dichos valores de atenuacion generado en la etapa (a) es un primer factor indicativo de una cantidad de atenuacion del canal sin voz suficiente para causar que la inteligibilidad predicha de la voz determinada por el canal de voz en presencia del contenido determinado por el canal sin voz exceda un valor de umbral predeterminado, escalado por un segundo factor relacionado monotonicamente con la probabilidad de que el canal de voz sea indicativo de voz.
  15. 15
    Procedimiento segun la reivindicacion 11, en el que la generacion de cada uno de dichos valores de atenuacion en la etapa (a) incluye las etapas de:determinar un espectro de potencia indicativo de la potencia como una funcion de la frecuencia del canal de voz y un segundo espectro de potencia indicativo de la potencia como una funcion de la frecuencia del canal sin voz, y realizar una determinacion en el dominio de la frecuencia del valor de atenuacion en respuesta al espectro de potencia y al segundo espectro de potencia.
  16. 16
    Medio de almacenamiento legible por ordenador que comprende instrucciones, que cuando son ejecutadas con uno o mas procesadores, controlan el uno o mas procesadores para realizar el procedimiento descrito en cualquiera de las reivindicaciones 1-15.
  17. 17
    Sistema configurado para realizar un procedimiento segun cualquiera de las reivindicaciones 1-15.
Independent claims17