ES2717606T3

Scalable compressed audio bit stream and codec using a hierarchical filterbank and multichannel joint coding

Abstract

A method of reconstructing a time domain output audio signal from an encoded bit stream, comprising: receive a scaled bit stream (599) having a predetermined data rate within a given interval as a sequence of frames, each frame containing at least one of the following and at least some of the frames containing all of the following (a) a plurality of quantized tonal components (2407) representing frequency domain contents at different frequency resolutions of an input signal, b) quantized residual time sample components (2403) representing a time domain residual formed from the difference between reconstructed tonal components and an input signal and c) scale factor grids (2404) representing signal energies of a residual signal formed from the difference between reconstructed tonal components and an input signal, wherein the scale factor grids (2404) extend at least partially over a frequency range of the input signal; receiving information (599) for each frame about the position of the quantized components and/or grids within the frequency interval; parsing the frames of the scaled bitstream into the components and grids (600); decoding any tonal component to form transform coefficients (2408); decode any time sample component and any grid (2401-2405); multiplying the time sample components by grid elements to form time domain samples (2406); and applying an inverse hierarchical filter bank (2400) to the transform coefficients (2407) and time domain samples (4002) to reconstruct a time domain output audio signal (614).

ES2717606T3, drawing sheet 1
Sheet 1 of 12

Term

Term ended

Projected expiry passed 16 June 2026, 0.3 years ago.

  1. Priority
  2. Filed
  3. Published
  4. Projected expiry
  5. Today

35 claims: 4 independent, 31 dependent

  1. 1
    REIVINDICACIONES 1. Un procedimiento de reconstrucción de una señal de audio de salida de dominio de tiempo a partir de un flujo de bits codificado, que comprende:recibir un flujo (599) de bits escalado que tiene una tasa de datos predeterminada dentro de un intervalo dado como una secuencia de tramas, conteniendo cada trama al menos uno de los siguientes y conteniendo al menos algunas de las tramas todos los siguientes (a) una pluralidad de componentes (2407) tonales cuantificados que representan contenidos de dominio de frecuencia a diferentes resoluciones de frecuencia de una señal de entrada, b) componentes (2403) de muestra de tiempo residuales cuantificados que representan un residual de dominio de tiempo formado a partir de la diferencia entre componentes tonales reconstruidos y una señal de entrada y c) cuadrículas de factor de escala (2404) que representan energías de señal de una señal residual formada a partir de la diferencia entre componentes tonales reconstruidos y una señal de entrada, en el que las cuadrículas (2404) de factor de escala se extienden al menos parcialmente en un intervalo de frecuencia de la señal de entrada;recibir información (599) para cada trama acerca de la posición de los componentes cuantificados y/o cuadrículas dentro del intervalo de frecuencia;analizar las tramas del flujo de bits escalado en los componentes y cuadrículas (600);decodificar cualquier componente tonal para formar coeficientes (2408) de transformada;decodificar cualquier componente de muestra de tiempo y cualquier cuadrícula (2401-2405);multiplicar los componentes de muestra de tiempo por elementos de cuadrícula para formar muestras (2406) de dominio tiempo;y aplicar un banco (2400) de filtros jerárquico inverso a los coeficientes (2407) de transformada y muestras (4002) de dominio tiempo para reconstruir una señal (614) de audio de salida de dominio de tiempo.
  2. 2
    El procedimiento de la reivindicación 1, en el que las muestras de dominio tiempo se forman mediante, el análisis del flujo de bits en una cuadrícula (2404) de factor de escala G1 y los componentes (2403) de muestra de tiempo;la decodificación y cuantificación inversa de la cuadrícula de factor de escala de cuadrícula G1 para producir una cuadrícula (2405) de factor de escala G0;y la decodificación y cuantificación inversa de los componentes de muestra de tiempo, multiplicando esos valores de muestra de tiempo por valores (2406) de cuadrícula de factor de escala G0 para producir muestra (4002) de tiempo reconstruida.
  3. 3
    El procedimiento de la reivindicación 2, en el que la señal es una señal multicanal en la que los canales residuales se han agrupado y codificado, conteniendo también cada una de dichas tramas d) cuadrículas parciales que representan las relaciones de energía de señal de los canales de señal residuales dentro de grupos de canales comprendiendo además:analizar el flujo de bits en las cuadrículas (508) parciales;decodificar y cuantificar (2401) inversamente las cuadrículas parciales;y multiplicar las muestras de tiempo reconstruidas por la cuadrícula (508) parcial aplicada a cada canal secundario en un grupo de canales para producir las muestras de dominio tiempo reconstruidas.
  4. 4
    El procedimiento de la reivindicación 1, en el que la señal de entrada es multicanal en la que grupos de componentes tonales que contienen un canal primario y uno o más canales secundarios, conteniendo también cada una de dichas tramas e) una máscara de bits asociada con el canal primario en cada grupo en el que cada bit identifica la presencia de un canal secundario que se ha codificado conjuntamente con el canal primario, analizar el flujo de bits en las máscaras (3602) de bits;decodificar los componentes tonales para el canal primario en cada grupo (601);decodificar los componentes tonales conjuntamente codificados en cada grupo (601);para cada grupo, usar la máscara de bits para reconstruir los componentes tonales para cada uno de dichos canales secundarios a partir de los componente tonales de canal primario y los componentes (601) tonales conjuntamente codificados.
  5. 5
    El procedimiento de la reivindicación 4, en el que los componentes tonales de canal secundario se decodifican decodificando la información de diferencia entre las frecuencias primarias y secundarias, decodificándose por entropía y almacenándose amplitudes y fases para cada canal secundario en el que el componente tonal está presente.
  6. 6
    El procedimiento de la reivindicación 1, en el que el banco (2400) de filtros jerárquico inverso reconstruye la señal (614) de audio de salida transformando las muestras (4002) de dominio tiempo en coeficientes (2411) de transformada residuales, combinando (2412) los mismos con los coeficientes (2409) de transformada para un conjunto de componentes (2407) tonales a una resolución de frecuencia baja y transformado inversamente (2413) los coeficientes de transformada combinados para formar una señal (2415) de audio de salida parcialmente reconstruida, y repitiendo las etapas en esta señal de audio de salida parcialmente reconstruida con los coeficientes de transformada para otro conjunto de componentes tonales a la siguiente resolución de frecuencia más alta hasta que se reconstruya la señal (614) de audio de salida.
  7. 7
    El procedimiento de la reivindicación 6, en el que las muestras de dominio tiempo se representan como subbandas, reconstruyendo dicho banco de filtros jerárquico inverso la señal de audio de salida de dominio de tiempo mediante:a) la formación en ventanas de la señal o señales en cada una de las subbandas de dominio de tiempo de la trama de entrada para formar subbandas (2410) de tiempo de dominio formadas en ventana;b) la aplicación de una transformada de dominio de tiempo a frecuencia a cada una de las subbandas de tiempo de dominio formadas en ventana para formar coeficientes (2411) de transformada;c) la concatenación de los coeficientes de transformada resultantes para formar conjunto o conjuntos más grandes de los coeficientes (2411) de transformada residuales;d) sintetizar los coeficientes de transformada del conjunto de componentes (2409) tonales;e) la combinación de los coeficientes de transformada reconstruidos a partir de los componentes tonales y de dominio de tiempo en un único conjunto de coeficientes (2412) de transformada combinados;f) la aplicación de una transformada inversa a los coeficientes (2413) de transformada combinados, formando en ventanas y añadiendo solapamiento (2414) con la trama anterior para reconstruir una señal de dominio de tiempo parcialmente reconstruida (2415);y g) la aplicación de iteraciones sucesivas de las etapas (a) a (f) en la señal o señales de dominio de tiempo parcialmente reconstruida(s) usando el siguiente conjunto de componentes (2407) tonales hasta que se reconstruya la señal (614) de audio de salida de dominio de tiempo.
  8. 8
    El procedimiento de la reivindicación 6, en el que cada trama de entrada contiene Mi muestras de tiempo en cada una de las P subbandas, realizando dicho banco de filtros jerárquico inverso las siguientes etapas:a) en cada subbanda i, almacenar en memoria intermedia y concatenar las Mi muestras anteriores con las Mi muestras actuales para producir 2* Mi nuevas muestras (4004);b) en cada subbanda i, multiplicar las 2* Mi muestras de subbanda por una función de ventana de 2* Mi puntos (4006);c) aplicar una transformada de (2* Mi) puntos a las muestras de subbanda para producir Mi coeficientes de transformada para cada subbanda i (4008);d) concatenar los Mi coeficientes de transformada para cada subbanda i para formar un único conjunto de N/2 coeficientes (4010);e) sintetizar los coeficientes de transformada tonales a partir del conjunto decodificado e inversamente cuantificado de componentes tonales y combinar los mismos con los coeficientes concatenados de la etapa anterior para formar un único conjunto de coeficientes (2407, 2408, 2409, 2412) concatenados combinados;f) aplicar una transformada inversa de N puntos a los coeficientes concatenados combinados para producir N muestras (4012);g) multiplicar cada trama de N muestras por una función de ventana de N muestras para producir N muestras (4014) formadas en ventanas;h) añadir por superposición las muestras (4014) formadas en ventanas resultantes para producir N/2 nuevas muestras de salida en el nivel de subbanda dado como la señal (4016) de audio de salida parcialmente reconstruida;y i) repetir las etapas (a)-(h) en las N/2 nuevas muestras de salida usando el siguiente conjunto de componentes (2407) tonales hasta que se hayan procesado todas las subbandas y las N muestras de tiempo originales sean reconstruidas como la señal (614) de audio de salida.
  9. 9
    Un decodificador para reconstrucción de una señal de audio de salida de dominio de tiempo a partir de un flujo de bits codificado, que comprende:un analizador (600) de flujo de bits para analizar cada trama de un flujo de bits escalado en sus componentes de audio, conteniendo cada trama al menos uno de los siguientes y conteniendo al menos algunas de las tramas todos los siguientes (a) una pluralidad de componentes tonales cuantificados que representan contenidos de dominio de frecuencia a diferentes resoluciones de frecuencia de una señal de entrada, b) componentes de muestra de tiempo residuales cuantificados que representan un residual de dominio de tiempo formado a partir de la diferencia entre componentes tonales reconstruidos y una señal de entrada y c) cuadrículas de factor de escala que representan energías de señal de una señal residual formada a partir de la diferencia entre los componentes tonales reconstruidos y una señal de entrada;un decodificador (602) residual para codificar cualquier componente de muestra de tiempo y cualquier cuadrícula para reconstruir muestras de tiempo;un decodificador (601) tonal para decodificar cualquier componente tonal para formar coeficientes de transformada;y un banco (2400) de filtros jerárquico inverso que reconstruye la señal de salida transformando las muestras de tiempo en coeficientes de transformada residuales, combinando los mismos con los coeficientes de transformada para un conjunto de los componentes tonales a una resolución de frecuencia baja y transformado inversamente los coeficientes de transformada combinados para formar una señal de salida parcialmente reconstruida, y repitiendo las etapas en esta señal de salida parcialmente reconstruida con los coeficientes de transformada para otro conjunto de componentes tonales a la siguiente resolución de frecuencia más alta hasta que la señal de audio de salida se reconstruya.
  10. 10
    El decodificador de la reivindicación 9, en el que cada trama de entrada contiene Mi muestras de tiempo en cada una de las P subbandas, realizando dicho banco de filtros jerárquico inverso las siguientes etapas:a) en cada subbanda i, almacenar en memoria intermedia y concatenar las Mi muestras anteriores con las Mi muestras actuales para producir 2* Mi nuevas muestras (4004);b) en cada subbanda i, multiplicar las 2* Mi muestras de subbanda por una función (4006) de ventana de 2* Mi puntos;c) aplicar una transformada de (2* Mi) puntos a las muestras de subbanda para producir Mi coeficientes de transformada residuales para cada subbanda i (4008);d) concatenar los Mi coeficientes de transformada residuales para cada subbanda i para formar un único conjunto de N/2 coeficientes (4010);e) sintetizar los coeficientes de transformada tonales a partir del conjunto decodificado e inversamente cuantificado de componentes tonales y combinar los mismos con los coeficientes de transformada residuales concatenados para formar un único conjunto de coeficientes (2407, 2408, 2409, 2412) concatenados combinados;f) aplicar una transformada inversa de N puntos a los coeficientes concatenados combinados para producir N muestras (4012);g) multiplicar cada trama de N muestras por una función de ventana de N muestras para producir N muestras (4014) formadas en ventanas;h) añadir por superposición las muestras (4014) formadas en ventanas resultantes para producir N/2 nuevas muestras de salida en el nivel de subbanda dado como la señal (4016) de salida parcialmente reconstruida;y i) repetir las etapas (a)-(h) en las N/2 nuevas muestras de salida usando el siguiente conjunto de componentes (2407) tonales hasta que se hayan procesado todas las subbandas y las N muestras de tiempo originales sean reconstruidas como la señal (614) de salida.
  11. 11
    Un procedimiento de codificación de una señal de audio de entrada para formar un flujo (116) de bits escalable, que comprende:usar un banco (2101a,... 2101e) de filtros jerárquico (HFB) para descomponer una señal (100) de audio de entrada en una representación de tiempo/frecuencia de múltiples resoluciones;extraer componentes tonales en cada iteración del HFB en múltiples resoluciones de frecuencia de la representación (2109) de tiempo/frecuencia;extraer componentes residuales (2117, 2118, 2119) de la representación de tiempo/frecuencia eliminando componentes tonales de la señal de entrada para pasar una señal residual a la siguiente iteración del HFB y extrayendo los componentes residuales (2117, 2118, 2119) de la señal residual final;clasificando los componentes en base a su contribución relativa a la calidad (103, 107, 109) de señal decodificada;cuantificar y codificar los componentes (102, 107, 108);formar un flujo (126) de bits maestro que incluye los componentes (109) cuantificados clasificados, y escalar el flujo (126) de bits maestro eliminando un número suficiente de componentes (115) codificados de menor clasificación para formar el flujo (116) de bits escalado que tiene una tasa de datos menor que o aproximadamente igual a una tasa de datos deseada, en el que los componentes se clasifican y cuantifican con referencia a la misma función de enmascaramiento o diferentes criterios psicoacústicos, y en el que el flujo de bits escalado incluye información que indica la posición de los componentes en el espectro de frecuencia.
  12. 12
    El procedimiento de la reivindicación 11, en el que los componentes se clasifican agrupando primero los componentes tonales en al menos un subdominio (903, 904, 905, 906, 907) de frecuencia a diferentes resoluciones de frecuencia y agrupando los componentes residuales en al menos un subdominio (908, 909, 910) residual en diferentes escalas de tiempo y/o resoluciones de frecuencia, clasificando los subdominios en base a su contribución relativa a la calidad de señal decodificada y clasificando los componentes dentro de cada subdominio en base a su contribución relativa a la calidad de señal decodificada.
  13. 13
    El procedimiento de la reivindicación 12, que comprende adicionalmente:formar el flujo (126) de bits maestro en el que los subdominios y componentes dentro de cada subdominio se ordenan en base a su clasificación (109), eliminándose dichos componentes de baja clasificación comenzando con el componente de clasificación más baja en el subdominio de clasificación más baja y eliminando componentes en orden hasta que se consiga (115) la tasa de datos deseada .
  14. 14
    El procedimiento de la reivindicación 11, en el que el flujo (116) de bits escalado se graba en o se transmite a través de un canal que tiene la tasa de datos deseada como una restricción.
  15. 15
    El procedimiento de la reivindicación 14, en el que el flujo (116) de bits escalado es uno de los múltiples flujos de bits escalados y la tasa de datos de cada flujo de bits individual se controla independientemente, con la restricción de que la suma de las tasas de datos individuales no debe exceder una tasa de datos total máxima, controlándose dinámicamente cada una de dichas tasas de datos en tiempo de acuerdo con la calidad de señal decodificada a través de todos los flujos de bits.
  16. 16
    El procedimiento de la reivindicación 11, por el que componentes tonales que se eliminan para formar el flujo de bits escalado también se eliminan (2112) de la señal (2114) residual.
  17. 17
    El procedimiento de la reivindicación 11, en el que los componentes residuales incluyen componentes (2117) de muestra de tiempo y componentes (2118, 2119) de factor de escala que modifican los componentes de muestra de tiempo en diferentes escalas de tiempo y/o resoluciones de frecuencia.
  18. 18
    El procedimiento de la reivindicación 17, en el que los componentes de muestra de tiempo se representan mediante una cuadrícula G (2117) y los componentes de factor de escala comprenden una serie de una o más cuadrículas G0, G1 (2118, 2119) en múltiples escalas de tiempo y resoluciones de frecuencia que se aplican a los componentes de muestra de tiempo dividiendo la cuadrícula G por elementos de cuadrícula de G0, G1 en el plano de tiempo/frecuencia, teniendo cada cuadrícula G0, G1 un número diferente de factores de escala en tiempo y/o frecuencia.
  19. 19
    El procedimiento de la reivindicación 17, en el que los factores de escala se codifican (107) aplicando una transformación bidimensional a los componentes de factor de escala y cuantificando los coeficientes de transformada.
  20. 20
    El procedimiento de la reivindicación 19, en el que la transformada es una Transformada de Coseno Discreta bidimensional.
  21. 21
    Un procedimiento de la reivindicación 11, en el que el HFB descompone la señal de audio de entrada en coeficientes de transformada en niveles de resolución de frecuencia sucesivamente más bajos en iteraciones sucesivas, en el que dichos componentes tonales y residuales se extraen mediante:la extracción de componentes (2109) tonales de los coeficientes de transformada en cada iteración, cuantificando (2110) y almacenando los componentes tonales extraídos en una lista (2106) de tonos;la eliminación de los componentes (2111, 2112) tonales de la señal de audio de entrada para pasar una señal (2114) residual a la siguiente iteración del HFB;y la aplicación de una transformada (2115) inversa final con resolución de frecuencia relativamente menor que la iteración final del HFB a la señal (113) residual para extraer los componentes (2117) residuales.
  22. 22
    El procedimiento de la reivindicación 21, que comprende adicionalmente:eliminar algunos de los componentes (114) tonales de la lista de tonos después de la iteración final;y decodificar y cuantificar (104) inversamente localmente los componentes (114) tonales cuantificados eliminados, y combinar (105) los mismos con la señal (111) residual en la iteración final.
  23. 23
    El procedimiento de la reivindicación 22, en el que al menos algunos de los componentes tonales relativamente fuertes eliminados de la lista no se decodifican localmente ni se recombinan.
  24. 24
    El procedimiento de la reivindicación 21, en el que los componentes tonales en cada resolución de frecuencia se extraen (2109) mediante:la identificación de los componentes tonales deseados a través de aplicación de un modelo perceptual;la selección del más perceptualmente significativo de los coeficientes de transformada;el almacenamiento de parámetros de cada coeficiente de transformada seleccionado como el componente tonal, incluyendo dichos parámetros la amplitud, frecuencia, fase y posición en la trama del correspondiente coeficiente de transformada;y la cuantificación y codificación (2110) de los parámetros para cada componente tonal en la lista de tonos para inserción en el flujo de bits.
  25. 25
    El procedimiento de la reivindicación 21, en el que los componentes residuales incluyen componentes de muestra de tiempo representados como una cuadrícula G (2117), la extracción de los componentes residuales comprende además:construir una o más cuadrículas (2118, 2119) de factor de escala de diferentes resoluciones de tiempo/frecuencia, cuyos elementos representan valores de señal máximos o energías de señales en una región de tiempo/frecuencia;dividir los elementos de cuadrícula G de muestra de tiempo mediante correspondientes elementos de las cuadrículas de factor de escala para producir una cuadrícula G (2120) de muestra de tiempo escalada;y cuantificar y codificar la cuadrícula G (2122) de muestra de tiempo escalada y cuadrículas (2121) de factor de escala para inserción en el flujo de bits codificado.
  26. 26
    El procedimiento de la reivindicación 11, en el que la señal de audio de entrada se descompone y los componentes tonales y residuales se extraen mediante, (a) el almacenamiento en memoria intermedia de muestras de la señal de audio de entrada en tramas de N muestras (2900);(b) la multiplicación de las N muestras en cada trama por una función de ventana de N muestras (2900);(c) la aplicación de una transformada de N puntos para producir N/2 coeficientes de transformada originales (2902);(d) la extracción de componentes tonales de los N/2 coeficientes (2109) de transformada originales, cuantificando (2110) y almacenando los componentes tonales extraídos en una lista (2106) de tonos;(e) la resta de los componentes tonales cuantificando inversamente (2111) y restando los coeficientes de transformada tonales resultantes de los coeficientes de transformada originales (2112) para proporcionar N/2 coeficientes de transformada residuales;(f) la división de los N/2 coeficientes de transformada residuales en P grupos de M¡ coeficientes (2906), de tal p forma que la suma de los M¡ coeficientes es N/2 ( = N /2 ;) i=1 (g) para cada uno de los P grupos, la aplicación de una transformada inversa de (2* Mi) puntos a los coeficientes de transformada residuales para producir (2* Mi) muestras de subbanda desde cada grupo (2906);(h) en cada subbanda, la multiplicación de las 2* Mi muestras de subbanda por una función de ventana de 2* Mi puntos (2908);(i) en cada subbanda, la superposición con Mi muestras anteriores y la adición de los valores correspondientes para producir Mi nuevas muestras para cada subbanda (2910);(j) la repetición de las etapas (a)-(i) en una o más de las subbandas de Mi nuevas muestras usando tamaños N de transformada sucesivamente más pequeños (2912) hasta que la resolución de tiempo/transformada deseada se logre (29014);y (k) la aplicación de una transformada (2115) inversa final con resolución N de frecuencia relativamente menor a las Mi nuevas muestras para cada salida de subbanda en la iteración final para producir subbandas de muestras de tiempo en una cuadrícula G de subbandas y múltiples muestras de tiempo en cada subbanda.
  27. 27
    El procedimiento de la reivindicación 11, en el que la señal de audio de entrada es una señal de audio de entrada multicanal, codificándose juntos cada uno de dichos componentes tonales formando grupos de dichos canales y para cada uno de dichos grupos, seleccionar un canal primario y al menos un canal secundario, que se identifican a través de una máscara (3602) de bits, identificando cada bit la presencia de un canal secundario, cuantificar y codificar el canal primario (102, 108);y cuantificar y codificar la diferencia entre el canal primario y cada canal secundario (102, 108).
  28. 28
    El procedimiento de la reivindicación 27, en el que se selecciona un modo de canal conjunto de codificación de cada grupo de canales en base a una métrica que indica qué modo proporciona la menor distorsión percibida para la tasa de datos deseada en la señal de salida decodificada.
  29. 29
    El procedimiento de la reivindicación 11, en el que la señal de audio de entrada es una señal multicanal, comprendiendo adicionalmente:restar los componentes tonales extraídos de la señal de audio de entrada para cada canal para formar señales (2109a,...2109e) residuales;formar los canales de la señal residual en grupos determinados por criterios perceptuales y eficiencia de codificación (3702);determinar canales primarios y secundarios para cada grupo de señal residual (3704);calcular una cuadrícula (508) parcial para codificar información espacial relativa entre cada canal primario/secundario que se emparejan en cada grupo (502) de señales residuales;cuantificar y codificar componentes residuales para el canal primario en cada grupo como respectivas cuadrículas G (2110a);cuantificar y codificar la cuadrícula parcial para reducir la tasa (2110a) de datos requerida;e insertar la cuadrícula parcial codificada y la cuadrícula G para cada grupo en el flujo de bits escalado (3706).
  30. 30
    El procedimiento de la reivindicación 29, en el que los canales secundarios se construyen a partir de combinaciones lineales de uno o más canales (3704).
  31. 31
    Un codificador de flujo de bits escalable para codificar una señal de audio de entrada y formar un flujo de bits escalable, que comprende:un banco (2100) de filtros jerárquicos (HFB) que descompone la señal de audio de entrada en coeficientes (2108) de transformada en niveles de resolución de frecuencia sucesivamente más bajos y de vuelta en muestras (2114) de subbanda de dominio de tiempo en escalas de tiempo sucesivamente más finas en iteraciones sucesivas;un codificador (102) de tono que (a) extrae componentes (2109) tonales de los coeficientes de transformada en cada iteración, cuantifica (2110) y almacena los mismos en una lista (2106) de tonos, (b) elimina los componentes (2111, 2112) tonales de la señal de audio de entrada para pasar una señal (2114b) residual a la siguiente iteración del HFB y (c) clasifica todos los componentes tonales extraídos en base a su contribución relativa a calidad de señal decodificada;un codificador (107) residual que aplica una transformada (2115) inversa final con resolución de frecuencia relativamente menor que la iteración final del HFB (2101e) a la señal (113) residual final para extraer los componentes residuales (2117, 2118, 2119) y clasifica los componentes residuales en base a su contribución relativa a calidad de señal decodificada;en el que los componentes tonales extraídos y componentes residuales se clasifican y cuantifican con referencia a la misma función de enmascaramiento o diferentes criterios psicoacústicos;un formateador (109) de flujo de bits que ensambla los componentes tonales y residuales en una base de trama por trama para formar un flujo (126) de bits maestro;y un escalador (115) que elimina un número suficiente de los componentes codificados de menor clasificación de cada trama del flujo de bits maestro para formar un flujo (116) de bits escalado que tiene una tasa de datos menor que o aproximadamente igual a una tasa de datos deseada, en el que el flujo de bits escalado incluye información que indica la posición de los componentes en el espectro de frecuencia.
  32. 32
    El codificador de la reivindicación 31, en el que el codificador de tono agrupa los componentes tonales en subdominios de frecuencia a diferentes resoluciones (903, 904, 905, 906, 907) de frecuencia y clasifica los componentes con cada subdominio, el codificador residual agrupa los componentes residuales en subdominios residuales en diferentes escalas de tiempo y/o resoluciones (908, 909, 910) de frecuencia y clasifica los componentes con cada subdominio, y dicho formateador de flujo de bits clasifica los subdominios en base a su contribución relativa a calidad de señal decodificada.
  33. 33
    El codificador de la reivindicación 32, en el que el formateador de flujo de bits ordena los subdominios y los componentes dentro de cada subdominio en base a su clasificación, eliminando dicho escalador (115) dichos componentes de baja clasificación comenzando con el componente de clasificación más baja en el subdominio de clasificación más baja y eliminando componentes en orden hasta que se consiga la tasa de datos deseada.
  34. 34
    El codificador de la reivindicación 31, en el que la señal de audio de entrada es una señal de audio de entrada multicanal, codificando conjuntamente dicho codificador de tono cada uno de dichos componentes tonales formando grupos de dichos canales y para cada uno de dichos grupos, seleccionando un canal primario y al menos un canal secundario, que se identifican a través de una máscara (3602) de bits, identificando cada bit la presencia de un canal secundario;cuantificando y codificando el canal primario (102, 108);y cuantificando y codificando la diferencia entre el canal primario y cada canal secundario (102, 108).
  35. 35
    El codificador de la reivindicación 31, en el que la señal de entrada es una señal de audio multicanal, dicho codificador residual, formando los canales de la señal residual en grupos determinados por criterios perceptuales y eficiencia de codificación (3702);determinando canales primarios y secundarios para cada uno de dichos grupos de señales residuales (3704);calculando una cuadrícula (508) parcial para codificar información espacial relativa entre cada canal primario/secundario que se emparejan en cada grupo (502) de señales residuales;cuantificando y codificando componentes residuales para el canal primario en cada grupo como respectivas cuadrículas G (2110a);cuantificando y codificando la cuadrícula parcial para reducir la tasa (2110a) de datos requerida;e insertando la cuadrícula parcial codificada y la cuadrícula G para cada grupo en el flujo de bits escalado (3706). 36. El codificador de la reivindicación 31, en el que el codificador residual extrae componentes de muestra de tiempo representados por una cuadrícula G (2117) y una serie de una o más cuadrículas G0, G1 (2118, 2119) de factor de escala en múltiples resoluciones de tiempo y frecuencia que se aplican a los componentes de muestra de tiempo dividiendo la cuadrícula G por elementos de cuadrícula de G0, G1 en el plano (2120) de tiempo/frecuencia, teniendo cada cuadrícula G0, G1 un número diferente de factores de escala en tiempo y/o frecuencia.
Independent claims35