PL2941771T3

Decoder, encoder and method for informed loudness estimation employing by-pass audio object signals in object-based audio coding systems

Abstract

This record has no abstract on file.

Term

8.2 yearsto projected expiry

Projected expiry 27 November 2034, counted from filing; an application has no term until it is granted.

  1. Priority
  2. Filed
  3. Published
  4. Today
  5. Projected expiry

1 claim: 1 independent, 0 dependent

  1. 1
    Zastrzeżenia patentowe 1. Dekoder do generowania wyjściowego sygnału audio zawierającego jeden lub większą liczbę wyjściowych kanałów audio, przy czym dekoder zawiera:interfejs (110) odbiorczy do odbierania wejściowego sygnału audio zawierającego wiele sygnałów obiektów audio, odbierania informacji głośności o sygnałach obiektów audio oraz do odbierania informacji odtwarzania, które wskazują czy jeden lub większa liczba sygnałów obiektów audio powinna zostać wzmocniona lub stłumiona, i procesor (120) sygnału do generowania jednego lub większej liczby wyjściowych kanałów audio wyjściowego sygnału audio, przy czym interfejs (110) odbiorczy jest przystosowany do odbierania downmiksowanego sygnału zawierającego jeden lub większą liczbę downmiksowanych kanałów jako wejściowy sygnał audio, przy czym jeden lub większa liczba downmiksowanych kanałów zawiera sygnały obiektów audio i gdzie liczba jednego lub większej liczby downmiksowanych kanałów jest mniejsza niż liczba sygnałów obiektów audio, przy czym interfejs (110) odbiorczy jest przystosowany do odbierania informacji downmiksu wskazujących, w jaki sposób sygnały obiektów audio są miksowane wewnątrz jednego lub większej liczby downmiksowanych kanałów, przy czym interfejs (110) odbiorczy jest przystosowany do odbierania jednego lub większej liczby kolejnych obejściowych sygnałów obiektów audio, gdzie jeden lub większa liczba kolejnych obejściowych sygnałów obiektów audio nie jest miksowana wewnątrz downmiksowanego sygnału, przy czym interfejs (110) odbiorczy jest przystosowany do odbierania informacji głośności wskazujących informacje o głośności sygnałów obiektów audio, które są miksowane wewnątrz downmiksowanego sygnału i wskazywania informacji o głośności jednego lub większej liczby kolejnych obejściowych sygnałów obiektów audio, które nie są miksowane wewnątrz downmiksowanego sygnału, przy czym procesor (120) sygnału jest przystosowany do określania wartości kompensacji głośności w zależności od informacji o głośności sygnałów obiektów audio, które są miksowane wewnątrz downmiksowanego sygnału i w zależności od informacji głośności jednego lub większej liczby kolejnych obejściowych sygnałów obiektów audio, które nie są miksowane wewnątrz downmiksowanego sygnału, i przy czym procesor (120) sygnału jest przystosowany do generowania jednego lub większej liczby wyjściowych kanałów z audio wyjściowego sygnału audio w zależności od informacji downmiksu, w zależności od informacji odtwarzania i w zależności od wartości kompensacji głośności. 2. Dekoder według zastrz.1, w którym procesor (120) sygnału jest przystosowany do generowania jednego lub większej liczby wyjściowych kanałów audio wyjściowego sygnału audio z wejściowego sygnału audio w zależności od informacji odtwarzania i w zależności od wartości kompensacji głośności w taki sposób, że głośność wyjściowego sygnału audio jest równa głośności wejściowego sygnału audio, lub w taki sposób, że głośność wyjściowego sygnału audio jest bardziej zbliżona do głośności wejściowego sygnału audio niż głośność zmodyfikowanego sygnału audio, który byłby uzyskiwany przez modyfikowanie wejściowego sygnału audio poprzez wzmocnienie lub stłumienie sygnałów obiektów audio wejściowego sygnału audio, zgodnie z informacjami odtwarzania, 3. Dekoder według zastrz. 2, w którym procesor (120) sygnału jest przystosowany do generowania zmodyfikowanego sygnału audio przez modyfikowanie wejściowego sygnału audio poprzez wzmocnienie lub stłumienie sygnałów obiektów audio wejściowego sygnału audio, zgodnie z informacjami odtwarzania, i przy czym procesor (120) sygnału jest przystosowany do generowania wyjściowego sygnału audio przez zastosowanie wartości kompensacji głośności na zmodyfikowanym sygnale audio tak, aby głośność wyjściowego sygnału audio była równa głośności wejściowego sygnału audio, lub tak, aby głośność wyjściowego sygnału audio była bardziej zbliżona do głośności wejściowego sygnału audio niż głośność zmodyfikowanego sygnału audio. 4. Dekoder według jednego z powyższych zastrz., w którym każdy z sygnałów obiektów audio wejściowego sygnału audio jest przypisany do dokładnie jednej grupy spośród dwóch lub większej liczby grup, przy czym każda spośród dwóch lub większej liczby grup zawiera jeden lub większą liczbę sygnałów obiektów audio wejściowego sygnału audio, w którym interfejs (110) odbiorczy jest przystosowany do odbierania wartości głośności każdej grupy spośród dwóch lub większej liczby grup jako informacji głośności, w którym procesor (120) sygnału jest przystosowany do określania wartości kompensacji głośności w zależności od wartości głośności każdej spośród dwóch lub większej liczby grup, i przy czym procesor (120) sygnału jest przystosowany do generowania jednego lub większej liczby wyjściowych kanałów audio wyjściowego sygnału audio z wejściowego sygnału audio, w zależności od wartości kompensacji głośności. 5. Dekoder według dowolnego z powyższych zastrz., w którym co najmniej jedna grupa spośród dwóch lub większej liczby grup zawiera dwa lub większą liczbę sygnałów obiektów audio. 6. Dekoder według dowolnego z powyższych zastrz., w którym każdy z sygnałów obiektów audio wejściowego sygnału audio jest przypisany do dokładnie jednej grupy spośród dokładnie dwóch grup jako dwie lub większą liczba grup, gdzie każdy z sygnałów obiektów audio wejściowego sygnału audio przypisany jest albo do grupy obiektów pierwszoplanowych spośród dokładnie dwóch grup albo do grupy obiektów tła spośród dokładnie dwóch grup, w którym interfejs (110) odbiorczy jest przystosowany do odbierania wartości głośności grupy obiektów pierwszoplanowych, w którym interfejs (110) odbiorczy jest przystosowany do odbierania wartości głośności grupy obiektów tła, w którym procesor (120) sygnału jest przystosowany do określania wartość kompensacji głośności w zależności od wartości głośności grupy obiektów pierwszoplanowych i w zależności od wartości głośności grupy obiektów tła, i przy czym procesor (120) sygnału jest przystosowany do generowania jednego lub większej liczby kanałów wyjściowych wyjściowego sygnału audio z wejściowego sygnału audio, w zależności od wartości kompensacji głośności. 7. Dekoder według zastrz. 6, przy czym procesor (120) sygnału jest przystosowany do określania wartości ΔL zmiany głośności zgodnie ze wzorem gdzie KFGO wskazuje wartość głośności grupy obiektów pierwszoplanowych, gdzie KBGO wskazuje wartość głośności grupy obiektów tła, gdzie mFGO wskazuje wzmocnienie odtwarzania grupy obiektów pierwszoplanowych, i gdzie mBGO wskazuje wzmocnienie odtwarzania grupy obiektów tła. 8. Dekoder według zastrz. 6, w którym procesor (120) sygnału jest przystosowany do określania wartości ΔL kompensacji głośności zgodnie ze wzorem Ł^co/iO + 10 ificoflo gdzie LFGO wskazuje wartość głośności grupy obiektów pierwszoplanowych, gdzie LBGO wskazuje wartość głośności grupy obiektów tła, gdzie gFGO wskazuje wzmocnienie odtwarzania grupy obiektów pierwszoplanowych, i gdzie gBGO wskazuje wzmocnienie odtwarzania grupy obiektów tła. 9. Koder zawierający zespół (210;710) kodowania obiektowego do kodowania wielu sygnałów obiektów audio w celu zakodowania sygnału audio zawierającego wiele sygnałów obiektów audio, i zespół (220;720;820) kodowania głośności obiektów do kodowania informacji głośności w sygnałach obiektów audio, przy czym informacje głośności zawierają jedną lub większą liczbę wartości głośności, gdzie każda spośród jednej lub większej liczby wartości głośności zależy od jednego lub większej liczby sygnałów obiektów audio, przy czym zespół (210;710) kodowania obiektowego jest przystosowany do odbierania sygnałów sygnały obiektów audio, przy czym każdy z sygnałów obiektów audio jest przypisany do dokładnie jednej spośród dwóch lub większej liczby grup, przy czym każda spośród dwóch lub większej liczby grup zawiera jeden lub większą liczbę sygnałów obiektów audio, przy czym zespół (210;710) kodowania obiektowego jest przystosowany do downmiksowania sygnałów obiektów audio, zawartych w dwóch lub większej liczbie grup, w celu uzyskania downmiksowanego sygnału zawierającego jeden lub większą liczbę downmiksowanych kanałów audio jako zakodowany sygnał audio, przy czym liczba jednego lub większej liczby downmiksowanych kanałów jest mniejsza niż liczba sygnałów obiektów audio zawartych w dwóch lub większej liczbie grup, przy czym zespół (220;720;820) kodowania głośności obiektów jest przypisany do odbierania jednego lub większej liczby kolejnych obejściowych sygnałów obiektów audio, przy czym każdy spośród jednego lub większej liczby kolejnych obejściowych sygnałów obiektów audio jest przypisany do trzeciej grupy, przy czym każdy spośród jednego lub większej liczby kolejnych obejściowych sygnałów obiektów audio nie jest zawarty w pierwszej grupie i nie jest zawarty w drugiej grupie, przy czym zespół (210;710) kodowania obiektowego jest przystosowany do nie przeprowadzania downmiksowania jednego lub większej liczby kolejnych obejściowych sygnałów obiektów audio wewnątrz downmiksowanego sygnału, i gdzie zespół (220;720;820) kodowania głośności obiektów jest przystosowany do określania pierwszej wartości głośności, drugiej wartości głośności i trzeciej wartości głośności informacji głośności, przy czym pierwsza wartość głośności wskazuje całkowitą głośność jednego lub większej liczby sygnałów obiektów audio pierwszej grupy, druga wartość głośności wskazuje całkowitą głośność jednego lub większej liczby sygnałów obiektów audio drugiej grupy, a trzecia wartość głośności wskazuje całkowitą głośność jednego lub większej kolejnych obejściowych sygnałów obiektów audio trzeciej grupy, lub jest przystosowany do określania pierwszej wartości głośności i drugiej wartości głośności informacji głośności, przy czym pierwsza wartość głośności wskazuje całkowitą głośność jednego lub większej liczby sygnałów obiektów audio pierwszej grupy, a druga wartość głośności wskazuje całkowitą głośność jednego lub większej liczby sygnałów obiektów audio drugiej grupy i jednego lub większej liczby kolejnych obejściowych sygnałów obiektów audio trzeciej grupy. 10. Koder według zastrz. 9, w którym dwie lub większa liczba grup to dokładnie dwie grupy, w którym każdy z sygnałów obiektów audio jest przypisany do dokładnie jednej grupy spośród dokładnie dwóch grup, przy czym każda z dokładnie dwóch grup zawiera jeden lub większą liczbę sygnałów obiektów audio, w którym zespół (210;710) kodowania obiektowego jest przystosowany do downmiksowania sygnałów obiektów audio zawartych w dokładnie dwóch grupach, w celu uzyskania downmiksowanego sygnału zawierającego jeden lub większą liczbę downmiksowanych kanałów audio jako zakodowany sygnał audio, przy czym liczba jednego lub większej liczby downmiksowanych kanałów jest mniejsza niż liczba sygnałów obiektów audio zawartych w dokładnie dwóch grupach. 11. Układ zawierający: koder (310) określony w zastrz. 9 albo 10 do kodowania wielu sygnałów obiektów audio w celu uzyskania zakodowanego sygnału audio zawierającego wiele sygnałów obiektów audio, i dekoder (320) określony w jednym z zastrz. 1 do 8 do generowania wyjściowego sygnału audio zawierającego jeden lub większą liczbę wyjściowych kanałów audio, przy czym dekoder (320) jest przystosowany do odbierania zakodowanego sygnału audio jako wejściowego sygnału audio oraz do odbierania informacji głośności, przy czym dekoder (320) jest przystosowany do dalszego odbierania informacji odtwarzania, przy czym dekoder (320) jest przystosowany do określania wartości kompensacji głośności w zależności od informacji głośności i w zależności od informacji odtwarzania, i przy czym dekoder (320) jest przystosowany do generowania jednego lub większej liczby wyjściowych kanałów audio wyjściowego sygnału audio z wejściowego sygnału audio w zależności od informacji odtwarzania i w zależności od wartości kompensacji głośności. 12. Sposób generowania wyjściowego sygnału audio zawierającego jeden lub większą liczbę wyjściowych kanałów audio, przy czym sposób obejmuje: odbieranie wejściowego sygnału audio zawierającego wiele sygnałów obiektów audio, odbieranie informacji głośności wskazujących informacje o głośności sygnałów obiektów audio, które są miksowane wewnątrz downmiksowanego sygnału, i wskazywanie informacji o głośności jednego lub większej liczby kolejnych obejściowych sygnałów obiektów audio, które nie są miksowane wewnątrz downmiksowanego sygnału, i odbieranie informacji odtwarzania wskazujących, czy jeden lub większa liczba sygnałów obiektów audio powinna zostać wzmocniona lub stłumiona, odbieranie downmiksowanego sygnału zawierającego jeden lub większą liczbę downmiksowanych kanałów jako wejściowy sygnał audio, przy czym jeden lub większa liczba downmiksowanych kanałów zawiera sygnały obiektów audio, i gdzie liczba jednego lub większej liczby downmiksowanych kanałów jest mniejsza niż liczba sygnałów obiektów audio, odbieranie informacji downmiksu wskazujących, w jaki sposób sygnały obiektów audio są miksowane wewnątrz jednego lub większej liczby downmiksowanych kanałów, odbieranie jednego lub większej liczby kolejnych obejściowych sygnałów obiektów audio, przy czym jeden lub większa liczba kolejnych obejściowych sygnałów obiektów audio nie jest miksowana wewnątrz downmiksowanego sygnału, określanie wartości kompensacji głośności w zależności od informacji o głośności sygnałów obiektów audio, które są miksowane wewnątrz downmiksowanego sygnału, i w zależności od informacji głośności jednego lub większej liczby kolejnych obejściowych sygnałów obiektów audio, które nie są miksowane wewnątrz downmiksowanego sygnału, i generowanie jednego lub większej liczby wyjściowych kanałów audio wyjściowego sygnału audio z wejściowego sygnału audio w zależności od informacji downmiksu, w zależności od informacji odtwarzania i w zależności od wartości kompensacji głośności. 13. Sposób kodowania obejmujący: kodowanie wejściowego sygnału audio zawierającego wiele sygnałów obiektów audio, i kodowanie informacji głośności w sygnałach obiektów audio, przy czym informacje głośności zawierają jedną lub większą liczbę wartości głośności, przy czym każda z jednej lub większej liczby wartości głośności zależy od jednego lub większej liczby sygnałów obiektów audio, przy czym każdy z sygnałów obiektów audio jest przypisany do dokładnie jednej spośród dwóch lub większej liczby grup, przy czym każda spośród dwóch lub większej liczby grup zawiera jeden lub większą liczbę sygnałów obiektów audio, przy czym kodowanie informacji głośności w sygnałach obiektów audio przeprowadzane jest przez downmiksowanie sygnałów obiektów audio zawartych w dwóch lub większej liczbie grup w celu uzyskania downamiksowanego sygnału zawierającego jeden lub większą liczbę downmiksowanych kanałów audio jako zakodowany sygnał audio, przy czym liczba jednego lub większej liczby downmiksowanych kanałów jest mniejsza niż liczba sygnałów obiektów audio zawartych w dwóch lub większej liczbie grup, gdzie każdy spośród jednego lub większej liczby kolejnych obejściowych sygnałów obiektów audio przypisany jest do trzeciej grupy, przy czym każdy spośród jednego lub większej liczby kolejnych obejściowych sygnałów obiektów audio nie jest zawarty w pierwszej grupie i nie jest zawarty w drugiej grupie, gdzie kodowanie informacji głośności w sygnałach obiektów audio jest przeprowadzane bez downmiksowania jednego lub większej liczby kolejnych obejściowych sygnałów obiektów audio wewnątrz downmiksowanego sygnału, i gdzie kodowanie informacji głośności w sygnałach obiektów audio jest przeprowadzane przez określanie pierwszej wartości głośności, drugiej wartości głośności i trzeciej wartości głośności informacji głośności, przy czym pierwsza wartość głośności wskazuje całkowitą głośność jednego lub większej liczby sygnałów obiektów audio pierwszej grupy, druga wartość głośności wskazuje całkowitą głośność jednego lub większej liczby sygnałów obiektów audio drugiej grupy, a trzecia wartość głośności wskazuje całkowitą głośność jednego lub większej kolejnych obejściowych sygnałów obiektów audio trzeciej grupy, lub jest przystosowany do określania pierwszej wartości głośności i drugiej wartości głośności informacji głośności, przy czym pierwsza wartość głośności wskazuje całkowitą głośność jednego lub większej liczby sygnałów obiektów audio pierwszej grupy, a druga wartość głośności wskazuje całkowitą głośność jednego lub większej liczby sygnałów obiektów audio drugiej grupy i jednego lub większej liczby kolejnych obejściowych sygnałów obiektów audio trzeciej grupy. 14. Sposób według zastrz. 13, w którym dwie lub większa liczba grup to dokładnie dwie grupy, w którym każdy z sygnałów obiektów audio jest przypisany do dokładnie jednej grupy spośród dokładnie dwóch grup, przy czym każda z dokładnie dwóch grup zawiera jeden lub większą liczbę sygnałów obiektów audio, w którym kodowanie informacji głośności sygnałów obiektów audio przeprowadzane jest przez downmiksowanie sygnałów obiektów audio zawartych w dokładnie dwóch grupach w celu uzyskania downmiksowanego sygnału zawierającego jeden lub większą liczbę downmiksowanych kanałów audio jako zakodowany sygnału audio, przy czym liczba jednego lub większej liczby downmiksowanych kanałów jest mniejsza niż liczba sygnałów obiektów audio zawartych w dokładnie dwóch grupach. 15. Program komputerowy do przeprowadzenia sposobu określonego w jednym z zastrz. 12 do 14, gdy jest wykonywany na komputerze lub procesorze sygnału. Fraunhofer- Gesellschaft zur Forderung der angewandten Forschung e.V.,Niemcy Pełnomocnik: EP 2 941 771 B1 Z-15848/17 1/12 ο 1_Ι_ <υ ο Ν Ο Λ'Ξ Ο ct σ3 Ν ε £ ο £ μ ο EP 2 941 771 B1 Z-15848/17 3/12 Wyjściowy sygnał audi k CD CO Dekoder a λ O o N O O Ό O 'E? cś cś ’2 cś i£ a cś £ "O o Informacje dotyczące co o LL_ N > s 1 ce dł. N .2 % o ~ c § te tz §3.2 >1 Xł c/j o EP 2 941 771 B1 Z-15848/17 2/12 FIG 2 EP 2 941 771 B1 Z-15848/17 o £ o '5 -CZ) £ "3 c ' 00 X CZ) >~ O N O o o3 .2/2 O 03 σ3 N ε fe o £ m o CD u_ O £ .2 ’o ^ ’a? £ CD £ o 44 τ-, O gCZ) K N CŚ EP 2 941 771 B1 Z-15848/17 5/12 LO o Ll_ EP 2 941 771 B1 Z-15848/17 T Wprowadzanie danych przez użytkownika Rzeczywisty poziom sygnału wyjściowego Czas Estymacja głośności sygnału wyjściowego w oparciu o sygnał Opóźnienie Czas - i 1 i ..... Estymacja głośności sygnału wyjściowego w oparciu o informacje Czas - ------- -------w Czas FIG 6 EP 2 941 771 B1 Z-15848/17 O £ >? O '3 .2 £ '5? O co ω 3 o ΓΪ2 c®' N C i? « £> £ o o Ό Ό σ3 N c3 o S >. > -rt -rt O Ό Ό O OQ CC hO u_ S—< £ c EP 2 941 771 B1 Z-15848/17 8/1 ο c σ3 oo O Ll_ EP 2 941 771 B1 Z-15848/17 9/12 Transportowanie EP 2 941 771 B1 Z-15848/17 10/12 Tłumienie downmiksu (LU) Wzmocnienie FGO (dB) FIG 10 EP 2 941 771 B1 Z-15848/17 11/12 Wzmocnienie FGO (dB) EP 2 941 771 B1 Z-15848/17 12/12 Dane wprowadzane c\j O