JP5728736B2

Audio splitting with codec-enforced frame sizes

Abstract

This record has no abstract on file.

JP5728736B2, drawing sheet 1
Sheet 1 of 12

Term

4.2 yearsleft in the term

Expires 21 December 2030.

  1. Priority
  2. Filed
  3. Granted
  4. Today
  5. Expires

21 claims: 6 independent, 15 dependent

  1. 1
    音声および映像を含むメディア・コンテンツをコンピューティング・システムにより受け取ることと、 前記映像を複数のビデオフレームに、所定のビデオ符号化フレーム・レートに従って前記コンピューティング・システムにより符号化することと、 前記音声を、所定の音声符号化コーデック適用フレーム・サイズを有する、複数の隙間のない音声フレームに、前記コンピューティング・システムにより符号化することと、 複数のコンテンツ・ファイルを前記コンピューティング・システムにより生成することであって、前記複数のコンテンツ・ファイルのそれぞれが、固定時間幅を有する符号化映像部分と符号化済音声部分と有し、前記符号化済映像部分は、1以上の複数の映像フレームを有し、前記符号化済音声部分は、1以上の複数の隙間のない音声フレームを有し、 前記複数のコンテンツ・ファイルのうちの1つまたは複数のコンテンツ・ファイルの前記符号化済音声部分の期間が、それぞれの1以上のコンテンツ・ファイルの前記符号化済映像部分の前記固定時間幅よりも大きいか、またはこれよりも小さ く、 前記1以上のコンテンツ・ファイルの現在のコンテンツ・ファイルの符号化済音声部分の時間長が互いに整数倍でない場合も、長さ調整のために0値の埋め込みを前記現在のコンテンツ・ファイルの前記符号化済音声部分に行わず、前記現在のコンテンツ・ファイルの前記符号化済音声部分を隙間のない音声フレームを用いて満たし、 次のコンテンツ・ファイルの前記音声に、固定時間幅から前記現在のコンテンツ・ファイルの音声のうちの符号化済部分の期間を引くことにより得られる、前記次のコンテンツ・ファイルの前記符号化済音声部分の再生開始位置を示すプレゼンテーション・オフセットを与えて再生し、前記音声が再生されず、前記現在のコンテンツ・ファイルと前記次のコンテンツ・ファイルのつなぎ目で、アーチファクトが発生しないようにする、 ことと、 を含む方法。
  2. 2
    前記1以上のコンテンツ・ファイルのそれぞれのコンテンツ・ファイルのそれぞれの符号化済音声部分の前記隙間のない音声フレームの最後が、0で埋められることがない、 請求項1に記載の方法。
  3. 3
    前記メディア・コンテンツを前記音声および前記映像にスプリットすることを更に含み、 前記映像を符号化することが、前記固定時間幅に従って映像コーデックを使用することにより前記映像を符号化することを含み、 前記音声を符号化することが、前記コーデック適用フレーム・サイズに従って音声コーデックを使用することにより前記音声を符号化することを含む、 請求項1に記載の方法。
  4. 4
    前記音声の符号化済フレームをバッファリングすることと、 前記複数のコンテンツ・ファイルのうちの現在のコンテンツ・ファイルの前記符号化済音声部分を満たすのに必要な符号化済フレーム数を求めることであって、前記フレーム数が、前記複数のファイルのうち前記現在のファイルの前記符号化済音声部分を満たすのに必要なサンプル数を、前記コーデック適用フレーム・サイズで割った数以上の最小の整数であり、割った数には端数があり、端数は、サンプル・オフセットとして保持されることと、 前記複数のコンテンツ・ファイルのうちの現在のコンテンツ・ファイルの前記符号化済音声部分を満たすための前記符号化済フレームがバッファリングされたかどうかを判定することと、 前記符号化済フレームが前記複数のコンテンツ・ファイルの現在のコンテンツ・ファイルの前記符号化済音声部分を満たすほどバッファリングされている場合、前記複数のコンテンツ・ファイルのうちの前記現在のコンテンツ・ファイルの前記符号化済音声部分を前記フレーム数のフレームで満たすことと、 前記符号化済フレームが前記複数のコンテンツ・ファイルの現在のコンテンツ・ファイルの前記符号化済音声部分を満たすほどバッファリングされていない場合、前記音声のフレームを更にバッファリングし、前記複数のコンテンツ・ファイルのうちの前記現在のコンテンツ・ファイルの前記符号化済音声部分を、前記フレーム数のフレームおよび前記追加のフレームで満たすことと、 を更に含む請求項1に記載の方法。
  5. 5
    前記複数のコンテンツ・ファイルの現在のコンテンツ・ファイルの前記符号化済音声部分を満たすだけの符号化済フレームがバッファリングされたかどうかを前記判定することが、 バッファリングされたフレームの数と、前記コーデック適用フレーム・サイズとを乗算することと、 前記複数のコンテンツ・ファイルのうちの前のコンテンツ・ファイルからの前記サンプル・オフセットがあればこれを、前記乗算の積に加えることと、 その和が、前記複数のコンテンツ・ファイルのうちの第1のコンテンツ・ファイルを満たすのに必要なサンプルの数以上であるかどうかを判定することと、 を含む 請求項4に記載の方法。
  6. 6
    前記複数のコンテンツ・ファイルのうちの次のコンテンツ・ファイルについてサンプル・オフセットがあればこれを求めることを更に含む、 請求項4に記載の方法。
  7. 7
    前記サンプル・オフセットを求めることが、 (前記符号化済フレームの数)×(前記コーデック適用フレーム・サイズ)-(前記複数のコンテンツ・ファイルのうちの第1のコンテンツ・ファイルを満たすのに必要なサンプルの数)+(前記複数のコンテンツ・ファイルのうちの前のコンテンツ・ファイルからの前記サンプル・オフセット)を計算することを含む、 請求項6に記載の方法。
  8. 8
    前記音声の符号化済フレームをバッファリングすることを更に含み、 前記複数のコンテンツ・ファイルを前記生成することが、 前記複数のコンテンツ・ファイルのうちの現在のコンテンツ・ファイルの前記符号化済音声部分を満たすのに必要なサンプルの数を算出することと、 前記複数のコンテンツ・ファイルのうちの前記現在のコンテンツ・ファイルの前記符号化済音声部分に必要なフレームの数を算出することと、 前記サンプルの数が前記コーデック適用フレーム・サイズで均等に割り切れない場合、前記フレーム数のフレームにフレームを追加することと、 前記複数のコンテンツ・ファイルのうちの前記現在のコンテンツ・ファイルの前記符号化済音声部分をフレームで満たすことと、 を含む、 請求項1に記載の方法。
  9. 9
    前記音声の符号化済フレームをバッファリングすることを更に含み、 前記複数のコンテンツ・ファイルを前記生成することが、 前記固定時間幅を映像フレームのサンプリング・レートに掛け、これに、前記複数のコンテンツ・ファイルのうちの直前のコンテンツ・ファイルからのサンプル・オフセットがあればこれを足すことにより、前記複数のコンテンツ・ファイルのうちの前記1つまたは複数のコンテンツ・ファイルのうちの現在のコンテンツ・ファイルの前記符号化済音声部分を満たすのに必要なサンプルの数を算出することと、 前記サンプルの数を、前記コーデック適用フレーム・サイズで割ることにより、前記現在のコンテンツ・ファイルの前記符号化済音声部分を満たすのに必要なフレームの数を算出することと、 前記除算の余りが0の場合、前記現在のコンテンツ・ファイルの前記符号化済音声部分を前記フレーム数のフレームで満たすことと、 前記除算の余りが0より大きい場合、前記フレーム数を1だけインクリメントし、前記インクリメントしたフレーム数のフレームで前記現在のコンテンツ・ファイルの前記符号化済音声部分を満たすことと を含む、 請求項 4 に記載の方法。
  10. 10
    前記複数のコンテンツ・ファイルを前記生成することが、 前記現在のコンテンツ・ファイルを満たすのに必要な前記サンプルの数に戻すために、前記フレームの数と、前記コーデック適用フレーム・サイズとを掛けることと、 前記サンプルの数を前記サンプリング・レートで割ることにより、前記現在のコンテンツ・ファイルの前記音声のうちの前記符号化済部分の前記期間を算出することと、 前記固定時間幅から前記期間を引くことにより、前記複数のコンテンツ・ファイルのうちの次のコンテンツ・ファイルについての、前記音声ファイルの再生開始位置を示すプレゼンテーション・オフセットを求めることと、 前記フレームの数に前記コーデック適用フレーム・サイズを掛け、ここから、前記複数のコンテンツ・ファイルのうちの前記第1のコンテンツ・ファイルを満たすのに必要な前記サンプルの数を引き、前記複数のコンテンツ・ファイルのうちの前記前のコンテンツ・ファイルからのサンプル・オフセットがあればこれを足すことにより、前記複数のコンテンツ・ファイルのうちの前記次のコンテンツ・ファイルについての前記サンプル・オフセットを、現在処理中のコンテンツ・ファイルのサンプル・オフセットとしてアップデートすることと を更に含む、 請求項9に記載の方法。
  11. 11
    前記受け取ることが、前記メディア・コンテンツを音声と映像の両方を含む複数の生の離散的なデータのストリーム(ストリームレット)として受け取ることを含み、 前記複数の生のストリームレットのそれぞれが、前記メディア・コンテンツのうちで前記固定時間幅を有する映像フレームを含む、 請求項1に記載の方法。
  12. 12
    前記メディア・コンテンツを前記受け取ることが、 前記複数の生のストリームレットのうちの第1の生のストリームレットおよび前記複数の生のストリームレットのうちの第2の生のストリームレットを受け取ることと、 前記第1の生のストリームレットの前記音声および前記映像をスプリットし、前記第2の生のストリームレットの前記音声および前記映像をスプリットすることと、 を含み、 前記映像を前記符号化することが、 前記第1の生のストリームレットの前記映像を符号化することであって、前記第1の生のストリームレットの前記映像が、前記複数のコンテンツ・ファイルのうちの第1のコンテンツ・ファイル内に格納されることと、 前記第2の生のストリームレットの前記映像を符号化することであって、前記第2の生のストリームレットの前記映像が、前記複数のコンテンツ・ファイルのうちの第2のコンテンツ・ファイル内に格納されることと、 を含み、 前記音声を前記符号化することが、 前記第1の生のストリームレットの前記音声を、第1の複数の音声フレームに符号化することと、 前記第1の複数の音声フレームをバッファリングすることと、 前記第1のコンテンツ・ファイルを満たすのに十分なフレームがバッファリングされたかどうかを判定することと、 前記第1のコンテンツ・ファイルを満たすのに十分なフレームがバッファリングされていない場合、前記第2の生のストリームレットの前記音声を、第2の複数の音声フレームに符号化し、前記第2の複数の音声フレームをバッファリングすることと、 前記第1のコンテンツ・ファイルを満たすのに十分なフレームがバッファリングされている場合、前記バッファリングされた音声フレームを前記第1のコンテンツ・ファイル内に格納することと、 を含む、 請求項11に記載の方法。
  13. 13
    前記固定時間幅が約2秒間であり、 前記音声が、1秒間に約48000サンプルでサンプリングされ、 前記コーデック適用フレーム・サイズが、1フレームにつき1024サンプルであり、 前記複数のコンテンツ・ファイルのうちの初めの3つのコンテンツ・ファイルの音声部分がそれぞれ、94の音声フレームを含み、 前記複数のコンテンツ・ファイルのうちの第4のコンテンツ・ファイルの音声部分が、93の音声フレームを含み、 前記第4のコンテンツ・ファイルの映像部分がそれぞれ、約60の映像フレームを含む、 請求項1に記載の方法。
  14. 14
    前記固定時間幅が約2秒間であり、 前記音声が、1秒間に約44100サンプルでサンプリングされ、 前記コーデック適用フレーム・サイズが、1フレームにつき1024サンプルであり、 前記複数のコンテンツ・ファイルのうちの第1のコンテンツ・ファイルの前記符号化済音声部分が、87の音声フレームを含み、前記複数のコンテンツ・ファイルのうちの第2のコンテンツ・ファイルの前記符号化済音声部分が、86の音声フレームを含む、 請求項1に記載の方法。
  15. 15
    前記コーデック適用フレーム・サイズが、1フレームにつき2048サンプルである、 請求項1に記載の方法。
  16. 16
    映像および音声を含むメディア・コンテンツを受け取る手段と、 前記映像をフレーム・レートに従って符号化する手段と、 前記音声を固定フレーム・サイズに従って符号化する手段と、 前記符号化済映像を複数の符号化済映像部分にセグメント化する手段であって、前記符号化済映像部分のそれぞれが、別々のコンテンツ・ファイル内に格納される手段と、 前記符号化済音声を複数の符号化済音声部分にスプリットする手段と、 を備えるコンピューティング・システムであって、 各符号化済音声部分が、複数の隙間のない音声フレームに含まれ、それぞれ個別のコンテンツ・ファイルに境界アーチファクトを導入することなく格納され、前記別々のコンテンツ・ファイルのうちの第1のコンテンツ・ファイルの前記符号化された音声が、前記第1のコンテンツ・ファイル内に格納された前記符号化済映像部分の期間よりも長い、または、これより短い期間を有 し 、 前記複数のコンテンツ・ファイルの現在のコンテンツ・ファイルの符号化済音声部分の時間長が互いに整数倍でない場合も、長さ調整のために0値の埋め込みを前記現在のコンテンツ・ファイルの前記符号化済音声部分に行わず、前記現在のコンテンツ・ファイルの前記符号化済音声部分を隙間のない音声フレームを用いて満たし、 次のコンテンツ・ファイルの前記音声に、固定時間幅から前記現在のコンテンツ・ファイルの音声のうちの符号化済部分の期間を引くことにより得られる、前記次のコンテンツ・ファイルの前記符号化済音声部分の再生開始位置を示すプレゼンテーション・オフセットを与えて再生し、前記音声が再生されず、前記現在のコンテンツ・ファイルと前記次のコンテンツ・ファイルのつなぎ目で、アーチファクトが発生しないようにする、 コンピューティング・システム。
  17. 17
    前記コンテンツ・ファイルのそれぞれについて、サンプル・オフセットがあればこれを記録する手段と、 前記コンテンツ・ファイルのそれぞれについて、プレゼンテーション・オフセットがあればこれを記録する手段と、 を更に備える請求項16に記載のコンピューティング・システム。
  18. 18
    音声および映像を含むメディア・コンテンツを受け取り、前記音声および前記映像をスプリットするためのスプリッタと、 前記スプリッタから前記映像を受け取るように結合され、前記映像をフレーム・レートに従って符号化するための映像エンコーダと、 前記スプリッタから前記音声を受け取るように結合され、前記音声を、コーデック適用フレーム・サイズに従って符号化するための音声エンコーダと、 複数のコンテンツ・ファイルを生成するための音声スプリッティング・マルチプレクサであって、前記複数のコンテンツ・ファイルのそれぞれが、前記映像のうちで固定時間幅を有する符号化済部分と、前記音声のうちで、前記コーデック適用フレーム・サイズを有する複数の隙間のない音声フレームを有する符号化済部分とを含み、前記複数のコンテンツ・ファイルのうちの1つまたは複数のコンテンツ・ファイルの前記音声の前記符号化済部分の期間が、前記固定時間幅よりも長い、または、これよりも短く、1以上の前記複数のコンテンツ・ファイルの音声の符号 化 された部分の隙間のない複数の音声フレームのうちの最後のものは、ゼロで埋められることがな く、 前記複数のコンテンツ・ファイルの現在のコンテンツ・ファイルの符号化済音声部分の時間長が互いに整数倍でない場合も、長さ調整のために0値の埋め込みを前記現在のコンテンツ・ファイルの前記符号化済音声部分に行わず、前記現在のコンテンツ・ファイルの前記符号化済音声部分を隙間のない音声フレームを用いて満たし、 次のコンテンツ・ファイルの前記音声に、固定時間幅から前記現在のコンテンツ・ファイルの音声のうちの符号化済部分の期間を引くことにより得られる、前記次のコンテンツ・ファイルの前記符号化済音声部分の再生開始位置を示すプレゼンテーション・オフセットを与えて再生し、前記音声が再生されず、前記現在のコンテンツ・ファイルと前記次のコンテンツ・ファイルのつなぎ目で、アーチファクトが発生しないようにする、 音声スプリッティング・マルチプレクサと、 を備えるコンピューティング・デバイス。
  19. 19
    前記コンピューティング・デバイスが、前記音声の符号化済フレームをバッファリングするための音声フレーム・バッファを更に備える、 請求項18に記載のコンピューティング・デバイス。
  20. 20
    コンピューティング・デバイスに実行されると前記コンピューティング・デバイスにある方法を行わせる命令を格納する非一時的コンピュータ可読記憶媒体であって、 前記方法が、 音声および映像を含むメディア・コンテンツを受け取ることと、 前記映像をフレーム・レートに従って符号化することと、 前記音声を、コーデック適用フレーム・サイズに従って符号化することと、 複数のコンテンツ・ファイルを生成することであって、前記複数のコンテンツ・ファイルのそれぞれが、前記映像のうちで固定時間幅を有する符号化済部分と、前記音声のうちで、前記コーデック適用フレーム・サイズを有する複数の隙間のない音声フレームを有する符号化済部分とを含み、前記複数のコンテンツ・ファイルのうちの1つまたは複数のコンテンツ・ファイルの前記音声の前記符号化済部分の期間が、前記固定時間幅よりも長い、または、これよりも短く、1以上の前記複数のコンテンツ・ファイルの音声の符号かされた部分の隙間のない複数の音声フレームのうちの最後のものは、ゼロで埋められることがな く、 前記複数のコンテンツ・ファイルの現在のコンテンツ・ファイルの符号化済音声部分の時間長が互いに整数倍でない場合も、長さ調整のために0値の埋め込みを前記現在のコンテンツ・ファイルの前記符号化済音声部分に行わず、前記現在のコンテンツ・ファイルの前記符号化済音声部分を隙間のない音声フレームを用いて満たし、 次のコンテンツ・ファイルの前記音声に、固定時間幅から前記現在のコンテンツ・ファイルの音声のうちの符号化済部分の期間を引くことにより得られる、前記次のコンテンツ・ファイルの前記符号化済音声部分の再生開始位置を示すプレゼンテーション・オフセットを与えて再生し、前記音声が再生されず、前記現在のコンテンツ・ファイルと前記次のコンテンツ・ファイルのつなぎ目で、アーチファクトが発生しないようにする、 ことと、 を含む、 コンピュータ可読記憶媒体。
  21. 21
    前記方法が、 前記音声の符号化済フレームをバッファリングすることと、 前記複数のコンテンツ・ファイルのうちの現在のコンテンツ・ファイルの音声の符号化された部分を満たすのに必要な符号化済フレーム数を求めることであって、前記フレーム数が、前記複数のファイルのうちの前記現在のファイルの音声の符号化された部分を満たすのに必要なサンプル数を、前記コーデック適用フレーム・サイズで割った数以上の最小の整数であることと、 前記複数のコンテンツ・ファイルのうちの現在のコンテンツ・ファイルの音声の符号化された部分を満たすだけの前記符号化済フレームがバッファリングされたかどうかを判定することと、 前記複数のコンテンツ・ファイルのうちの現在のコンテンツ・ファイルの音声の符号化された部分を満たすだけの前記符号化済フレームがバッファリングされている場合、前記複数のコンテンツ・ファイルのうちの前記現在のコンテンツ・ファイルの音声の前記符号化された部分を前記フレーム数のフレームで満たすことと、 前記複数のコンテンツ・ファイルのうちの現在のコンテンツ・ファイルの音声の符号化された部分を満たすだけの前記符号化済フレームがバッファリングされていない場合、前記音声のフレームをバッファリングし、前記複数のコンテンツ・ファイルのうちの前記現在のコンテンツ・ファイルの音声の前記符号化された部分を、前記バッファされたフレームで満たすことと、 を更に含む、 請求項20に記載のコンピュータ可読記憶媒体。
Independent claims21