KR20000076488A

System and method for automatic audio content analysis for word spotting indexing classification and retrieval

Abstract

According to the present invention, a system for indexing an audio stream for subsequent information retrieval using special audio pre-filtering, skimming the audio stream, gisting and summarizing the audio stream, but indexing only the appropriate speech segments generated by the speech recognition engine, and A method is provided. Special indexing features are described that improve the search and reproducibility of the information retrieval system used after indexing word spotting. The present invention involves translating an audio stream into intervals, each interval comprising one or more segments. For each interval segment, it is determined whether the segment exhibits one or more predetermined audio characteristics, such as a special zero crossing rate range, a specific energy range, and a specific spectral energy concentration range. Audio characteristics are qualitatively determined to represent each audio event including silence, music, speech and lyrics. In addition, interval groups are determined whether or not they match qualitatively predefined meta-patterns such as constant continuous speech, final ideas, stuttering and speech emphasis, etc., and then the audio stream is determined based on interval classification and meta-pattern matching. is indexed, where appropriate features are indexed to improve subsequent retrieval capabilities following information retrieval. In addition, the long-term alternatives generated by the speech recognition engine are indexed with their respective weights to improve subsequent reproducibility.

KR20000076488A, drawing sheet 1
Sheet 1 of 17

Term

Term ended

Projected expiry passed 19 January 2020, 6.7 years ago.

  1. Priority
  2. Filed
  3. Published
  4. Projected expiry
  5. Today

23 claims: 4 independent, 19 dependent

  1. 1
    오디오 신호를 분석하기 위한 컴퓨터 실시 방법에 있어서, 한 개 이상의 세그먼트의 임시 순서를 각각 포함하는 오디오 신호의 한 개 이상의 간격 내의 오디오 이벤트를 검출하는 단계와, 음성 경계부를 관련된 신뢰 레벨로 식별하기 위해 오디오 이벤트를 분석하는 단계와, 정확도를 개선하기 위해 정성적으로 결정된 규칙을 이용하여 음성 경계부 및 신뢰 레벨에 기초하여 오디오 신호를 색인하는 단계와, 재현 능력을 개선하기 위해 관련된 가중과 함께 오디오 신호 내의 최소한 하나의 워드로 대안을 색인하는 단계와, 이의 색인을 이용하여 오디오 신호를 워드 스폿팅, 요약 및 스키밍하는 것들 중 하나 이상을 보증하는 단계 를 포함하는 컴퓨터 실시 방법.
  2. 2
    최소한 하나의 오디오 신호를 분류 및 색인하기 위한 컴퓨터 유용 코드를 가지고 있는 컴퓨터 유용 매체를 포함하는 데이터 기억 장치를 포함하는 컴퓨터에 있어서, 한 개 이상의 세그먼트를 각각 포함하는 간격으로 오디오 신호를 번역하기 위한 논리 수단과, 세그먼트 간격이 최소한 하나의 각각의 오디오 이벤트를 각각 나타내는 한 개 이상의 선정된 오디오 특징을 나타내는 지의 여부를 결정하기 위한 논리 수단과, 결정 수단에 응답하여 간격을 각각의 오디오 이벤트와 관련시킴으로써 간격을 분류하기 위한 논리 수단과, 최소한 하나의 간격 그룹이 미리 정의된 세트의 메타 패턴 내의 메타 패턴과 일치하는 지의 여부를 결정하기 위한 논리 수단과, 간격 그룹이 메타 패턴과 일치하는 것이 결정될 때 간격 그룹을 메타 패턴 분류와 관련시키기 위한 논리 수단과, 간격 분류 및 메타 패턴 분류에 기초하여 오디오 신호를 색인하기 위한 논리 수단 을 포함하는 컴퓨터.
  3. 3
    제 2 항에 있어서, 신호로부터의 워드를 표현하기 위해 음성 인식 엔진을 이용하여 오디오 신호의 적절한 부분만을 처리하기 위한 논리 수단과, 최소한 소정의 워드에 대한 대안을 엔진으로부터 수신하기 위한 논리 수단과, 워드 및 대안 중 최소한 소정의 것에 대한 신뢰 레벨을 엔진으로부터 수신하기 위한 논리 수단과, 신뢰 레벨의 최소한의 일부분에 기초하여 워드 및 대안을 색인하기 위한 논리 수단 을 더 포함하는 컴퓨터.
  4. 4
    제 3 항에 있어서, 대안이 N개의 문자 보다 길고 x%를 초과하는 신뢰성을 가지고 있는 워드만을 수신하는 컴퓨터.
  5. 5
    제 2 항에 있어서, 각각의 선정된 오디오 특징이 최소한의 오디오 신호 부분의 제로 교차율, 최소한의 오디오 신호 부분의 에너지, 최소한의 오디오 신호 부분의 스펙트럼 에너지 집중 및 주파수들 중 한 개 이상에 기초를 두고 있는 컴퓨터.
  6. 6
    제 2 항에 있어서, 간격을 분류하기 전에 세그먼트를 정규화하기 위한 논리 수단을 더 포함하는 컴퓨터.
  7. 7
    제 6 항에 있어서, 정성적으로 정의된 선정된 세트의 패턴이 일정하게 연결된 음성, 및 음성과 조합된 음악을 포함하는 컴퓨터.
  8. 8
    제 6 항에 있어서, 신호의 색인을 이용하여 오디오 신호를 스키밍, 요점 정리 및 요약하기 위한 최소한의 간격 및 메타 패턴 분류 부분을 제공하기 위한 논리 수단을 더 포함하는 컴퓨터.
  9. 9
    제 2 항에 있어서, 세그먼트 간격이 한 개 이상의 선정된 오디오 특징을 나타내는 지의 여부를 결정하기 위한 논리 수단이 세그먼트에 관련된 한 개 이상의 오디오 특징이 각각의 임계치와 같은 지의 여부를 간격 내의 각각의 세그먼트에 대해 결정하기 위한 수단과, 각각의 특징이 각각의 임계치와 같을 때 한 개 이상의 오디오 특징과 관련된 한 개 이상의 카운터를 각각 증가시키기 위한 수단과, 한 개 이상의 카운터를 간격 내의 세그먼트의 수와 비교하기 위한 수단, 비교 수단에 기초하여 간격의 분류를 보증하는 간격을 분류하기 위한 논리 수단 을 포함하는 컴퓨터.
  10. 10
    제 2 항에 있어서, 미리 정의된 세트의 오디오 이벤트는 색인하기 위한 논리 수단이 이에 기초하여 오디오 신호를 색인할 수 있도록 음성에서의 강조부, 음성에서의 머뭇거림 및 음성에서의 결론 아이디어를 더 포함하는 컴퓨터.
  11. 11
    제 10 항에 있어서, 간격을 분류하기 위한 논리 수단에 의해 음성으로서 분류된 최소한 하나의 간격 내의 한 개 이상의 우세 주파수를 결정하기 위한 수과, 한 개 이상의 세그먼트가 우세 주파수의 상한 N%(N은 수이다)를 포함할 때 음성에서의 강조부와 한 개 이상의 세그먼트를 관련시키기 위한 수단과, 한 개 이상의 세그먼트가 우세 주파수의 하한 N%(N은 수이다)를 포함할 때 음성에서의 결론 아이디어와 한 개 이상의 세그먼트를 관련시키기 위한 수단 을 더 포함하는 컴퓨터.
  12. 12
    제 11 항에 있어서, 음성에서의 강조부와 모두 관련된 임시 순서 세그먼트가 선정된 기간 보다 긴 기간을 정의하는 지의 여부를 결정하고, 만일 그렇다면 임시 순서 세그먼트를 중요한 아이디어 언어로서 색인하기 위한 수단을 더 포함하는 컴퓨터.
  13. 13
    오디오 신호를 분석하기 위한 컴퓨터 실시 방법에 있어서, 한 개 이상의 세그먼트의 임시 순서를 각각 포함하는 오디오 신호의 한 개 이상의 간격 내의 오디오 이벤트를 검출하는 단계와, 오디오 이벤트에 기초하여 오디오 신호를 색인하는 단계와, 이의 색인을 이용하여 오디오 신호를 스키밍, 요점 정리 또는 요약하는 단계 를 포함하는 컴퓨터 실시 방법.
  14. 14
    제 13 항에 있어서, 신호로부터의 워드를 표현하기 위해 음성 인식 엔진을 이용하여 오디오 신호의 적절한 부분만을 처리하는 단계와, 최소한 소정의 워드에 대한 대안을 엔진으로부터 수신하는 단계와, 최소한 소정의 워드 및 대안에 대한 신뢰 레벨을 엔진으로부터 수신하는 단계와, 신뢰 레벨에 최소한 일부분 기초하여 워드 및 대안을 색인하는 단계 를 더 포함하는 컴퓨터 실시 방법.
  15. 15
    제 13 항에 있어서, 검출 단계가 세그먼트 간격이 최소한 음악 및 음성을 포함하는 최소한 하나의 각각의 오디오 이벤트를 각각 나타내는 한 개 이상의 선정된 오디오 특징을 나타내는 지의 여부를 결정하는 단계와, 결정 수단에 응답하여 간격을 각각의 오디오 이벤트와 관련시킴으로써 간격을 분류하는 단계와, 최소한 하나의 간격 그룹이 미리 정의된 세트의 메타 패턴 내의 메타 패턴과 일치하는 지의 여부를 결정하는 단계와, 간격 그룹이 메타 패턴과 일치하는 것이 결정될 때 간격 그룹을 메타 패턴 분류와 관련시키되, 오디오 신호의 색인이 간격 분류 및 메타 패턴 분류에 기초하여 표현되는 단계 를 포함하는 컴퓨터 실시 방법.
  16. 16
    제 15 항에 있어서, 세그먼트 간격이 한 개 이상의 선정된 오디오 특징을 나타내는 지의 여부를 결정하는 단계가 세그먼트에 관련된 한 개 이상의 오디오 특징이 각각의 임계치와 같은 지의 여부를 간격 내의 각각의 세그먼트에 대해 결정하는 단계와, 각각의 특징이 각각의 임계치와 같을 때 한 개 이상의 오디오 특징과 관련된 한 개 이상의 카운터를 각각 증가시키는 단계와, 한 개 이상의 카운터를 간격 내의 세그먼트의 수와 비교하되, 상기 간격 분류 로직 수단이 상기 비교 단계에 기초하여 간격을 분류하는 단계 를 포함하는 컴퓨터 실시 방법.
  17. 17
    제 16 항에 있어서, 간격을 분류하는 단계 중에 음성으로서 분류된 최소한 하나의 간격 내의 한 개 이상의 우세 주파수를 결정하는 단계와, 한 개 이상의 세그먼트가 우세 주파수의 상한 N%(N은 수이다)를 포함할 때 음성에서의 강조부와 한 개 이상의 세그먼트를 관련시키는 단계와, 한 개 이상의 세그먼트가 우세 주파수의 하한 N%(N은 수이다)를 포함할 때 음성에서의 결론 아이디어와 한 개 이상의 세그먼트를 관련시키는 단계 를 더 포함하는 컴퓨터 실시 방법.
  18. 18
    제 17 항에 있어서, 음성에서의 강조부와 모두 관련된 임시 순서 세그먼트가 선정된 기간 보다 긴 기간을 정의하는 지의 여부를 결정하고, 만일 그렇다면 임시 순서 세그먼트를 중요한 아이디어 언어로서 정의 및 색인하는 단계를 더 포함하는 컴퓨터 실시 방법.
  19. 19
    컴퓨터 프로그램 제품에 있어서, 디지털 처리 장치로 판독가능한 컴퓨터 프로그램 기억 장치와, 프로그램 기억 장치 상의 프로그램 수단을 포함하되, 최소한 하나의 오디오 신호를 인덱싱하기 위한 방법을 실행하기 위해 디지털 처리 장치로 수행가능한 명령어를 실시하는 프로그램 코드 요소를 구비하며, 상기 방법 단계는, 한 개 이상의 세그먼트를 각각 포함하는 간격으로 오디오 신호를 번역하는 단계와, 간격 세그먼트가 최소한의 오디오 신호 부분의 제로 교차율, 최소한의 오디오 신호 부분의 에너지, 최소한의 오디오 신호 부분의 주파수 및 최소한의 오디오 신호 부분의 스펙트럼 에너지 집중을 포함하는 한 세트의 특징으로부터 선택되고, 최소한의 음악 및 음성을 포함하는 최소한 하나의 각각의 오디오 이벤트를 각각 나타내는 한 개 이상의 선정된 오디오 특징을 나타내는 지의 여부를 결정하는 단계와, 결정 단계에 응답하여 간격을 각각의 오디오 이벤트와 관련시킴으로써 간격을 분류하는 단계와, 신뢰 레벨에 최소한 일부분 기초하여 워드 및 대안을 색인하는 단계를 포함하는 컴퓨터 프로그램 제품.
  20. 20
    제 19 항에 있어서, 상기 방법은 신호로부터의 워드를 표현하기 위해 음성 인식 엔진을 이용하여 오디오 신호의 적절한 부분만을 처리하는 단계와, 최소한 소정의 워드에 대한 대안을 엔진으로부터 수신하는 단계와, 워드 및 대안 중 최소한 소정의 것에 대한 신뢰 레벨을 엔진으로부터 수신하는 단계와, 신뢰 레벨에 최소한 일부분 기초하여 워드 및 대안을 색인하는 단계 를 더 포함하는 컴퓨터 프로그램 제품.
  21. 21
    제 19 항에 있어서, 상기 방법은 최소한 하나의 간격 그룹이 미리 정의된 세트의 메타 패턴 내의 메타 패턴과 일치하는 지의 여부를 결정하는 단계와, 간격 그룹이 메타 패턴과 일치하는 것이 결정될 때 간격 그룹을 메타 패턴 분류와 관련시키되, 오디오 신호의 색인이 메타 패턴에 최소한 일부분 기초하는 단계를 포함하는 컴퓨터 프로그램 제품.
  22. 22
    제 21 항에 있어서, 상기 방법은 세그먼트에 관련된 한 개 이상의 오디오 특징이 각각의 임계치와 같은 지의 여부를 간격 내의 각각의 세그먼트에 대해 결정하는 단계와, 각각의 특징이 각각의 임계치와 같을 때 한 개 이상의 오디오 특징과 관련된 한 개 이상의 카운터를 각각 증가시키는 단계와, 한 개 이상의 카운터를 간격 내의 세그먼트의 수와 비교하되, 상기 간격 분류 로직 수단이 상기 비교 수단에 기초하여 분류를 행하는 단계를 더 포함하는 컴퓨터 프로그램 제품.
  23. 23
    제 22 항에 있어서, 상기 방법은 간격을 분류하는 단계중에 음성으로서 분류된 최소한 하나의 간격 내의 한 개 이상의 우세 주파수를 결정하는 단계와, 한 개 이상의 세그먼트가 우세 주파수의 상한 N%(N은 수이다)를 포함할 때 음성에서의 강조부와 한 개 이상의 세그먼트를 관련시키는 단계와, 한 개 이상의 세그먼트가 우세 주파수의 하한 N%(N은 수이다)를 포함할 때 음성에서의 결론 아이디어와 한 개 이상의 세그먼트를 관련시키는 단계를 더 포함하는 컴퓨터 프로그램 제품.
Independent claims23