KR100554397B1

Interactive voice recognition system and method

Abstract

The present invention relates to an interactive voice recognition system and method, in which voice data of a scenario net structure is recorded in a memory to detect a scenario net number according to a user's voice command, and the detected scenario net By reading the voice data recorded in the memory by number and converting the read voice data into an audible frequency and outputting it, the voice data desired by the user can be provided to the user by step-by-step inquiry and response between the user and the system. It is effective in enabling an interactive conversation between the user and the product.Speech, Recognition, Interactive

KR100554397B1, drawing sheet 1
Sheet 1 of 6

Term

Term ended

Expired 25 March 2023, 3.5 years ago.

  1. Priority and filed
  2. Granted
  3. Expired
  4. Today

23 claims: 7 independent, 16 dependent

  1. 1
    삭제
  2. 2
    시나리오 넷 구조로 기록된 음성 데이터를 독출하기 위한 제 1 메모리;음성인식용 연산 정보가 미리 기록되어 있고, 사용자의 기록명령에 의해 적어도 하나 이상의 메시지 정보 또는 스케줄 정보가 기록되며, 사용자의 재생명령에 의해 해당 메시지 정보 또는 스케줄 정보를 독출하기 위한 제 2 메모리;마이크를 통해 입력된 사용자의 음성 신호를 디지탈 변환하여 출력하는 음성 입력수단;사용자의 조작에 따라 스위칭 신호를 출력하는 수동 조작수단;상기 음성 입력수단으로부터 입력되는 음성 신호 또는 상기 수동 조작수단에 의해 입력되는 스위칭 신호를 인식하여, 인식 결과 기록명령이면 상기 음성 입력수단으로부터 입력된 음성 신호를 상기 제 2 메모리에 기록하고, 인식 결과 재생명령이면 시나리오 넷 번호를 검출하여 상기 검출된 시나리오 넷 번호에 의해 상기 제 1 메모리에 기록된 음성 데이터를 독출하거나 또는 상기 제 2 메모리에 기록된 음성 데이터를 독출하는 음성 처리수단;및 상기 음성 처리수단으로부터 독출된 음성 데이터를 아날로그 변환하여 스피커를 통해 출력하는 음성 출력수단;을 포함하고, 상기 제 1 메모리는 상기 수동 조작수단를 통해 입력되는 스위칭 신호의 입력 횟수에 대한 정보와 상기 입력 횟수에 대응하는 음성 데이터를 더 포함하고 있어서, 상기 수동 조작수단에 의해 스위칭 신호가 인식되는 경우, 상기 음성 처리수단이 상기 수동 조작수단으로부터 입력된 스위칭 신호의 입력 횟수에 따라 상기 제 1 메모리에 기록된 음성 데이터를 독출함을 특징으로 하는 대화형 음성 인식 시스템.
  3. 3
    제 2 항에 있어서, 상기 제 1 메모리에는, 사용자와 시스템간에 이루어지는 단계적인 질의 및 응답에 의해 사용자가 원하는 음성 데이터가 독출되도록, 예상되는 사용자의 질의에 대응되는 적어도 하나 이상의 음성 데이터가 일정한 시나리오 넷 구조로 이미 기록되어 있는 것을 특징으로 하는 대화형 음성 인식 시스템.
  4. 4
    제 3 항에 있어서, 상기 제 1 메모리는, 메인 어드레스(Main Address) 영역, 서브 어드레스(Sub-Address) 영역 및 실제 정보(Real Information) 영역으로 구분되며, 상기 메인 어드레스 영역은, 음성인식용 정보를 갖는 영역, 압축신장용 정보를 갖는 영역, 시나리오 넷 번호 정보를 갖는 영역, 시나리오 음성 데이터 정보를 갖는 영역, 인식처리 제어용 정보를 갖는 영역, 기타 음성 데이터 정보를 갖는 영역을 포함하고, 상기 서브 어드레스 영역은, 음성 인식정보 어드레스(N 1 )를 갖는 영역, 압축용 신장용 정보 어드레스(N 2 )를 갖는 영역, 기타 정보(N n )를 갖는 영역을 포함하고, 상기 실제 정보 영역은, 적어도 하나 이상의 음성인식용 정보의 실제 데이터를 갖는 영역, 적어도 하나 이상의 압축 신장용 실제 데이터를 갖는 영역, 적어도 하나 이상의 기타 정보의 실제 데이터를 갖는 영역을 포함하는 것을 특징으로 하는 대화형 음성 인식 시스템.
  5. 5
    삭제
  6. 6
    제 2 항에 있어서, 상기 음성 입력수단은, 마이크를 통해 입력된 아날로그 음성 신호의 크기를 소정 레벨로 조정하여 출력하는 레벨 조정부;및 상기 레벨 조정부로부터 입력된 아날로그 음성 신호를 입력받아 디지털 음성 신호로 변환하여 출력하는 A/D 컨버터를 포함하는 것을 특징으로 하는 대화형 음성 인식 시스템.
  7. 7
    제 2 항에 있어서, 상기 음성 처리수단은, 음성인식용 연산 정보에 의해 상기 음성 입력수단으로부터 입력된 음성 신호를 인식하여 인식 정보를 출력하는 음성 인식부;상기 제 1 메모리 또는 상기 제 2 메모리로부터 독출된 음성 데이터를 소정의 데이터 신장 방식에 따라 신장하는 음성 신장부;상기 음성 입력수단으로부터 입력된 음성 신호를 소정 데이터 압축 방식에 따라 압축하여 상기 제 2 메모리에 기록하는 음성 압축부;노말 상태에서 상기 음성 입력수단으로부터 출력된 음성 신호를 상기 음성 인식부로 입력시키다가 스위칭 제어신호가 입력되면 상기 음성 입력수단으로부터 출력된 음성 신호를 상기 음성 압축부에 입력시키는 스위칭부;및 상기 음성 인식부로부터 입력된 인식 정보에 의해 기록명령인가 재생명령인가를 판단하여, 기록명령이면 상기 스위칭부에 스위칭 제어신호를 출력하여 상기 음성 입력수단으로부터 출력된 음성 데이터를 상기 음성 압축부로 입력시키도록 제어하고, 재생명령이면 시나리오 넷 번호를 검출하여 상기 검출된 시나리오 넷 번호에 의해 상기 제 1 메모리에 기록된 음성 데이터를 상기 음성 신장부로 출력하도록 제어하거나 또는 상기 제 2 메모리에 기록된 음성 데이터를 상기 음성 신장부로 출력하도록 제어하는 제어부를 포함하는 것을 특징으로 하는 대화형 음성 인식 시스템.
  8. 8
    제 7 항에 있어서, 상기 음성 인식부는, 사용자의 음성 신호 패턴이 달라진다거나 또는 연속어 문장 형태의 음성 신호가 입력되더라도 핵심적인 단어만을 인식할 수 있도록 하기 위해, HMM(Hidden Markove Model)을 이용한 비터비 알고리즘을 사용하여 음성 신호를 음소 단위로 인식하는 것을 특징으로 하는 대화형 음성 인식 시스템.
  9. 9
    제 2 항에 있어서, 상기 음성 출력수단은, 상기 음성 처리수단으로부터 입력된 디지털 음성 데이터를 아날로그 음성 신호로 변환하여 출력하는 D/A 컨버터;및 상기 D/A 컨버터로부터 입력된 아날로그 음성 신호를 전력 증폭하여 스피커를 통해 출력하는 전력 증폭부를 포함하는 것을 특징으로 하는 대화형 음성 인식 시스템.
  10. 10
    삭제
  11. 11
    제 2 항에 있어서, 상기 음성 처리수단의 제어에 따라 상기 제 1 메모리 또는 상기 제 2 메모리로부터 독출된 음성 데이터를 문자 메시지 또는 영상 이미지로 변환하여 화면에 표시하기 위한 디스플레이 구동수단을 더 포함하는 것을 특징으로 하는 대화형 음성 인식 시스템.
  12. 12
    제 2 항에 있어서, 상기 음성 처리수단의 제어에 따라 상기 제 1 메모리 또는 상기 제 2 메모리로부터 독출된 음성 데이터에 의해 해당 메커니즘을 구동시키는 메커니즘 구동수단을 더 포함하는 것을 특징으로 하는 대화형 음성 인식 시스템.
  13. 13
    사용자에 의해 입력된 음성 신호나 스위치 신호를 인식하여, 음성 신호를 기록할 것인가 아니면 음성 데이터를 재생할 것인가를 결정하는 제 10 단계;상기 제 10 단계에서 음성 신호 기록이 결정되었으면, 음성인식용 연산 정보가 미리 기록되어 있는 제2 메모리에 외부로부터 입력되는 사용자 음성신호인 적어도 하나 이상의 메시지 정보 또는 스케줄 정보를 기록하는 제 20 단계;및 상기 제 10 단계에서 사용자 음성 신호에 의해 음성 신호 재생이 결정되면, 시나리오 넷 번호를 검출하여 상기 검출된 시나리오 넷 번호에 의해 제 1 메모리에 시나리오 넷 구조로 기록된 음성 데이터를 독출하여 가청주파수로 변환 출력하거나 또는 제 2 메모리에 기록된 음성 데이터를 독출하여 가청주파수로 변환 출력하는 제 30 단계;상기 제 10 단계에서 사용자의 스위치 신호에 의해 음성 신호 재생이 결정되면, 사용자에 의해 입력되는 스위치 신호의 입력회수를 체크하여 상기 제 1 메모리에 기록된 스위칭 신호의 입력회수에 대한 정보를 검출하고, 상기 입력회수 정보에 대응하여 상기 제 1 메모리에 기록된 음성 데이터를 독출하여 가청주파수로 변환 출력하는 제 40 단계를 포함하는 것을 특징으로 하는 대화형 음성 인식 방법.
  14. 14
    제 13 항에 있어서, 상기 제 1 메모리는, 예상되는 사용자의 질의에 대응되는 적어도 하나 이상의 음성 데이터가 일정한 시나리오 넷 구조로 이미 기록되어 있어, 사용자와 시스템간에 이루어지는 단계적인 질의 및 응답에 의해 사용자가 원하는 음성 데이터가 독출되는 것을 특징으로 하는 대화형 음성 인식 방법.
  15. 15
    제 13 항 또는 제 14 항에 있어서, 상기 제 1 메모리는, 메인 어드레스(Main Address) 영역, 서브 어드레스(Sub-Address) 영역 및 실제 정보(Real Information) 영역으로 구분되며, 상기 메인 어드레스 영역은, 음성인식용 정보를 갖는 영역, 압축신장용 정보를 갖는 영역, 시나리오 넷 번호 정보를 갖는 영역, 시나리오 음성 데이터 정보를 갖는 영역, 인식처리 제어용 정보를 갖는 영역, 기타 음성 데이터 정보를 갖는 영역을 포함하고, 상기 서브 어드레스 영역은, 음성 인식정보 어드레스(N 1 )를 갖는 영역, 압축용 신장용 정보 어드레스(N 2 )를 갖는 영역, 기타 정보(N n )를 갖는 영역을 포함하고, 상기 실제 정보 영역은, 적어도 하나 이상의 음성인식용 정보의 실제 데이터를 갖는 영역, 적어도 하나 이상의 압축 신장용 실제 데이터를 갖는 영역 및 적어도 하나 이상의 기타 정보의 실제 데이터를 갖는 영역을 포함하는 것을 특징으로 하는 대화형 음성 인식 방법.
  16. 16
    삭제
  17. 17
    제 13 항에 있어서, 상기 제 10 단계는, 시스템 전원이 온되면 초기 시나리오 넷 번호를 검색하는 제 11 단계;외부로부터 음성 신호를 입력받는 제 12 단계;상기 제 11 단계에서 검색된 시나리오 넷 번호에 의해 시나리오 넷 번호 정보를 검색하여 상기 검색된 시나리오 넷 번호 정보에 의해 외부로부터 입력된 음성 신호를 인식할 것인가 아니면 기록할 것인가 아니면 상기 제 1 메모리 또는 상기 제 2 메모리에 기록된 음성 데이터를 재생할 것인가를 결정하는 제 13 단계;상기 제 13 단계에서 음성 신호 인식을 결정하였으면, 상기 시나리오 넷 번호 정보에 의해 인식 도메인을 검색하는 제 14 단계;상기 제 14 단계에서 검색된 인식 도메인에 의해 외부로부터 입력된 음성 신호를 인식하는 제 15 단계;상기 제 15 단계에서 인식된 결과를 시나리오 넷 번호 영역에 존재하는 인식용 패턴 정보로 처리하는 제 16 단계;및 상기 제 16 단계에서 처리된 인식 결과에 의해 다음 시나리오 넷 번호를 검색한 후 상기 제 13 단계로 복귀하는 제 17 단계로 이루어짐을 특징으로 하는 대화형 음성 인식 방법.
  18. 18
    제 17 항에 있어서, 상기 제 20 단계는, 상기 제 13 단계에서 음성 신호 기록이 결정되었으면 외부로부터 입력된 음성 신호를 소정의 데이터 압축 방식에 따라 압축시키는 제 21 단계;상기 제 21 단계에서 압축된 음성 데이터를 제 2 메모리에 기록하는 제 22 단계;및 상기 제 16 단계에서 처리된 인식 결과에 의해 다음 시나리오 넷 번호를 검색한 후 상기 제 13 단계로 복귀하는 제 23 단계로 이루어짐을 특징으로 하는 대화형 음성 인식 방법.
  19. 19
    제 17 항에 있어서, 상기 제 30 단계는, 상기 제 13 단계에서 음성 데이터 재생이 결정되었으면, 상기 제 13 단계에서 검색된 시나리오 넷 번호 정보에 의해 상기 제 1 메모리에 기록된 해당 음성 데이터를 독출하거나 또는 상기 제 2 메모리에 기록된 음성 데이터를 독출하는 제 31 단계;상기 제 31 단계에서 독출된 음성 데이터를 소정의 데이터 신장 방식에 따라 신장시켜 가청 주파수로 변환 출력하는 제 32 단계;상기 제 16 단계에서 처리된 인식 결과에 의해 다음 시나리오 넷 번호가 존재하는가를 판단하는 제 33 단계;및 상기 제 33 단계에서 판단된 결과 다음 시나리오 넷 번호가 존재하면 다음 시나리오 넷 번호를 검색하여 상기 제 12 단계로 복귀하고, 다음 시나리오 넷 번호가 존재하지 않으면 종료하는 제 34 단계로 이루어짐을 특징으로 하는 대화형 음성 인식 방법.
  20. 20
    제 17 항에 있어서, 상기 제 15 단계는, 사용자의 음성 신호의 패턴이 달라진다거나 또는 연속어 문장 형태의 음성 신호가 입력되더라도 핵심적인 단어만을 인식할 수 있도록 하기 위해, HMM(Hidden Markove Model)을 이용한 비터비 알고리즘을 사용하여 음성 신호를 음소 단위로 인식하는 것을 특징으로 하는 대화형 음성 인식 방법.
  21. 21
    삭제
  22. 22
    제 13 항에 있어서, 상기 제 1 메모리 또는 상기 제 2 메모리로부터 독출된 음성 데이터를 문자 메시지 또는 영상 이미지로 변환하여 화면에 표시하는 제 50 단계를 더 포함하는 것을 특징으로 대화형 음성 인식 방법.
  23. 23
    제 13 항에 있어서, 상기 제 1 메모리 또는 상기 제 2 메모리로부터 독출된 음성 데이터에 의해 해당 메커니즘을 구동시키는 제 60 단계를 더 포함하는 것을 특징으로 하는 대화형 음성 인식 방법.
Independent claims23