ES2420559T3

A mass-scale, user-independent, device-independent, voice message to text conversion system

Abstract

A large-scale vocal messaging system, independent of the user and independent of the device, which allows to convert an unstructured vocal message into text for a visual presentation on a screen; characterized in that the system comprises (i) subsystems implemented by computer, as well as (ii) a network connection to provide transcription and quality control to human operators; the system being adapted to optimize the effectiveness of human operators, including: a grid subsystem implemented by computer to generate a grid of possible sequences of phrases or words and to allow a human operator to guide a conversion subsystem by presenting one or more converted candidate words or phrases from the grid and to allow the operator select the candidate word or phrase or by entering one or more characters for a different converted word, Operationally start the conversion subsystem to propose an alternative word or phrase.

Term

0.4 yearsto projected expiry

Projected expiry 12 February 2027, counted from filing; an application has no term until it is granted.

  1. Priority
  2. Filed
  3. Published
  4. Today
  5. Projected expiry

17 claims: 3 independent, 14 dependent

  1. 1
    REIVINDICACIONES 1. Un sistema de mensajería vocal a gran escala, independiente del usuario e independiente del dispositivo, que permite convertir un mensaje vocal no estructurado en texto para una presentación visual en una pantalla; caracterizado porque el sistema comprende (i) subsistemas puestos en práctica por ordenador, así como (ii) una conexión de red para proporcionar una transcripción y un control de calidad a operadores humanos; estando el sistema adaptado para optimizar la eficacia de los operadores humanos comprendiendo, además:un subsistema de retícula puesta en práctica por ordenador para generar una retícula de posibles secuencias de frases o palabras y para permitir a un operador humano guiar un subsistema de conversión presentando una o más palabras o frases convertidas candidatas a partir de la retícula y para permitir al operador seleccionar la palabra o la frase candidata o bien, introduciendo uno o varios caracteres para una palabra convertida diferente, iniciar operativamente el subsistema de conversión para proponer una palabra o frase alternativa.
  2. 2
    El sistema según la reivindicación 1, en donde el subsistema de retícula está configurado para recibir entradas procedentes de un subsistema que gestiona la información de registro histórico de llamada del par.
  3. 3
    El sistema según la reivindicación 1, en donde el subsistema de retícula está configurado para recibir entradas procedentes de recursos de conversión.
  4. 4
    El sistema según la reivindicación 1, en donde el subsistema de retícula está configurado para recibir entradas procedentes de un subsistema de contexto que tiene conocimiento del contexto de un mensaje.
  5. 5
    El sistema según la reivindicación 1, en donde el subsistema de retícula está configurado para aprender, a partir de las entradas del operador humano, palabras o frases probables que corresponden a un modelo sonoro.
  6. 6
    El sistema según la reivindicación 1, en donde el operador humano debe seleccionar solamente una sola tecla para aceptar una palabra o una frase.
  7. 7
    El sistema según la reivindicación 1, en donde el subsistema de retícula está configurado para proporcionar automáticamente mayúsculas iniciales y signos de puntuación.
  8. 8
    El sistema según la reivindicación 1, en donde el subsistema de retícula está configurado para proponer números, nombres reales, direcciones web, direcciones de correo electrónico, direcciones físicas, información de localización u otras coordenadas candidatas.
  9. 9
    El sistema según la reivindicación 1, en donde el subsistema de retícula está configurado para realizar automáticamente la distinción entre las partes del mensaje que son susceptibles de ser importantes y las que son susceptibles de no tener importancia.
  10. 10
    El sistema según la reivindicación 1, en donde las partes sin importancia del mensaje son confirmadas por el operador, como perteneciente a una clase propuesta por el subsistema de retícula y a continuación, se convierten únicamente por un motor de reconocimiento vocal ASR del aparato (1).
  11. 11
    El sistema según la reivindicación 1, en donde el operador humano puede pronunciar la palabra correcta en el destino del sistema de conversión, que está configurado para su transcripción automática más adelante.
  12. 12
    El sistema según la reivindicación 3, en donde los recursos de conversión analizan una palabra o una frase convertida con respecto a un cuerpo de conocimiento en línea.
  13. 13
    El sistema según la reivindicación 12, en donde el cuerpo de conocimiento en línea es Internet, accesible por un motor de búsqueda.
  14. 14
    El sistema según la reivindicación 13, en donde el cuerpo de conocimiento en línea es una base de datos de motor de búsqueda.
  15. 15
    El sistema según una cualquiera de las reivindicaciones precedentes, en donde el mensaje es uno de los mensajes siguientes:(a) un correo de voz destinado a un teléfono móvil y el sistema está configurado para convertir el mensaje vocal en texto y enviar el mensaje vocal a ese teléfono móvil o (b) un mensaje vocal destinado a un servicio de mensajería instantánea y el sistema está configurado para convertir el mensaje vocal en texto y enviar el mensaje vocal a un servicio de mensajería instantánea para su presentación visual en una pantalla o (c) un mensaje vocal destinado a un servicio web y el sistema está configurado para convertir el mensaje vocal en texto y enviar el mensaje vocal a un servidor para una presentación visual como parte del servicio web.
  16. 16
    El sistema según cualquier reivindicación precedente, en donde el mensaje es uno de los mensajes siguientes:5 (a) un mensaje vocal destinado a convertirse al formato de texto y enviarse bajo la forma de mensaje de texto o (b) un mensaje vocal destinado a convertirse al formato de texto y enviarse en tanto como mensaje de correo electrónico o 10 (c) un mensaje vocal destinado a convertirse al formato de texto y enviarse bajo la forma de una nota o de un memorándum, por correo electrónico o texto, a un expedidor del mensaje.
  17. 17
    Un método que permite proporcionar un sistema de mensajería vocal a gran escala, independiente del usuario e 15 independiente del dispositivo, que convierte un mensaje vocal no estructurado en texto para una presentación visual en una pantalla, caracterizado por cuanto que el sistema comprende:(i) subsistemas puestos en práctica por ordenador así como (ii) una conexión de red para proporcionar una transcripción y un control de calidad a operadores humanos;optimizando el método la eficacia de los operadores humanos comprendiendo las etapas de: 20 un subsistema de retícula puesto en práctica por ordenador, que genera una retícula de posibles secuencias de palabras o frases y que permite a un operador humano guiar un subsistema de conversión presentándole una o más palabras o frases convertidas candidatas a partir de la retícula y que permite al operador seleccionar la palabra o la frase candidata o, introduciendo uno o varios caracteres para una palabra o una frase convertida diferente, para iniciar operativamente el subsistema de conversión para proponer una palabra o frase alternativa. Calidad de la voz y confianza en el Reconocedor Motor de ASR Modelos de Reconocedor de voz Control de calidad Procesamiento lenguaje postconversión Voz Correo de voz Clasificación de voz y unidad decisión sobre estrategia de conversión Mejora de la voz Figura 1 Entrada mensaje de voz Aplicación de Control de Calidad QC Gestor de cola de espera (TAT) Preprocesamiento Adaptación de canal, lenguaje, ruido ASR Multi-motor, independiente del usuario que habla Figura 2 Postprocesamiento Frases de lenguaje natural Salida de texto convertido Corregir: hi jonathan i will be in the stag and hounds at seven forty see you soon andy Salida en pantalla | hi john it's tam i will be into stagecoach after four to meet you soon amy Entrada: accept_word Salida: hi | john it's tam i will be into stagecoach after four to meet you soon amy Entrada: 3 * accept_char Salida: hi jo | hn it's tam i will be into stagecoach after four to meet you soon amy Entrada: n Salida: hi jon | athan i will be into stagecoach after four to meet you soon amy Entrada: 4 * accept_word 3 * accept_char Salida: hi jonathan i will be in | to stagecoach after four to meet you soon amy Entrada: space Salida: hi jonathan i will be in | the stadium from after four to meet you soon amy Entrada: accept_word 4 * accept_char Salida: hi jonathan i will be in the sta | dium from after four to meet you soon amy Entrada: g Salida: hi jonathan i will be in the stag | ecoach after four to meet you soon amy Entrada: " Salida: hi jonathan i will be in the stag | and hounds after four to meet you soon amy Entrada: 3 * accept_word 2 * accept_char Salida: hi jonathan i will be in the stag and hounds a | fter four to meet you soon amy Figura 3 Entrada: t Salida: hi jonathan i will be in the stag and hounds at | seven forty see you soon amy Entrada: 6 * accept_word 2 * accept_cbar Salida: hi jonathan i will be in the stag and hounds at seven forty see you soon a | my Entrada: n Salida: hi jonathan i will be in the stag and hounds at seven fourty see you soon a | ndy Entrada: accept_utterance Salida en pantalla: | HEY john it's tam i will be into stagecoach after four to SOON amy Figura 4
Independent claims17