Nova Patents
ES2645313T3

Automatic face extraction

Abstract

A method implemented by computer, comprising: detecting one or more speakers in an audio sample that corresponds to a video sample; storing a speaker's timeline, which identifies a speaker, by a speaker identifier and a speaker's location at all times along a speaker's timeline; detect, in the video sample, one or more facial images for each speaker detected; storing at least one facial image detected for each detected speaker in a face database; and associate a speaker timeline and a facial image with each speaker detected.

ES2645313T3, drawing sheet 1
Sheet 1 of 6

Term

Term ended

Projected expiry passed 18 October 2025, 0.9 years ago.

  1. Priority
  2. Filed
  3. Published
  4. Projected expiry
  5. Today

30 claims: 5 independent, 25 dependent

  1. 1
    ES 2 645 313 T3 REIVINDICACIONES 1. Un procedimiento implementado por ordenador, que comprende:detectar uno o más hablantes en una muestra de audio que corresponde a una muestra de vídeo;almacenar una línea de tiempo de hablante, que identifica un hablante, por un identificador de hablante y una ubicación de hablante en todo momento a lo largo de una línea de tiempo de hablante;detectar, en la muestra de vídeo, una o más imágenes faciales para cada hablante detectado;almacenar en una base de datos de rostros al menos una imagen facial detectada para cada hablante detectado;y asociar una línea de tiempo de hablante y una imagen facial con cada hablante detectado.
  2. 2
    El procedimiento implementado por ordenador de acuerdo con la reivindicación 1, en el que la detección de una o más imágenes faciales comprende adicionalmente el uso de un seguimiento de rostros para detectar una o más imágenes faciales.
  3. 3
    El procedimiento implementado por ordenador de acuerdo con la reivindicación 1, en el que la detección de uno o más hablantes comprende adicionalmente el uso de una localización de fuentes de sonido para detectar uno o más hablantes.
  4. 4
    El procedimiento implementado por ordenador de acuerdo con la reivindicación 1, que comprende adicionalmente:identificar más de una imagen facial para cada hablante;y seleccionar la mejor imagen facial para almacenar en la base de datos de rostros.
  5. 5
    El procedimiento implementado por ordenador de acuerdo con la reivindicación 4, en el que la selección comprende adicionalmente seleccionar como mejor imagen facial una imagen facial que incluya una vista facial más frontal.
  6. 6
    El procedimiento implementado por ordenador de acuerdo con la reivindicación 4, en el que la selección comprende adicionalmente seleccionar como mejor imagen facial una imagen facial que presente el menor movimiento.
  7. 7
    Procedimiento implementado por ordenador de acuerdo con la reivindicación 4, en el que la selección comprende adicionalmente seleccionar como mejor imagen facial una imagen facial que presente la máxima simetría.
  8. 8
    El procedimiento implementado por ordenador de acuerdo con la reivindicación 1, en el que la ubicación del hablante es señalada por una caja delimitadora de hablante identificada por coordenadas de muestra de vídeo.
  9. 9
    El procedimiento implementado por ordenador de acuerdo con la reivindicación 1, en el que la ubicación del hablante es señalada por ángulos faciales del hablante identificados por azimut y elevación en la muestra de vídeo.
  10. 10
    Un procedimiento implementado por ordenador, que comprende:mostrar visualmente una muestra audio/visual (A/V) que tenga uno o más hablantes incluidos en la misma;mostrar una línea de tiempo de hablante correspondiente a cada hablante, indicando la línea de tiempo de hablante en qué puntos a lo largo de un continuo temporal y desde qué ubicación está hablando el hablante correspondiente a la línea de tiempo de hablante;asociar una imagen facial de hablante con cada línea de tiempo de hablante, correspondiendo la imagen facial de hablante al hablante asociado con la línea de tiempo de hablante;y mostrar la imagen facial con la correspondiente línea de tiempo de hablante.
  11. 11
    El procedimiento implementado por ordenador de acuerdo con la reivindicación 10, que comprende adicionalmente recuperar la imagen facial de hablante de una base de datos de rostros que asocia cada identificador de hablante con al menos una imagen facial de un hablante que corresponda al identificador de hablante.
  12. 12
    Uno o más medios legibles por ordenador que contienen instrucciones ejecutables que, cuando se ejecutan, implementan el siguiente procedimiento:identificar cada hablante de una muestra A/V por un identificador de hablante;identificar una ubicación para cada hablante de la muestra A/V;extraer al menos una imagen facial para cada hablante identificado en la muestra A/V;crear una línea de tiempo de hablante para cada hablante identificado en la muestra A/V, indicando cada línea de tiempo de hablante un tiempo, un identificador de hablante y una ubicación de hablante;y asociar la imagen facial para un hablante con una línea de tiempo de hablante que corresponda al mismo hablante.
  13. 13
    Uno o más medios legibles por ordenador de acuerdo con la reivindicación 12, que comprenden adicionalmente identificar cada hablante utilizando localización de fuentes de sonido. ES 2 645 313 T3
  14. 14
    Uno o más medios legibles por ordenador de acuerdo con la reivindicación 12, que comprenden adlclonalmente Identificar cada ubicación de hablante utilizando un seguidor de rostros.
  15. 15
    Uno o más medios legibles por ordenador de acuerdo con la reivindicación 12, en el que la ubicación de los hablantes es identificada por una caja delimitadora de hablante en la muestra A/V.
  16. 16
    Uno o más medios legibles por ordenador de acuerdo con la reivindicación 12, que comprenden adicionalmente almacenar las líneas de tiempo de hablante y las imágenes faciales y enlazar cada línea de tiempo de hablante con la imagen facial apropiada.
  17. 17
    Uno o más medios legibles por ordenador de acuerdo con la reivindicación 12, que comprenden adicionalmente extraer más de una imagen facial para cada hablante.
  18. 18
    Uno o más medios legibles por ordenador de acuerdo con la reivindicación 17, que comprenden adicionalmente seleccionar la mejor imagen facial para asociar con la línea de tiempo de hablante.
  19. 19
    Uno o más medios legibles por ordenador de acuerdo con la reivindicación 18, en el que la selección de una mejor imagen facial comprende adicionalmente seleccionar una imagen facial que tenga una imagen facial frontal máxima.
  20. 20
    Uno o más medios legibles por ordenador de acuerdo con la reivindicación 18, en el que la selección de una mejor imagen facial comprende adicionalmente seleccionar una imagen facial que presente el menor movimiento.
  21. 21
    Uno o más medios legibles por ordenador de acuerdo con la reivindicación 18, en el que la selección de una mejor imagen facial comprende adicionalmente seleccionar una imagen facial que presente la máxima simetría facial.
  22. 22
    Uno o más medios legibles por ordenador, que comprenden:una base de datos de líneas de tiempo de hablantes que incluye una línea de tiempo de hablante para cada hablante de una muestra A/V, identificando cada línea de tiempo de hablante un hablante y una ubicación de hablante en múltiples ocasiones a lo largo de un continuo de tiempo;y una base de datos de rostros que incluye al menos una imagen facial para cada hablante identificado en una línea de tiempo de hablante y un identificador de hablante que vincula cada imagen facial con la apropiada línea de tiempo de hablante de la base de datos de líneas de tiempo de hablantes.
  23. 23
    Uno o más medios legibles por ordenador de acuerdo con la reivindicación 22, en el que cada línea de tiempo de hablante de la base de datos de líneas de tiempo de hablantes incluye el identificador de hablante apropiado para enlazar la base de datos de líneas de tiempo de hablantes con la base de datos de rostros.
  24. 24
    Un sistema, que comprende:una muestra A/V;medios para identificar cada hablante que aparece en la muestra A/V;medios para identificar una imagen facial para cada hablante identificado en la muestra A/V;medios para crear una línea de tiempo de hablante para cada hablante identificado en la muestra de A/V;y medios para asociar una imagen facial con una línea de tiempo de hablante apropiada;en el que los medios para identificar cada hablante comprenden además un localizador de fuentes de sonido.
  25. 25
    El sistema de acuerdo con la reivindicación 24, en el que los medios para identificar una imagen facial comprenden además un seguidor de rostros.
  26. 26
    El sistema de acuerdo con la reivindicación 24, en el que una línea de tiempo de hablante identifica un hablante asociado con la línea de tiempo de hablante mediante un identificador de hablante y una ubicación de hablante para cada una de múltiples ocasiones a lo largo de un continuo de tiempo.
  27. 27
    El sistema de acuerdo con la reivindicación 26, en el que la asociación de una imagen facial con una línea de tiempo de hablante apropiada comprende adicionalmente asociar cada imagen facial con el identificador de hablante.
  28. 28
    El sistema de acuerdo con la reivindicación 24, que comprende adicionalmente almacenar las líneas de tiempo de hablante y las imágenes faciales.
  29. 29
    El sistema de acuerdo con la reivindicación 28, en el que las líneas de tiempo de hablante y las imágenes faciales se almacenan por separado.
  30. 30
    El sistema de acuerdo con la reivindicación 24, en el que la muestra A/V comprende además una reunión grabada.
Independent claims30