CN105453025A

Visual confirmation for a recognized voice-initiated action

Abstract

The techniques described herein provide computing devices that are configured to provide an indication that the computing device has recognized a voice-initiated action. In one example, a method for outputting, by the computing device, a voice recognition graphical user interface (GUI) having at least one element in a first visual format for display is provided. The method further includes receiving audio data by the computing device and determining, by the computing device, a voice-initiated action based on the audio data. The method further includes outputting an updated voice recognition GUI for display while receiving additional audio data and before performing the voice initiation action based on the audio data, where the updated voice recognition GUI is A second visual format different from the first visual format is used to display the at least one element to indicate that the voice-initiated action has been recognized.

CN105453025A, drawing sheet 1
Sheet 1 of 11

Term

7.7 yearsto projected expiry

Projected expiry 19 June 2034, counted from filing; an application has no term until it is granted.

  1. Priority
  2. Filed
  3. Published
  4. Today
  5. Projected expiry

14 claims: 5 independent, 9 dependent

  1. 1
    一种方法,包括: 由计算设备输出具有以第一视觉格式的至少一个元素的话音识别图形用户界面(GUI) 以用于显示; 由所述计算设备接收音频数据; 由所述计算设备基于所述音频数据来确定语音发起动作;以及 在接收到附加音频数据的同时并且在基于所述音频数据来执行所述语音发起动作之 前,输出已更新的话音识别GUI以用于显示,在所述已更新的话音识别GUI中以不同于所述 第一视觉格式的第二视觉格式来显示所述至少一个元素,以指示所述语音发起动作已被识 别。
  2. 2
    根据权利要求1所述的方法,进一步包括: 由所述计算设备基于所述音频数据来确定转录; 识别与所述语音发起动作相关联的所述转录的一个或多个单词,其中,所述至少一个 元素包括所述一个或多个单词的至少一部分;以及 由所述计算设备在输出所述已更新的话音识别GUI之前输出所述转录的不包括所述一 个或多个单词的一部分以用于以所述第一视觉格式显示。
  3. 3
    根据权利要求1至2中的任一项所述的方法, 其中,在图像、色彩、字体、大小、突出显示、风格、以及位置中的一个或多个方面,所述 第二视觉格式不同于所述第一视觉格式。
  4. 4
    根据权利要求1至3中的任一项所述的方法,进一步包括: 由所述计算设备来确定所述音频数据的转录,其中: 输出所述话音识别GUI进一步包括输出所述转录的至少一部分,以及 输出所述已更新的话音识别GUI进一步包括裁剪被输出的所述转录的所述至少一部 分,使得所述转录的与所述语音发起动作相关的所述一个或多个单词被显示。
  5. 5
    根据权利要求1至4中的任一项所述的方法, 其中,所述至少一个元素的所述第一视觉格式包括表示所述计算设备的话音识别模式 的图像,以及其中,所述至少一个元素的所述第二视觉格式包括表示所述语音发起动作的 图像。
  6. 6
    根据权利要求5所述的方法, 其中,表示所述话音识别模式的所述图像响应于基于所述音频数据确定所述语音发起 动作而变体成表示所述语音发起动作的所述图像。
  7. 7
    根据权利要求1至6中的任一项所述的方法,进一步包括 响应于基于所述音频数据而确定所述语音发起动作,由所述计算设备来执行所述语音 发起动作。
  8. 8
    根据权利要求7所述的方法, 其中,执行所述语音发起动作进一步响应于由所述计算设备接收到确认所述语音发起 动作正确的指示。
  9. 9
    根据权利要求1至8中的任一项所述的方法,进一步包括,由所述计算设备并且至少 部分地基于所述音频数据来确定所述语音发起动作。
  10. 10
    根据权利要求9所述的方法,其中,确定所述语音发起动作进一步包括至少部分地 基于以所述音频数据为基础的所述转录的单词或短语与动作的预配置的集合的比较来确 定所述语音发起动作。
  11. 11
    根据权利要求9至10中的任一项所述的方法,其中,确定所述语音发起动作进一步 包括: 由所述计算设备来识别所述转录中的至少一个动词;以及 将所述至少一个动词与来自动词集合的一个或多个动词相比较,所述动词集合中的每 个动词与来自多个动作的至少一个动作相对应。
  12. 12
    根据权利要求9至11中的任一项所述的方法,其中,确定所述语音发起动作进一步 包括以下各项中的至少一个: 由所述计算设备至少部分地基于来自所述计算设备的数据来确定场境;以及 由所述计算设备至少部分地基于所述场境来确定所述语音发起动作;或者 响应于接收到取消输入的指示,由所述计算设备来输出所述至少一个元素以便以所述 第一视觉格式来显示。 13 .一种计算机可读存储介质,所述计算机可读存储介质被用指令编码以使得一个或 多个可编程处理器执行权利要求1至12中的任一项所述的方法。
  13. 13
    14. 一种计算设备,包括: 显示设备;以及 一个或多个处理器,所述一个或多个处理器可操作以: 输出具有以第一视觉格式的至少一个元素的话音识别图形用户界面(GUI)以用于在所 述显示设备处显示; 接收音频数据; 基于所述音频数据来确定语音发起动作;以及 在接收到附加音频数据的同时且在基于所述音频数据来执行所述语音发起动作之前, 输出已更新的话音识别GUI以用于显示,在所述已更新的话音识别GUI中以不同于所述第一 视觉格式的第二视觉格式来显示所述至少一个元素,以指示所述语音发起动作已被识别。
  14. 14
    15. 根据权利要求14所述的计算设备,进一步包括用于执行权利要求1至12中的任一项 所述的方法的装置。
Independent claims14