WO2018166316A1

Speaker's flu symptoms recognition method fused with multiple end-to-end neural network structures

Abstract

A speaker's flu symptoms recognition method fused with multiple end-to-end neural network structures consisting of four end-to-end neutral networks, the method comprising: when the input is an original speech or speech spectrum, extracting optimal features by means of a convolutional neural network, and finally performing classification by means of a long/short-term memory network or a fully connected network; and when the input is mel frequency cepstral coefficient (MFCC) or constant Q cepstral coefficient (CQCC), directly performing classification by means of the long/short-term memory network, and finally fusing these systems together. The whole process integrates feature extraction and model classification, such that the whole speaker process of recognizing flu symptoms of a speaker can be simpler and quicker.

WO2018166316A1, drawing sheet 1
Sheet 1 of 3

Term

No projected expiry on record.

  1. Priority
  2. Filed
  3. Published
  4. Today

5 claims: 1 independent, 4 dependent

  1. c01
    融合多种端到端深度学习结构的说话人感冒症状识别方法,包括:S1、构建输入为语音,网络为卷积神经网络加上长短期记忆网络的端到端神经网络;S2、构建输入为语音频谱,网络为卷积神经网络加上长短期记忆网络的端到端神经网络;S3、构建输入为语音频谱,网络为卷积神经网络加上全连接的端到端神经网络;S4、构建输入为语音MFCC/CQCC特征,网络为长短期记忆网络的端到端神经网络;S5、融合以上四种端到端神经网络进行说话人感冒症状识别;
  2. c03
    根据权利要求1所述的融合多种端到端深度学习结构的说话人感冒症状识别方法,其特征还在于:S1中所述的输入为语音、网络为CNN+LSTM的端到端神经网络,具体为,输入语音切分为相同大小的片段比如40ms,然后进行均值归一化,而相对应的卷积神经网络由8个模块组成,每一个模块是由一维卷积层、ReLU激活层、一维最大池化层组成的,其中,每一个卷积核的大小为32,池化核的大小为2,池化步长为2。而后使用长短期记忆网络进行分类。
  3. c04
    根据权利要求1所述的融合多种端到端深度学习结构的说话人感冒症状识别方法,其特征还在于:S2中所述的输入为语音频谱,网络为为CNN+LSTM的端到端神经网络,具体为:输入语音切分为相同大小的片段,进行快速傅里叶变换,求出语音片段的频谱图,卷积神经网络则由6个模块组成,每个模块由二维卷积层、ReLU激活层、二维最大池化层组成。其中,第一个卷积层使用7*7的卷积层,第二层使用5*5的卷积核,剩下4层使用3*3的卷积核,所有的最大池化层使用3*3的池化核,池化步长为2。最后经过LSTM网络进行分类。
  4. c05
    根据权利要求1所述的融合多种端到端深度学习结构的说话人感冒症状识别方法,其特征还在于:S3中所述的输入为语音频谱,网络为为CNN+LSTM的端到端神经网络,具体为:输入语音切分为相同大小的片段,进行快速傅里叶变换,求出语音片段的频谱图,卷积神经网络则由6个模块组成,每个模块由二维卷积层、ReLU激活层、二维最大池化层组成。其中,第一个卷积层使用7*7的卷积层,第二层使用5*5的卷积核,剩下4层使用3*3的卷积核,所有的最大池化层使用3*3的池化核,池化步长为2。再经过一个全连接层,最后经过Softmax进行分类。
  5. c06
    根据权利要求1所述的融合多种端到端深度学习结构的说话人感冒症状识别方法,其特征还在于:S4的MFCC特征通过对语音进行预加重,加窗分帧、快速傅里叶变换、梅尔刻度三角滤波器组滤波、取对数运算、离散余弦变换后最终得到的,而CQCC特征是通过对语音进行常数Q变换、求能量谱密度、取对数操作、余弦变换得到的。进行经过长短期记忆网路进行分类。对语音提取MFCC或者CQCC特征作为神经网络的输入,最后经过长短期记忆网络进行分类。