先列出困难,然后依次分析。1、语音激活检测(voice active detection,VAD)2、语音唤醒 (voice trigger,VT)3、回声消除(Echo Cancelling)4、低信噪比(signal to noise ratio, SNR)和 混响 (Reverberation)5、鸡尾酒会问题(cocktail-party problem )6、关于语音识别的未来1、语音激活检测(VAD),顾名思义,指的就是判断什么时候有语音什么时候没有语音(静音)。后续的语音信号处理或是语音识别都是在VAD截取出来的有效语音片段上进行的,这样可以极大的减少计算量,同时也能减少噪声误识别等情况。在近场识别的时候,这个算法可有可无:比如语音输入法中可以用手按着说话按键说话,结束之后松开。即便有,也可以做的比较简单:例如可以用能量、音高、过零率等方式进行判断。因为近场情况下信噪比(SNR)比较高,信号清晰,简单算法也可以做到有效可靠。远场识别情况下不能用手接触设备,必须使用VAD。这时噪声比较大,SNR下降剧烈,这种情况下传统的方法效果不理想。近几年深度神经网络(deep neural netword,DNN)火热,基于DNN(包括DNN, CNN, RNN)的语音系统成为标配,因此VAD使用DNN来做也合情合理。但即便是这样,仍然有很大的挑战,简单的如:开关门的声音、鼓掌、跺
...
继续阅读
(37)