近年来,人工智能和人类生活越来越息息相关,人们一直憧憬身边可以出现一个真正的贾维斯,希望有一天计算机真的可以像人一样能听会说,能理解会思考。而实现这一目标的重要前提是计算机能够准确无误的听懂人类的话语,也就是说高度准确的语音识别系统是必不可少的。
作为国内智能语音与人工智能产业的佼佼者,科大讯飞一直引领中文语音识别技术不断进步。去年12月21日,在北京国家会议中心召开的以“AI复始,万物更新”为主题的年度发布会上,科大讯飞提出了以前馈型序列记忆网络(FSMN,Feed-forwardSequentialMemoryNetwork)为代表的新一代语音识别系统,让大家眼前一亮[1]。
通过进一步的研究,我们在FSMN的基础之上,再次推出全新的语音识别框架,将语音识别问题创新性的重新定义为“看语谱图”的问题,并通过引入图像识别中主流的深度卷积神经网络(CNN,ConvolutionalNeuralNetwork)实现了对语谱图的全新解析,同时打破了传统深度语音识别系统对DNN和RNN等网络结构的依赖,最终将识别准确度提高到了新的高度。
今天我们将揭开它的神秘面纱。
FSMN我们在上一期文章中(
转载请注明:http://www.0431gb208.com/sjszlfa/62.html