国内刊号:51-1267/TN
国际刊号:1001-893X
发布日期:
作者:李冬梅,李明,郭莉莉,张士兵
单位:(南通大学 信息科学技术学院,江苏 南通226019;南通大学 信息科学技术学院,江苏 南通226020;南通大学 信息科学技术学院,江苏 南通226021;南通大学 信息科学技术学院,江苏 南通226022)
关键词:氦语音;语音识别;机器学习;深度卷积神经网络(DCNN);连接时序分类(CTC);
基金:国家自然科学基金资助项目(61871241);江苏省科研与实践创新计划项目(KYCX20_2828)
为了解决传统氦语音处理技术存在的处理速度慢、计算复杂、操作困难等问题,提出了一种采用机器学习的氦语音识别方法,通过深层网络学习高维信息、提取多种特征,不但解决了过拟合问题,同时也具备了字错率(Word Error Rate,WER)低、收敛速度快的优点。首先自建氦语音孤立词和连续氦语音数据库,对氦语音数据预处理,提取的语音特征主要包括共振峰特征、基音周期特征和FBank(Filter Bank)特征。之后将语音特征输入到由深度卷积神经网络(Deep Convolutional Neural Network,DCNN)和连接时序分类(Connectionist Temporal Classification,CTC)组成的声学模型进行语音到拼音的建模,最后应用Transformer语言模型得到汉字输出。提取共振峰特征、基音周期特征和FBank特征的氦语音孤立词识别模型相比于仅提取FBank特征的识别模型的WER降低了7.91%,连续氦语音识别模型的WER降低了14.95%。氦语音孤立词识别模型的最优WER为1.53%,连续氦语音识别模型的最优WER为36.89%。结果表明,所提方法可有效识别氦语音。
来源:2022年第9期
《电讯技术》期刊编辑部