人工智能机器声音的原理是什么?
机器能听懂人话,主要靠三个原理:第一,对语音信息通过短时幅度谱的时间变化模式来编码;第二,处理声学信号时,用十个有区别性、离散性的符号来表示;第三,语音交互是个认知过程,不能脱离语言的语法、语义和结构。实际操作中,会把语音分成很多小段,提取MFCC特征,把声波转成多维向量形成矩阵,也就是观察序列,这样声音信号就变成了明确的数字信号,再跟数据库匹配做出反应。
机器能听懂人话,主要靠三个原理:第一,对语音信息通过短时幅度谱的时间变化模式来编码;第二,处理声学信号时,用十个有区别性、离散性的符号来表示;第三,语音交互是个认知过程,不能脱离语言的语法、语义和结构。实际操作中,会把语音分成很多小段,提取MFCC特征,把声波转成多维向量形成矩阵,也就是观察序列,这样声音信号就变成了明确的数字信号,再跟数据库匹配做出反应。
把复杂原理总结得挺精炼。不过MFCC特征提取只是第一步,现在的深度学习模型更看重端到端的特征学习和语义理解,光靠向量匹配已经不够看了,毕竟语境和语气才是聊天的灵魂。