机器能听懂人话,主要靠三个原理:第一,对语音信息通过短时幅度谱的时间变化模式来编码;第二,处理声学信号时,用十个有区别性、离散性的符号来表示;第三,语音交互是个认知过程,不能脱离语言的语法、语义和结构。实际操作中,会把语音分成很多小段,提取MFCC特征,把声波转成多维向量形成矩阵,也就是观察序列,这样声音信号就变成了明确的数字信号,再跟数据库匹配做出反应。
人工智能机器声音的原理是什么?
现在的语音识别和语言转化技术,本质上都离不开统计学和概率论。虽然这种方法做不到百分之百准确,但准确率已经相当高,效果也很理想。可以说,统计学和概率论是未来智能技术发展的基石,没有它们,机器根本没法理解我们说的话。
人工智能的机器声音,从非专业角度看,核心是建立文字发音字典库。每个文字对应多个发音数字,以方便数字化分析的方式存储音料。机器根据设定语句发音相对好实现,真正的难点在于让发音连贯自然。反过来把语音转成文字,就得用统计学和概率论来分析,找出相似度最高的语音,匹配对应的文字。
这种基于字根组合的方法,甚至可以延伸到控制语速和音量来表达情绪。就像人在打字时,脑子里先想好要表达的内容,然后找到对应的字根组合成字,再组成一句话。算法越复杂,机器声音就越自然,越能传达情感。
人工智能虽然计算能力强、记忆能力强、学习能力强,但机器不能取代人脑。AI缺乏人类的思考能力、应变能力和创新能力。回顾AlphaGo与李世石的人机大战,第四局中李世石巧妙营造欺骗性模式扳回一局,这说明AI应变性明显不足,无法处理完全未知的情景。目前AI能自己去学习,还不能自己去思考,而且本质上还是计算机程序,存在被破解和植入病毒的风险,只能作为人类大脑的延伸工具,而不是替代品。
如果你的言语内容是固定的,最简单的办法就是直接录制整段语音然后播放,跟播放MP3或WAV文件一样,简单但单调。要是想应对复杂的对话,就需要两种方案了:一种是存大量完整语句,需要大容量硬件;另一种是储存音标或字根,不需要太多硬件,但需要复杂的算法来组合这些基本单元,比如把d、a、o组合成"到"这个发音。
虽然原理听起来不难,但想实现精准的语音识别和语音智能,需要庞大的数据库和更先进的算法。在这方面,国内的大型IT企业做得相当到位。不过也要明白,机器的工作原理分三代:第一代是线控或遥控指令机械手,第二代是程序控制自动机械装置,第三代才是人工智能,也就是能通过计算机分析自动处理的仿人类技能机械。
从触发词说起,无论是"嘿Siri"还是"小艺小艺",都是通过语音识别系统实现的。先做特征提取和模式匹配,参考模式库里的基本单元,通过系统训练和识别,当特定触发词出现时,收录声音并通过声学模型和语言模型解码,反馈给控制系统一个确定信号。对于触发词之外的语音命令,还需要结合语音学、语言学、数理统计、神经生物学等技术,让机器真正听懂人话。