人工智能语音合成能代替真人配音吗?

汉语博大精深,同样的字组成不同词语发音和意思都不同,语言结构让人琢磨不透。现在的AI做不到像人一样把握说话语气和发音轻重,如果胡乱推广可能会引发社会问题,所以现阶段还不能完全替代。

目前AI语音功能只能满足一小部分需求。你看喜马拉雅那些听书APP,真人讲的故事非常有感情,听着带劲;但AI读出来的稿件干巴巴的,没有感情,也表现不出角色特色。听新闻也许还能凑合,但其他不行。

虽然现在商用广泛,像百度、阿里、腾讯、科大讯飞这些大厂都有很丰富的经验和技术接口,应用也在导航、播报、教育等领域普及。但目前的缺点还是很明显的,就是播报语气比较生硬,不够自然。

未来二三十年内,开发出那种流畅度、音调和人声变化都跟真人一样的AI是完全有可能的。现在其实已经商用了很多,比如电话广告、语音客服,还有头条上常见的电影解说,只要写好文本AI就能自动配音。

其实想自己做配音也挺简单,不用非找专业老师。准备好视频文稿,用PR或AU这些后期软件对干音降噪处理,再做音画同步,操作简单快捷。当然如果追求极致效果,还是得找像声咔配音这样有上千名老师的专业平台。

想要将来完全替代真人,AI必须具备高阶的情绪模拟能力和自主学习能力。现在的短板在于无法模仿真人特有的语调情感,多音字容易读错,情感不到位,这对视频来说是致命打击,还是选真人配音更真实。

我觉得英语配音被替代只是时间问题,但汉语确实很难。因为汉语是象形文字,同音字太多,必须依赖语境才能准确识别意思。要是AI真能完美解决这个难题,那它的人工智能水平基本就接近真人了。