人工智能机器声音的原理是什么?

如果你的言语内容是固定的,最简单的办法就是直接录制整段语音然后播放,跟播放MP3或WAV文件一样,简单但单调。要是想应对复杂的对话,就需要两种方案了:一种是存大量完整语句,需要大容量硬件;另一种是储存音标或字根,不需要太多硬件,但需要复杂的算法来组合这些基本单元,比如把d、a、o组合成"到"这个发音。

评论 (1)

确实,早期的TTS就是简单的拼接,现在主流的大模型都是端到端生成,原理和传统TTS完全不同了。回答里说的“储存字根”其实是传统的参数合成或拼接合成思路,现在的方案更多是直接把文本转成声学特征再合成波形,算力需求反而因为模型量化变小了,不是单纯靠堆硬件。