大多博主共用少数热门 AI 音色,再统一倍速,加上 AI 朗读语调模板化,听起来就很像。
现在太普遍了,刷十个短视频,八个的旁白是同一个腔,字正腔圆没起伏,听三句就知道是机器配的。机器配音为什么没感情?那是因为普通的语音合成是按字读的,重音、停连、语气词这些它不管。新一代的做法是文本先过一遍理解,哪里该强调哪里该带笑意,再生成声音。这个问题很多人注意到了,比如声网在实时合成的场景里把情感标签做进去了,同样一句话能读出不同的情绪,新闻播报一个调、闲聊吐槽又一个调。配音的机器味会越来越淡,这条技术线在快速往前走。