我视频里那个像真人的 AI 配音,是怎么做出来的?

起因

10 月 4 日,知识星球里星友 Rock 留言:「王老师最近的视频非常高产啊,啥套餐啊这么奢侈」

后来他又追问了一句,说「下篇该讲讲怎么做视频了」,说我视频里各种风格、各种语气都驾驭得很轻松,他特别想学。

既然大家想学,咱们就来写一篇好了。不过做视频是个系统工程,涉及脚本、画面、剪辑、动效和配音。如果眉毛胡子一把抓,很容易让人望而却步。咱们得讲究梯次递进,一步一步来。

做视频的第一步,必须先把旁白声音做好。画面哪怕简朴一些,只要声音自然真诚,观众就能安安心心看下去;可声音一旦显得假,哪怕画面再炫丽,那种浓浓的人造塑料感也会立刻把人劝退。

所以咱们今天就先来说说音频。至于 Rock 问的套餐和整体开销,等后面讲到视频制作时再一并细说。

底子

聊音频和声音克隆,对我来说其实不是个全新的话题。

早在 2025 年 6 月,我就在 B 站发布过一条视频,叫做 《我用 AI 克隆了自己的声音,日语专业朋友听完激动到给我打电话》 。

后来,我又在公众号写过一篇 《如何用 Claude Skill 做教学视频?》 ,里面专门梳理过我是怎么给自动化视频配音搭脚手架的。

刚开始图省事,我先尝试了微软 Edge 的免费音色,挑了一个叫「云扬」的专业播音腔男声。好用,但终究不是我的声音,观众看了不满意。

于是我很快转向了 MiniMax,用它来克隆我自己的真实声音。平时由 MiniMax 挑大梁,MiniMax 的接口不可用时,就退回 Edge。

这套以 MiniMax 为核心的方案,真正基本成型是在去年年末到今年年初。

之后做重点讲解视频时,我一直都在用它。这一用就超过了大半年。

在这大半年的时间里,市面上陆续冒出了不少主打声音克隆的新工具,我也陆陆续续测过不少竞品。但无论怎么对比,当时综合看下来,确实都没有 MiniMax 顺手好用。

语料

随着视频发得越来越多,星球里经常有朋友跑来问我:王老师,我也去试了 ListenHub、ElevenLabs,或者在 YouMind 里试过声音克隆,为什么做出来的效果怎么听都不如你视频里的声音自然?总觉得「差了口气」,问题到底出在哪儿?

面对这种困惑,我的回答通常只有两点:第一是模型本身的能力,第二是你喂给它的语料。

很多人对声音克隆有一种误解,以为只要选个好模型,随便从手机里翻出一段几秒钟的日常语音丢进去,模型就能自动学会你说话的全部精髓。其实根本不是那么回事。我也反复试过各种各样的语料准备方式,出来的声音质感可以说千差万别。

我之前就做过一次试验。为了图省事,我顺手从一段公开视频的开头截取了 4 秒多钟开场白,那是我精神饱满、热情洋溢地跟观众打招呼的片段,我把它直接当成了克隆的参考音频。

可拿这样的开场当参考,念到严肃内容时,听着却「像一直在想乐」,总像憋着笑,感觉就不太好。

这就是语料的影响。克隆模型不仅会学习你的基本音色,参考录音里你当时是什么说话状态,它也会一并学过去。

效果

最近,新一批视频发出来给大家看的时候,评论区和后台收到的反馈非常有意思,甚至可以说是两个极端。

很多读者和星友的第一反应是惊喜。不少人留言说,完全听不出这是 AI 生成的配音,还以为是我自己坐在麦克风前一句一句录出来的原声。听到大家这么说,我心里自然很高兴,说明这几个月在声音上的琢磨没有白费。

但也有另外一些朋友,几乎一听就给出了截然相反的判断:这绝对是 AI,不可能是真人。

他们的理由很直接:这声音听起来太完美了,每一个字都无比饱满,每一句话都连贯顺滑,中间连半口粗气都不带喘的,根本不像真人日常讲话该有的样子。

这里面的反差很有意思:声音如果做得太糙,大家一听就知道是假的;可要是打磨得过于完美,中间连口气都不喘,大家同样一眼就能看穿,因为真人说话根本不可能不喘气。

从最初用了大半年的 MiniMax,到如今大家耳朵里听到的这种语音克隆,中间我到底换过哪几家?被大家评价为「太完美、不喘气」的声音,后来又是怎么被我一步步改回带着烟火气的「人话」的?

下面咱们就来详细拆解一下。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论