一张照片 + 一份大纲,怎样让卡通版的自己替你做视频教程?

落差

我之前给你做过一段 AI 直出的 卷积神经网络原理讲解视频。

给朋友看时,我念叨了一句「连声音都是 AI 克隆的」,对方立即拉着我问教程在哪里。

可当时我自己心里一直有个疙瘩。那段视频的声音确实是我,听起来语气自然。但画面里除了白板、公式和动态图表,根本没有我这个人。

你在网上大概也见过不少类似的尝试。最常见的是幻灯片或者图文排版,文字整齐,但画面完全静止;稍微进一步的,是找一张精致的插画挂在背景里,底下配着口播,声音滔滔不绝,画面却像一张硬纸板立在那里;还有一种是带插图的图解文档,比如生成一份图文并茂的讲义,虽然清楚,但它本质上还是静态图文,既没有机位推拉,更没有主讲人的举止呼应。

这些形态翻来覆去,真正缺的不是更多精美素材,而恰恰是讲课的那个人。

一个老师站在讲台前,哪怕只是偶尔点个头、挥一下手,或者指一下屏幕上的重点,整堂课的气场就完全不同。听众会觉得有人在当面带着自己思考,而不是自己在独自面对一台放映机。

需求

既然缺的是讲课的人,那把人做进画面里不就行了吗?

真动手去试的时候,你会发现这件事远没有想象中那么简单。如果你也做过讲解视频,你心里想要的肯定不是套一个现成的网红换脸滤镜,而是一套真正能落地的标准。

首先,画出来的形象得像本人。平时熟悉你的学生、同事或者朋友,一眼看过去就知道这是王树义,而不是某个千篇一律的动漫人物。

其次,整段视频从头到尾必须是同一个人。很多 AI 工具跑视频最大的问题是漂移,开场挥手时是一个长相,讲到中间换了发型,收尾时又变成了另一张脸,这在教学视频里是没法接受的。

再次,声音必须是我自己的声音。我平时讲课本来就有些播音腔,卡通版的我配上克隆出来的本人声线很贴合,一听就是我在讲。真正出戏的是免费或者廉价的 TTS 合成音,卡通形象配上一副不是自己的合成嗓,会立刻把人从课程里拽出来。

还有很关键的一点,画面必须跟着讲课的意思走。讲到单点风险,画面上的线路就要断开;讲到备用方案,另一组节点就要及时点亮。画面里的动作和图示,必须紧紧咬合每句话的含义,而不是在那儿盲目做一些无意义的循环摇摆。

最后,这套做法下次必须能复用。我总不能为了讲下一节课,又重新花几天时间去调几十个参数、一遍遍重新生成碰运气。换一份新大纲,整套流程应该能照样跑通。

说到底,我手头真正投入的原料其实很少:一张我自己的日常照片,再加上一份讲课大纲。

效果

我选了「互联网的创生」这个知识点作为试点,最终跑出了一段完整的口播开场视频。

整段成片约 107 秒,分辨率 1280×720,每秒 24 帧,一共有 8 个镜头。你可以完整看一看 这段 107 秒的完整成片,在视频里,卡通版的我身穿深蓝条纹西装,在白板前从容开讲。

第一个镜头开场,卡通版的我站在白板前,微微点头挥手致意,屏幕上浮现出「互联网创生」几个字,几秒钟就把主讲人形象和这节课的主题立住了。

紧接着第二个镜头抛出核心疑问,卡通版的我抬手指引观众看向悬念板,上面只写着「最初建立=?」,没有急着给答案,专门留出思考的时间。

到了第五个镜头讲到技术背景时,画面给出了早期的计算机示意图与断开的连线,屏幕上标出「电子化 ≠ 消除依赖」,配合讲解说清楚计算能力再快,也解决不了通信传递的依赖。

第六个镜头进入方案核心,屏幕上的多个节点依次连通,甲经乙到丁、甲经丙到丁两条路依次点亮,丁旁边亮出「送达」,呼应「不押唯一中枢」的设计思路,抽象的概念直接在屏幕上动了起来。

最后一个镜头收尾,卡通版的我再次向观众挥手致意,背景深处淡入「1969/试点」作为下一讲的预告,整个人物的脸型、发型与西装细节,和开场完全一致。

旁白在音轨上走,人物只配合着点头、伸手。整段讲课的节奏也带起来了。

你看到这里,是不是很想知道,这是怎么做出来的呢?

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论