我用 Vidu S2 找来了「乔布斯」,跟他聊了聊 iPhone Duo

Image

最近, APPSO 观看了国内首场 AI 艺人线下演唱会,效果非常惊艳,但略有遗憾的是,主角 Yuri 尤栗和观众互动的方式是在大屏幕上打字,要是她能像真人歌手观众那样和观众实时互动,让我们点歌,和我们玩一些小游戏,那该多有趣啊。

现在,这样能实时生成和编辑的视频已经出现了。

当大部分视频生成模型还在「卷时长、卷清晰度、算完再看」的离线生成赛道厮杀时,生数科技刚刚发布的 Vidu S2 已经把战场直接拉到了「边看边改」的实时操控领域。

Image

Vidu S2 的能力分为两部分, S2-Avatar 和 S2-Editing

  • S2-Avatar,实时交互模型。面向实时数字人互动,支持 720p 高清输出,增强动作指令遵循与人物表演能力;可在直播过程中输入参考图,根据指令完成持品互动、换服装和换背景。
  • S2-Editing,实时编辑模型。 面向正在流动的视频画面,支持实时修改风格、服装、人物主体与背景,为直播、虚拟演绎和互动内容提供即时视觉编辑能力。
Image

APPSO 第一时间进行了评测,我们发现:Vidu S2 将实时数字人互动进一步拓展到实时视频编辑,让数字人的表现更丰富、交互控制更灵活,也让正在进行的视频画面拥有了更多可编辑空间。

AI 视频终于「边播边改」了

Vidu S2-Avatar 对舞蹈、特定手势、情绪微表情的理解能力大幅提升,只需通过语音或文本指令即可驱动高质量动作,比如摆臂、扭身、踏步和抬腿等动作。

用户可以上传各种图片,比如真人照片、动漫形象或者可爱的宠物图片,从而创建出一个数字人物。

Image

启用麦克风和摄像头权限后,便可以与所创建的角色对话。你可以在视频流进行中的任意时刻,加入物品、服装或背景图片:让角色拿起图中的杯子,换上指定服装,或进入新的场景,输出分辨率同步提升至 720p。

最近,iPhone 首款折叠屏手机成了科技圈最火的话题,同样也伴随着巨大争议,有外媒认为 iPhone Duo 再现了乔布斯时代的惊艳,有人则认为创新不足。

Image

我也很好奇,如果乔布斯能够重新站在我们面前,看到今天的 iPhone Duo,他会怎么评价?

所以这次我直接在 Vidu S2 里创建了一个乔布斯数字人。

创建方式并不复杂,我给了它一张乔布斯的全身参考图,同时补充了一份比较完整的角色描述,包括他的性格、表达方式,以及对于产品、设计和用户体验的态度。

我比较在意的一点,是模型最后生成出来的不能只是一个「长得像乔布斯的人」,交流和行为上也要尽可能维持住这个角色。

Image

角色建立完成之后,我问乔布斯数字人「 iPhone Duo 达到你的预期了吗?」

这考验的是:实时数字人能不能结合自己的人设,对眼前的产品做出符合角色逻辑的回应,而不是突然变成一个普通的 AI 助手。

实际体验下来,这种感觉还挺奇妙的。

他说:「iPhone Duo 比我预想的流畅,但是价格让人犹豫。」

当然,只会站着说话还不够。

所以我又做了一个有点离谱、但其实很适合测试模型能力的实验:让乔布斯跳舞。

这主要是看 Vidu S2 对全身动作的控制能力。因为相比简单的点头、抬手,跳舞涉及躯干、手臂、腿部以及重心连续变化,对人物一致性和动作连贯性的要求都更高。

而当一个平时印象里永远穿着黑色高领衫、站在舞台上冷静讲产品的乔布斯,突然真的开始在我面前跳舞时,还挺有意思。

Vidu S2 做的已经不只是「把一张乔布斯的照片动起来」。

它更像是在尝试把一个固定的人物形象,变成一个可以拿东西、评价东西,甚至完成复杂动作的数字角色。

我还尝试了和一名叫 Himari 的女生和一位 30 多岁的美国送货司机 Tom Miller 视频通话。

当我输入「介绍下你的穿搭」, Himari 便会和我介绍:「自己穿的是校服」。当我询问 Tom Miller 在做什么,他会立即回复我说,「我正忙着送货」。

▲ 实时数字人 Himari

为了彻底终结长时间流式生成带来的「崩溃」与「漂移」,生数独创了 SRF(Self-Replay Forcing)训练技术。简单来说,模型拥有了「自我纠错的记忆」,它学会了直面自己的生成历史并修正误差。

而 Vidu S2-Editing 此次最大的升级是:只需一张简单的参考图,你就能对正在播放的视频流进行实时编辑,施展四种魔法:虚拟试穿、换背景、改风格、换角色,实现「拍摄即出片、出片即特效」。

传统数字人直播只能机械播报预制脚本,遇到观众临时要求「看看上身效果」或「展示细节」时无能为力;而真人直播换装成本高、SKU 展示又有限。

现在,Vidu S2-Editing 能够根据服装参考图实时编辑人物服装,实时生成多样穿搭效果。

我上传了可以清晰地展示出服装的整个边缘和轮廓的服装参考图,然后得到了蓝色 POLO 衫、米色大衣、黑色皮衣与棒球服的上身效果。

模型展现出较高的动作流畅度与面部特征稳定性,同时面料随肢体运动产生的物理形变也足够逼真。

未来的直播带货行业如果依托 Vidu S2-Editing 的动态参考图更新能力,运营人员只需要在后台上传商品白底图,数字人主播即可在说话间隙无缝「换装」或「持品讲解」,将直播互动从「单向广播」变为「即时响应式导购」。

Vidu S2-Editing 也可以用来做流媒体实时特效与视频包装。

传统影视与短视频的风格化渲染、背景扣像严重依赖后期调色与合成,周期以天为单位计算。

运用 Vidu S2-Editing,打开摄像头,选择不同风格,实时视频画面流能够呈现不同美学质感。全程在线的稳定性与惊艳的风格迁移能力,让人眼前一亮。

而角色替换功能,可以让我们瞬间无缝替换为另一个形象。这里建议使用正面朝向、且清晰可见的半身参考图像,质量会大幅提升。

实测过程中,Vidu S2-Editing 可以实现精准的透视对齐与自然的遮挡处理,鲜少有后期拼贴痕迹。

Image

我也在公司过了把薛甄珠瘾,说实话,用角色替换功能把自己「打扮」成薛甄珠后,说台词更放得开了。

这一秒在阳光沙滩,下一秒就能在安静的咖啡馆,杂乱背景实时清退,特效不再需要漫长的离线等待。

实时背景替换功能

画面继续,指令也可以继续

实时视频生成主要是为了交互娱乐。画面持续输出,用户也能持续输入,新的要求影响后续内容。上一代 Vidu S1 已经走上这条路,S2 进一步补上了动态参考图、复杂动作与实时编辑能力,并把数字人的实时输出提升至 720p。

Image

这项变化听上去像给视频装了个聊天框,实际上麻烦得多。聊天可以稍作停顿,正在抬起的手却不能悬在那里等模型算完。

离线制作还能把前后镜头放在一起修补,实时系统却无法提前知道你下一句会说什么。它要利用已经生成的画面往前走,又得为随时插入的要求留出空间。

这套系统的全链路研发,由朱军老师的00后博士生、生数科技流式视频生成与推理负责人张金涛负责。

Vidu S2 采用了 Backbone-Refiner 两阶段架构。主干网络以极低延迟专注负责骨架运动、物理规律和镜头语言的实时推流;精炼网络以异步流水线方式在毫秒级内完成 720P 高清细节重构、材质纹理与光影修复。

可以理解为,负责推进动作的 Backbone 部分先把节奏跟住,负责修饰画面的 Refiner 部分跟进,避免所有任务挤在同一道计算关口。两者并行作业,首次在保证低延迟的同时,维持了可用度极高的画面质感。

临时加入的参考图,则交给基于视觉语言模型的 VLM Agent 协调。VLM Agent 作为「中控调度脑」,负责实时解析当前画面的运动相位和空间状态,并在毫秒级的时间戳上完成特征对齐,确保新元素的介入符合惯性与光照物理规律。

Image

传统视频模型在面对复杂、连续的交互指令时极易出现「幻觉」或动作变形。Vidu S2 直接在部署端针对因果流式生成进行强化学习策略,让模型在单向时间流中具备极强的因果逻辑推理能力,大幅降低了指令漂移率。

Vidu S2 的底层逻辑已经不是一个单纯的「视频渲染器」,而是一个具备实时感知、规划与执行能力的实时视频模型。

Image

从生成一段视频,到运行一个实时世界

过去一百多年,视频的基本单位始终是一段已经完成的时间。它可以被拍摄、剪辑、压缩、分发,甚至由 AI 凭空生成。但人与视频的关系一直没变:内容先完成,观众后抵达。

现在,实时生成开始改变这种关系。画面继续,人的意图也能继续进入。模型要记住上一秒发生了什么,理解此刻插入的变化,再让下一秒维持人物、空间与因果的一致。

交互式视频生成让「成片」这个沿用百年的内容单位,第一次有机会变成持续运行的过程。而下一代 AI 视频的分水岭,开始从「生成结束」走向「世界继续」

有分析认为到 2026 年底,创作者将不再需要等待渲染队列,下一代 AI 系统会支持对画面本身的实时交互,导演式的调度将实时发生,而不再依赖静态的提示词,甚至设想广告会从「一条视频面对一百万观众」变成「一百万条视频,每条都为一个人定制」。

据彭博社报道,字节也准备推出一款允许用户创建实时空间视频的 AI 模型,张一鸣正在亲自监督开发进程,模型最快可能在下个月面世。

生数的 Vidu S 系列则围绕生成展开,将视频从一次性输出的内容,延伸为能够持续接收输入、理解指令并即时反馈的交互过程,面向实时对话、AI 情感陪伴、虚拟 IP、互动游戏、教育、文旅及直播等场景。

作为该系列的最新迭代,Vidu S2 率先将这一方向拓展到实时空间视频的生成与编辑。实时生成或编辑后的画面,可以转换为同步的左右眼视图,通过兼容头显呈现人物与场景的立体深度;已有的立体视频,也可以接受实时编辑。

这让「持续交互」与「空间体验」开始结合:用户的输入不断改变接下来的内容,生成的人物与场景则以更具临场感的方式呈现。

与人对话、参与游戏、即兴互动,本就是人们熟悉的体验。实时视频生成正在把这些体验带入 AI 创造的画面,让视频成为一个可以持续参与其中的过程。

Image

张金涛曾在播客里讲到两个 Vidu S1 社区案例,解释了实时交互为什么容易让人上头。

Image

一个用户上传自家小狗的照片,和屏幕里的数字小狗聊天。另一个玩家把游戏画面作为输入,让旁边的二次元角色看着游戏进程陪自己说话,角色会根据画面里的变化作出反应。

张金涛在采访中说,未来大量视觉内容可能由 AI 实时生成,每个人都可以拥有独立的交互会话。

在恋爱、游戏,甚至几乎所有的日常社交场景里,这种「实时交互」才是人类最大、最本能的视觉娱乐需求。在数字革命之前,人类所有的视觉娱乐基本都是实时在线交互的。

离线预制视频有「播放量」的上限,但实时交互视频的奇妙之处在于:每个人都拥有独一无二的 Session,你看到的画面只属于你。

将目光转向其他厂商,Adobe 做的 MotionStream,让创作者可以在视频生成的同时用鼠标和滑块实时拖动镜头、改变物体运动轨迹,边生成边操控,可以视作「未来人们控制视频方式的一次大改变」

Image

HeyGen 的 LiveAvatar 主打实时交互式 AI 数字人,可以用自己的数据自定义,被不少团队当作客服、直播、企业沟通的新渠道,偏商业化落地。

差别只在于,这一次,屏幕对面陪你聊天、陪你打游戏的,可能真的只是为你一个人实时生成的。

立即体验: https://vidu.cn/vidu-stream

API 平台: http://platform.vidu.cn/vidu-stream/doc

技术报告: https://arxiv.org/pdf/2609.11638

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论