美团智播——数字人直播技术创新与实践

引言

随着大语言模型、生成式AI与多模态交互技术的快速发展,数字人直播已突破早期形象僵硬、交互单一的瓶颈,在本地生活、电商、文娱等领域展现出巨大的商业潜力。美团智播,是面向本地生活场景的AI数字人直播解决方案,融合大模型、数字人与多模态交互技术,提供丰富的行业专属数字人形象,支持真人1:1复刻与门店实景定制,30秒生成直播素材,3分钟完成开播配置,7×24小时稳定上播。过去一年,依托生成式AI技术,数字人直播月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍,充分验证了AI数字人直播在本地生活商业闭环中的实际价值。

2026年7月8日至10日,美团智播在中国互联网大会上完成行业首秀,以“实时交互数字人+直播带货数字人”为主题亮相科技互动展区。展区中,实时交互数字人通过秒级语音问答与观众自然对话,数字人直播间则让参会者发出“完全看不出是数字人”的感叹——这一亮相标志着美团智播正式从内部打磨走向行业舞台。

如何让数字人直播达到真人级表现力,并满足大规模商业化落地的要求?本文将围绕美团智播的核心能力,系统介绍支撑产品的关键技术突破——涵盖高保真形象生成、自然动作驱动、语音手势协调、高效推理部署及系统架构设计,这些技术共同构成了数字人直播从“能用”到“好用”,再到“规模化量产”的完整技术闭环。凭借这些技术积累,美团智播荣获2026年度“中国多媒体企业创新技术奖”,这一奖项由中国计算机学会(CCF)和中国图象图形学学会(CSIG)指导,中国多媒体大会(ChinaMM)设立并颁发,是对美团在数字人直播领域自主创新能力的行业认可。

一、数字人直播的背景与挑战

1.1 业务背景:百万商家的“成本-效率-体验”困境

美团连接数百万商家与数亿消费者,数字人直播正加速渗透商家日常运营。然而,商家直播面临四重现实困境:

  1. 准入门槛高:专业数字人形象定制动辄数万元,7×24小时真人主播团队的人力成本更是中小商家难以承受之重;
  2. 时效性要求苛刻:限时秒杀、突发热点、天气突变等本地生活场景要求直播内容“分钟级”响应,传统真人主播排班与内容制作的周期无法满足实时营销节奏。
  3. 形象与内容同质化:大量商家依赖通用数字人模板,主播形象千篇一律,缺乏与品牌调性匹配的专属感,难以建立差异化认知。
  4. 规模化部署成本高:数万商家同时开播,若每路独占大量GPU,推理成本将线性膨胀,数字人直播的普惠化落地无从谈起。

更深层的问题是:现有大部分数字人方案普遍存在“一眼假”——面部僵硬、动作重复、手势与语音脱节,用户停留时长较真人主播明显偏低。如何让数字人直播媲美真人主播,是技术突破的核心方向。

1.2 技术挑战:高质量数字人直播的多维难题

数字人直播为上述问题提供了新思路,但要真正达到规模化商业可用,远非简单的视频生成任务,面临四大相互交织的技术挑战。

挑战一:形象高保真,从“一眼假”到“媲美真人”

任何面部僵硬、五官失调都会让观众一眼识破。更高要求在于:商家需要真人1:1复刻,以及换装、换背景时保持身份一致性。如何在生成与编辑全链路中同时保证高保真度与强一致性,是形象生成技术的核心难题。

挑战二:动作自然多样,从“木偶戏”到“真人感”

7×24小时直播对动作多样性要求极高。有限动作库循环播放导致观众疲劳、留存率下降;动态生成方案又面临质量不稳定、关节扭曲等问题。如何在单一模型中同时实现高质量与高多样性的动作生成,是长时直播的重大挑战。

挑战三:语音语义协调,从“念稿机器”到“音画一致”

优秀主播的手势与语义高度协调,现有技术能生成与节奏同步的自发性动作(点头、摆手),但无法产生与语义精准绑定的协调性手势。如何跨越语音与动作之间的“语义鸿沟”,是互动体验升级的关键瓶颈。

挑战四:规模化推理效率,从“单路昂贵”到“万路并发”

数字人直播系统是多智能体协同平台,如何在保证质量与实时性的前提下,高效协同多个子智能体,大幅压缩单路推理开销,是数字人直播走向普惠的最终门槛。

1.3 技术方案总览

面对上述挑战,美团智播自研关键技术,围绕数字人主播“长得真→动得准→演得活→卖得好”形成完整技术闭环,实现全链路跃升。

  • 长得真:高保真数字人形象生成与编辑技术,协同攻克形象生成高保真、多元化难题;
  • 动得准:文本驱动高质量动作生成技术,生成高可控、自然流畅的肢体动作,并通过动作迁移生成高表现力的数字人视频;
  • 演得活:语音手势协调生成技术,跨越语音与动作的语义鸿沟,让手势与讲解形成语义级配合;
  • 卖得好:面向规模化部署的Token压缩和推理加速技术,实现多智能体高效协同,打通万路并发瓶颈。

二、让AI主播“长得真”——高保真数字人形象生成与编辑

2.1 产品痛点与需求

商家对数字人形象有三层递进需求:快速可用(3分钟定制开播)、高度个性化(真人1:1复刻)、灵活可编辑(换装换背景时保持身份一致)。过去的定制化图像生成方法面临身份与姿态耦合、微调耗时长、编辑破坏身份特征等核心问题。

2.2 结构解耦身份个性化与自奖励精准编辑

针对数字人生成中身份保真与灵活编辑的双重挑战,美团智播研发团队提出了结构解耦身份个性化(SDIP)和自奖励精准编辑(SREdit)技术方案。

2.2.1 结构解耦身份个性化

SDIP(Structure-Decoupled Identity Personalization)的核心思想是将姿态、身份、背景三个维度进行结构性解耦,包含两个核心模块:

  • 身份与姿态精确分离模块:在Diffusion-Based主干网络中,通过结构残差注入,将身份特征以残差形式融入,避免姿态空间污染;空间解耦正则化损失,以面部为重点,显式约束身份特征的空间分布;区域动态掩码,隔离不同语义区域的特征流动。
  • 细节保真度增强模块:为解决细节保真度不足问题,通过视觉参考增强器将参考图像高频细节注入生成,提升纹理还原度;结合掩码感知质量校正策略,对遮挡和边界区域进行精细化修正。

2.2.2 自奖励精准编辑

商家日常运营中常需对数字人进行局部编辑——换应季服装、匹配活动背景、调整妆容。核心约束是:编辑前后身份特征必须保持一致,不能“换了衣服就认不出人”。

针对这一需求,团队提出了SREdit(Self-Rewarding Editing),被ACM MM 2026收录。其技术创新体现在三个层面:

  1. SIA指令原子化:在MLLM-DiT架构中,将复杂编辑指令分解为原子级操作单元,每个原子对应明确的空间区域和编辑语义,避免语义模糊导致身份信息被意外修改。
  2. 空间奖励重加权:根据编辑区域的空间分布动态调整奖励权重——编辑区域给予较高编辑质量权重,非编辑区域给予较高保真度权重,引导模型在“大胆编辑”与“谨慎保持”间找到最优平衡。
  3. 认知闭合架构:同一模型既做编辑器又做评判器,消除了传统方案中编辑器与评判器分离导致的reward hacking(编辑器学会欺骗评判器)。当二者共享同一套视觉理解能力时,优化目标与实际质量目标达成内在一致。

实验结果表明SREdit在公开数据集GEdit-Bench、ImgEdit-Bench、KRIS-Bench上整体性能提升2.5%~3.8%,视觉效果上在保持身份一致性的前提下达到了业界领先的编辑精度。

数字人图像生成与编辑效果示例:

三、让AI主播“动得准”——文本驱动高质量动作

3.1 产品痛点与需求

7×24小时数字人直播介绍商品时,不同商品需要不同风格的动作配合,这对动作生成系统提出双重挑战:保证单个动作质量(流畅、自然、物理合理),同时保证长序列的多样性和可控性。

3.2 MoTiGA:多级因果LLM动作生成

美团智播团队提出的多级因果LLM动作生成MoTiGA(Motion generation via multi-level causal Transformers with LLM-Guided Alignment)方法,被CVPR 2026收录,MoTiGA将大语言模型的自回归生成范式引入人体动作生成,通过多级因果结构和偏好优化实现质量与效率的双重提升。

  • Causal RVQ-VAE:传统RVQ-VAE使用双向卷积,训练时模型可“看到未来”,推理时只能自回归生成,导致训练-推理不一致。MoTiGA将卷积全部替换为因果卷积,从根本上消除行为差异。重建FID从0.114降至0.031,质量提升超过72%。
  • Time-lagged Causal Prediction:标准自回归生成逐token串行,效率低。MoTiGA观察到RVQ不同量化层间存在时间滞后因果依赖——粗粒度层可直接指导细粒度层预测。基于这一观察,设计了多级因果预测架构,不同量化层token可并行生成,推理效率提升K倍,同时保持因果依赖正确性。
  • MHPO(Motion Human Preference Optimization):业界首个将人类偏好优化引入动作生成的工作。团队在HumanML3D上构建了101,490组偏好对,采用类似DPO的策略直接在偏好数据上优化模型,使生成结果更符合人类对“自然动作”的主观判断。

实验结果表明,MoTiGA在HumanML3D数据集上FID为0.041(较基线降低82.3%)、在KIT-ML数据集上FID为0.180(较基线降低64.7%),生成的动作序列与真实人体动作分布高度吻合,达到了接近真人的自然度与流畅度。

四、让AI主播“演得活”——语音手势协调生成

4.1 产品痛点与需求

真人主播说“这款披萨用料非常足”时会张开双手比划量大,说“请看右边链接”时手指会指向右侧,这种语音与手势的协调是观众判断“数字人是否像真人”的重要线索。现有技术主要关注“自发性手势”(点头、摆手),缺乏与语义内容的深度绑定,无法精准生成“指向商品”、“比划大小”等协调性手势;在模型设计上,传统方案采用全局去噪架构,需等待整段语音结束后一次性生成全部动作,无法满足直播场景对实时性和无限时长的要求。

4.2 StreamingTalk:流式共语动作生成

StreamingTalk 的核心创新在于将全局去噪过程重构为流式因果生成架构,首次实现了非自发性协调动作的流式生成,支持数字人说话时实时、连续、可控地生成同步手势动作,论文已投稿AAAI 2027,其核心技术创新包括:

  • 流式因果生成架构:通过下三角时间步调度将全序列去噪转化为逐chunk渐进输出,每个chunk独立提交,推理延迟与总时长无关;活跃窗口内采用双向注意力精炼动作细节,以前方已提交帧作为锚点约束连续性,计算量恒定不随序列增长,实现直播场景下“边说边动”的实时表演。
  • 长序列稳定性保障:训练阶段采用Self-Forced Clean Anchoring策略,以模型自身预测替换真实锚点,模拟推理时的误差累积,弥合训练与推理的分布差异;同时引入尾部偏置采样,增加窗口末端帧的训练曝光,补偿滑动窗口的尾部覆盖不足。两者协同确保长时生成的手势质量不衰减、不漂移。
  • 时变动作控制机制:每个chunk可绑定独立动作标签,在边界处动态切换表演风格;语音特征通过交叉注意力注入保证节拍同步,动作标签作为语义条件控制手势类型。两层条件协同,使手势既跟随语音节奏,又能根据内容动态切换——介绍产品时双手展示,讲优惠时兴奋挥手,回答问题时托腮思考,全程在一条连续流中平滑过渡。

StreamingTalk首次验证了流式Flow Matching可在恒定延迟、恒定内存下生成无限长高质量手势流,为数字人从“能动但僵硬”升级为“实时演、持久演、灵活演”的高表现力提供了核心技术支撑。

五、让AI主播“卖得好”——高效推理支撑万路并发

5.1 产品痛点与需求

美团智播直播场景具有显著的规模化特征:数以万计的商家需要同时开播,每一路直播都需要实时的视觉理解、智能交互和画面渲染。按照传统的多模态大模型推理方式,每一路直播需要处理大量的视觉token,单路GPU占用高昂;当并发量达到万路级别时,大模型推理成本将成为产品普惠化的根本瓶颈。因此,如何在保证生成质量的前提下大幅压缩视觉推理开销,是产品普惠化的关键。

5.2 Glance2Gaze:扫视融合与注视压缩

美团智播团队提出的Glance2Gaze方法被NeurIPS 2025收录,通过创新的视觉Token压缩策略,在几乎不损失模型性能的前提下实现了75%的Token压缩率和2.5倍的推理加速。其命名灵感来自人类视觉系统的“扫视-注视”机制:人眼首先通过快速扫视(glance)获取场景全局信息,然后通过注视(gaze)聚焦到关键区域获取细节信息。

  • Glance Fusion:传统的视觉编码器(如ViT)通常只使用最后一层的输出作为视觉表征,丢弃了中间层的丰富信息。Glance Fusion通过多层特征融合机制,将ViT不同深度层的特征进行聚合,在不增加输出token数量的前提下获得更丰富的视觉表征。这相当于在“扫视”阶段获取了更全面的场景信息,为后续的压缩提供了更好的信息冗余基础。
  • Gaze Compression:不同于传统的在视觉编码器输出后进行独立压缩的方案,Gaze Compression将压缩模块直接嵌入到LLM的decoder层中,实现了视觉token的渐进式压缩——从576个token逐步压缩为288个,再进一步压缩为144个。

这种“嵌入式渐进压缩”设计有三个关键优势:压缩过程能够利用LLM的语义理解能力,更智能地判断哪些视觉信息冗余、哪些关键;渐进压缩避免了一次性大幅压缩导致的信息断崖式丢失;完全兼容FlashAttention-2,可以直接部署到现有推理基础设施,无需额外工程适配。

实验结果表明:Glance2Gaze实现了75%的视觉token压缩(576→144),模型在各项视觉理解任务上的性能损失控制在2%以内,推理速度提升2.5倍,将并发成本降低了60%以上。

六、系统架构:双引擎驱动的智播技术中台

单项技术的突破只是基础,如何将多项技术整合为一个高效协同的系统,才是产品落地的关键。美团智播在系统层面构建了“双引擎驱动”的技术中台架构,实现实时交互与内容量产的双重能力。

6.1 实时交互引擎

实时交互引擎是美团智播应对“用户即时互动”场景的核心组件。当观众在直播间提出问题或触发互动时,系统需要在极短时间内完成“语义理解→回答生成→动作合成→画面渲染”的全链路响应。美团智播的实时交互引擎实现了全双工通信,系统并行调度形象、文本生成、数字人驱动等核心能力,通过流式连接,前一阶段部分输出即触发下一阶段计算,最大限度压缩总体延迟。

6.2 内容量产引擎

对于日常直播中的商品讲解、活动介绍等“计划性内容”,美团智播构建了多智能体协同的内容量产引擎。该引擎采用“创意-检索-思考-生成-评测”的五阶段协同架构:

  • 创意智能体:基于商品特征和直播风格需求,生成讲解创意方案;
  • 检索智能体:从知识库中检索相关的商品信息、卖点话术和成功案例;
  • 思考智能体:整合创意方案和检索结果,规划完整的讲解逻辑和动作脚本;
  • 生成智能体:调度形象生成、视频生成、数字人驱动等技术模块,生成完整的视频内容;
  • 评测智能体:对生成内容进行质量评估,不达标则反馈至上游重新生成。

这种多智能体协同架构使得内容生产实现了“工业化流水线”模式,单条商品讲解视频的生成时间从人工制作的数小时缩短至分钟级,且质量稳定可控。

6.3 知识库支撑体系,“形象-动作-场景”解耦复用架构

支撑双引擎高效运转的,是美团智播精心构建的三大知识库:

  • 穿搭美学库:沉淀行业搭配规则与色彩美学知识,指导数字人形象的服装选择和风格搭配;
  • 直播专家知识库:汇集优秀真人主播的讲解技巧与互动经验,为AI主播的内容生成提供专业参考;
  • AI运营大脑:基于海量直播经营数据构建智能决策系统,实时分析直播间指标,动态调整商品切换、优惠触发、节奏把控等策略,形成数据驱动的持续优化闭环。

美团智播在系统设计上遵循了“形象-动作-场景”三维解耦的核心原则。数字人形象、肢体动作、直播场景三个维度完全独立管理,可以自由组合复用。这种解耦架构使得同一形象可搭配不同动作风格、同一套动作可应用到不同形象、同一场景可快速切换不同主播,组合式复用大幅降低了内容生产的边际成本,使“千人千面”的个性化直播成为可能。

七、总结与未来展望

美团智播已在多个业务线实现规模化落地,核心指标表现亮眼:定制化数字人模特从需求到上线仅需3小时,相比传统的定制拍摄效率提升超10倍;商家闲时交易额平均提升7.3%,7×24小时不间断开播有效填补真人主播休息时段的流量空白;整体开播效率提升60%,AI自动生成话术、装修直播间、触发营销动作,将商家从繁琐的直播准备中解放出来。

展望未来,美团智播将在以下方向持续演进:

  • 情感表达与个性化交互:未来数字人主播将具备情感计算能力,面对用户的不同反馈给予恰当的情感回应。
  • 自适应风格迁移:基于行业、品牌、时段的差异化需求,数字人主播将自动调节表达风格。
  • 高表现力实时交互:持续优化生成和渲染管线,向高表现力的实时交互产品形态迈进。

参考文献

  • [1] Chen X, Bao Q, Liu X, et al. Multi-level Causal LLM-based Text-to-Motion Generation with Human Alignment. CVPR 2026.
  • [2] Chen J, Liu H, Ao Y, et al. Glance2Gaze: Efficient Vision-Language Models from Glance Fusion to Gaze Compression. NeurIPS 2025.
  • [3] Wang Y, Bao Q, Ao Y, et al. SREdit: A Self-Rewarding Framework with Intrinsically Aligned Critic for Image Editing. ACM MM 2026.
  • [4] Zhang Z, Liu K, Chen Z, et al. InfVSR: Toward Consistency-Driven Streaming Generative Video Super-Resolution. ICML 2026.
  • [5] Fang F, Yang S, Yang W. CoordSpeaker: Exploiting Gesture Captioning for Coordinated Caption-Empowered Co-Speech Gesture Generation. CVPR 2026.
  • [6] Chen X, Liu W, Bao Q, et al. Motion Capture from Inertial and Vision Sensors [J]. IEEE Transactions on Multimedia, 2026.
  • [7] Liu H, Bao Q, Chen X, et al. Stable Layout Image Diffusion for Content-Aware Layout Generation. ICASSP 2026.
添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论