自动化生成连贯的长格式视频
Google Research 发布了一套面向长视频生成的多智能体框架:Co-Director(COLM 2026)、CANVAS(EMNLP 2026)、A²RD 和 VQQA,构建在 Gemini 和 Veo 之上。 核心问题是现有视频扩散模型只能生成高保真短片段,但多镜头长叙事会出现语义漂移、级联失败、特征漂移和内容崩塌。方案将长视频生成形式化为全局优化与世界状态跟踪:Co-Director 用多臂老虎机在创意策略、叙事模式和美学原型三个维度做全局搜索,并通过 MLLM Judge 闭环迭代;CANVAS 用持久视觉记忆维护角色、场景和物体状态,解决镜头切换间的视觉不连续;A²RD 采用自回归分段生成加多模态视频记忆,在extrapolation(推进叙事)和interpolation(锚定实体)之间自适应切换,可生成分钟级视频;VQQA 用视觉问答作为自然语言梯度做黑盒 prompt 优化,并引入全局选择机制防止语义漂移。 三个自研基准(GenAD-Bench、HardContinuityBench、LVBench-C)分别在营销广告约束、空间连续性、长时动态上评估,结果在多项已有 benchmark 上取得显著提升。 
