Google Research

RSS: https://research.google/blog/rss/
Google Research,在人工智能、机器学习、系统、理论与科学等领域推进前沿研究,发布支撑 Google 产品与更广泛社区的奠基性成果。

自动化生成连贯的长格式视频

Google Research 发布了一套面向长视频生成的多智能体框架:Co-Director(COLM 2026)、CANVAS(EMNLP 2026)、A²RD 和 VQQA,构建在 Gemini 和 Veo 之上。 核心问题是现有视频扩散模型只能生成高保真短片段,但多镜头长叙事会出现语义漂移、级联失败、特征漂移和内容崩塌。方案将长视频生成形式化为全局优化与世界状态跟踪:Co-Director 用多臂老虎机在创意策略、叙事模式和美学原型三个维度做全局搜索,并通过 MLLM Judge 闭环迭代;CANVAS 用持久视觉记忆维护角色、场景和物体状态,解决镜头切换间的视觉不连续;A²RD 采用自回归分段生成加多模态视频记忆,在extrapolation(推进叙事)和interpolation(锚定实体)之间自适应切换,可生成分钟级视频;VQQA 用视觉问答作为自然语言梯度做黑盒 prompt 优化,并引入全局选择机制防止语义漂移。 三个自研基准(GenAD-Bench、HardContinuityBench、LVBench-C)分别在营销广告约束、空间连续性、长时动态上评估,结果在多项已有 benchmark 上取得显著提升。
评论点赞收藏5 天前

MilleMiglia:面向中间里程物流的真实实例生成器

Google Research 发布 MilleMiglia,一个用 C++ 写的开源基准生成器,专门用于仿真“中间里程”物流(regional/continental 级配送中心之间的转运),补上过去 VRP 研究偏重首末段、中间段缺公共数据的空白。 文章解释中间里程与首末段的区别:单个货物可能跨多车、多节点、多天接力,需要满足固定发车时刻、分拣吞吐上限和到达/发车同步约束,传统 VRP 解法直接套用会失真;作者把问题建模为时空图上的多商品流。 MilleMiglia 用统计分布(重力模型/空间聚类决定节点位置、OD 需求对、车辆轮转)生成隐私安全的合成网络,支持从学术 toy 到大陆级工业规模的不同尺寸,也支持生成大规模训练集。 GitHub 开源,Google 与 UniBrescia、ENPC 合作,后续还会推出针对中间里程的专用 solver 和 API,并计划发起社区竞赛。对运筹/物流优化研究者有直接工具价值。
评论点赞收藏11 天前

让老师用生成式 UI 创建交互式学习模拟:Google 的新教育研究

Google Research 发布新研究,用生成式 UI(GenUI)让教师输入主题即可 AI 动态生成交互式学习模拟(分关卡、带脚手架提示、公式工具箱、即时反馈),并内置自动纠错循环(包括用 Chrome 实例模拟用户做可解性、对抗性测试)。 已发布 30+ 个英语 STEM 互动样例库(物理/化学/生物/数学,初中高中),全部经教师审核;美国 12 名教师试评平均 8/10,英国 STEM 教师总体评价良好,物理和化学最易生成。 目前通过 Google for Education 试点计划征集学校反馈,后续将做学习增益和参与度的 UX 实地研究。
评论点赞收藏12 天前

绕过推理瓶颈:用 Retrieve-for-Train 加速复杂 AI 检索

Google Research 团队在 ICML 2026 论文中提出 Retrieve-for-Train 框架,解决 LLM 在执行"查询扇出"(将一个宽泛查询分解为多个互补子查询)时的推理瓶颈。 核心思路:不在推理时让 LLM 消耗大量思考 token,而是用离线强化学习(Soft-GRPO + 三重复合奖励:groundedness / Vendi 多样性 / alignment)训练一个 4B 规模的扇出语言模型,将其学会的"探索行为"蒸馏进一个 53.9M 参数的扩散检索器,实现单次非自回归并行生成整组子查询嵌入。 关键结果: 1. 相比自回归 LLM 推理(大规模 batch 下接近 50 秒延迟),扩散检索器将推理压到亚秒至几秒,加速 12-20 倍; 2. 质量上优于单查询检索、zero-shot 扩展甚至 Best-of-N 基线;zero-shot LLM 容易陷入"近义改写坍缩"(如反复输出 bohemian festival fashion / clothes),而该方法能生成真正语义不同的分支(boots、lace 等); 3. 消融发现没有多样性项时模型会"奖励黑客"——生成退化的无意义字符串去套数据库坐标,Vendi Score 作为几何锚点堵住了这条捷径。 实验在时尚穿搭数据集(CLIP 检索)和音乐播放列表数据集(MuLan 检索)上验证,使用 Gemma3-4B 和 Qwen3-4B 驱动扇出。对搜索/推荐工程师和关注 LLM 推理效率的人有直接参考价值。
评论点赞收藏14 天前

ToolGrad:用文本梯度高效生成工具使用数据集

Google Research 提出 ToolGrad,用"答案优先"范式替代传统 DFS 搜索生成工具调用数据集。在 16k+ API 的 ToolBench 上生成复杂工具链,准确率接近 100%,成本更低。 用 gemini-2.5-flash-lite 生成的数据微调的 Gemma-3-12B 在 BFCL 榜单以 83.1 分逼近 Gemini 2.5 Pro(83.2),超出 GPT-5。代码和数据已开源。
评论点赞收藏19 天前

Google研究:跨人群基因组预测中,欧洲数据并非越多越好

Google Research用UK Biobank和Biobank Japan数据系统评估跨人群多基因风险评分(PRS)迁移效果,发现欧洲数据并非越多越好——当目标人群样本超过1.5万时,直接用目标人群数据训练的模型反而更准。 遗传保守性状(如BMI)能从欧洲数据中获益到2.5-4万样本,而人群特异性性状(血脂、血糖)在更小样本时就出现收益递减。PRS-CSx等先进方法需要大量目标人群数据才能超越简单方法。
评论点赞收藏26 天前

连接组学里程碑:绘制完整雄性果蝇大脑图谱

Google与HHMI Janelia合作在Cell发表果蝇雄性完整大脑连接组图谱,包含16.6万个神经元和1.25亿个突触连接,是迄今神经元数量最多的脑图谱。 结合此前发布的雌性果蝇脑图谱,可比较两性差异并研究求偶与攻击行为的神经机制。团队开发的AI工具(flood-filling networks、PATHFINDER)加速了重建过程,方法已延伸至斑马鱼和小鼠脑图谱绘制,有望推动神经退行性疾病研究。
评论点赞收藏27 天前

用深度学习从太空绘制全球甲烷排放地图

Google与NASA JPL合作开发MAPL-EMIT深度学习框架,利用国际空间站上的EMIT高光谱成像仪数据,实现全球甲烷排放点源的自动化检测。 模型基于Swin-S Vision Transformer架构,在360万个合成甲烷羽流数据上训练,对专家标注羽流的召回率达84%,比传统匹配滤波方法多识别约50%的合理羽流。 已在25个全球最大垃圾填埋场中的24个成功绘制羽流。模型、合成数据和全球羽流数据库已开源,可在Earth Engine、Kaggle和GitHub获取。
评论点赞收藏28 天前

TimesFM-3:Google 推出支持多变量预测的零样本时间序列基础模型

Google 发布 TimesFM-3,一个 3.3 亿参数的多变量时间序列预测基础模型,在单次前向传播中完成预测,在 Gift-Eval、FEV-Bench、TIME 三个公开基准上均排名第一。 相比前代仅支持单变量,TimesFM-3 原生支持多目标预测、历史协变量和已知未来事件(如促销、天气),无需微调即可零样本使用。核心突破是交替注意力架构(时间维因果注意力 + 变量维全注意力)和 Contiguous Patch Masking 策略,一次性生成整个预测 horizon,避免逐 patch 生成的误差累积。 预训练数据超 1 万亿时间点,模型已在 GitHub 和 Hugging Face 开源。
评论点赞收藏29 天前

行星预测引擎:用Earth AI自动化全球地理空间建模

Google Research 推出行星预测引擎(PPE),可自动完成从数据发现到模型训练的全流程地理空间建模,将原本需要数周的建模工作缩短至几分钟。 在21项CDC健康指标预测中R²达76.8%(对比人工管线60%),尼日利亚粮食安全风险降尺度R²从31.5%提升至66.1%,刚果埃博拉疫情预测Recall@10达83.3%。 核心方法是多模态融合——将结构化统计协变量与Population Dynamics和AlphaEarth基础模型嵌入结合,并引入防数据泄露的Feature Gate机制。
评论点赞收藏33 天前

教AI读地图:Google开源200万张合成地图路径数据集

Google Research开源MapTrace数据集和合成数据生成管线,用Gemini 2.5 Pro加Imagen-4生成200万张带标注路径的地图图像。在2.3万条路径上微调后,Gemini 2.5 Flash在MapBench地图路径追踪任务上NDTW从1.29降至0.87,Gemma 3 27B从1.29降至1.13,成功率同步提升。 管线分四步:LLM生成地图描述→文本转图像→AI Mask Critic筛选可行走区域→构建图结构后用Dijkstra采样路径,再由AI Path Critic校验。 研究结论是细粒度空间推理并非MLLMs的先天能力,可通过针对性合成数据显式教授获得。
评论点赞收藏34 天前

GlucoFM:连续血糖监测基础模型

Google发布GlucoFM,双通道架构分离血糖慢速趋势与短期波动,在7项临床预测任务上超越现有CGM模型。PR-AUC平均提升5.8个百分点,在糖尿病风险和β细胞功能评估中表现最佳。 模型支持少样本适应和跨数据集迁移,预训练使用10.9万小时无标签CGM数据。
评论点赞收藏34 天前

AgentHands:为XR空间对话生成交互式手势的AI助手

Google Research发布AgentHands,让XR中的AI助手通过同步手势在三维空间中指导用户。系统用LLM生成带时间戳的GestureEvent,与TTS语音精确同步,在头显端驱动虚拟手完成指向、演示、警告等动作。 N=12用户研究显示,相比纯语音,加入手势后空间定位显著更易(p<0.05),复杂操作步骤理解更轻松,安全警告效果更强,认知负荷降低。 应用场景包括兰花养护、3D打印机操作、健康教练等。
评论点赞收藏35 天前

Google推出AI工具:从可穿戴设备数据中自动发现候选生物标志物

Google Research发布Biomarker Discovery Framework,一个多智能体系统,从可穿戴设备数据中自动发现候选生物标志物。在9,279名参与者的三个队列中,系统自主识别出41个心理健康候选标志物和25个代谢疾病候选标志物。 睡眠时长变异性与抑郁严重程度相关(ρ=0.252),心率静息步数比作为心血管健康指标与胰岛素抵抗相关。15位盲审专家在七项质量维度上给该系统最高分,是唯一获得"接受"或"小修"建议的系统,平均保留56.9%的生成内容,高于基线系统的18.8%-30.4%。
评论点赞收藏39 天前

Google研究:用出行数据让AI理解城市的"节奏"

Google Research提出ME-POIs框架,将匿名化出行数据与文本嵌入融合,让AI理解地点的动态功能节奏。在洛杉矶和休斯顿测试中,预测访问意图提升81.9%,价格等级分类提升75.1%,繁忙度估算提升24.7%。 出行数据模型在价格分类上甚至超越了纯文本模型。
评论点赞收藏40 天前

超越BMI:用手机照片估算心血管代谢风险

Google Research推出PhotoScan,用手机照片估算体脂率和内脏脂肪,精度接近临床DXA。模型在3.5万UK Biobank数据上预训练,132人独立验证,体脂率MAE仅2.13,胰岛素抵抗分类AUROC达0.760,接近DXA的0.773。 BIA智能手表方案在此任务上无效。
评论点赞收藏44 天前

空架子还是丢了钥匙?参数化事实性的瓶颈在于提取而非编码

Google Research发现前沿LLM的事实性瓶颈已从知识编码转向知识提取。Gemini-3-Pro和GPT-5对95-98%的事实已编码,但仍无法直接回忆26-34%。 "思考"模式可恢复40-65%已编码但无法直接提取的事实。稀有事实和反向问题(知道"A是B"但答不出"B是什么")是重灾区。
评论点赞收藏49 天前

迈向专家级音视频临床问诊的 AMIE 系统

Google 将 AMIE 临床 AI 系统升级为支持实时视频问诊,基于 Gemini 和 Project Astra 构建了三智能体异步架构(对话、规划、感知),在 100 个场景、300 次模拟问诊的随机对照研究中,视频版 AMIE 在病史采集、诊断准确性和沟通质量上与 30 位持证全科医生表现相当,且在引导体格检查方面优于医生和纯文本版 AMIE。 研究由专业患者演员在模拟环境中完成,尚未在真实患者中验证。
评论点赞收藏49 天前

可扩展地检测对抗性合成垃圾与协同媒体滥用

Google Research 发布论文,介绍在大型在线视频平台部署的对抗性合成垃圾检测系统。该方案结合协调机器人网络检测与合成模式分类,并利用经 LoRA 微调和大语言模型自动化优化,实现对恶意账号集群的高效识别。 数据显示,系统在六个月内终止了 5 万个包含 13 万个频道的垃圾生成集群,并通过 LLM 驱动自动化将人工审核时间减少 50%。这为应对生成式 AI 带来的规模化内容滥用提供了可落地的工程实践参考。
评论点赞收藏73 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。