谷歌 DeepMind

RSS: https://deepmind.google/blog/rss.xml
Google DeepMind,世界领先的 AI 研究实验室,以 AlphaGo、AlphaFold 与 Gemini 模型闻名,致力于负责任地构建有益于人类的 AI。

Gemini 4 Argon:我们前沿智能的下一个时代

Google DeepMind 发布新前沿模型 Gemini 4 Argon,定位复杂软件工程、法律/金融等企业知识工作和网络安全防御。输出 token 上限从 64K 提升到 1M;定价为输入 $2/M、输出 $10/M。 DeepSWE v1.1 得分 77.9%,LVBench 91.7%,CWE-bench v1 68%,在 AutomationBench 上 51.3%。文中举例:帮助量子算法优化比公开基线快 40%;在 Google 数据中心识别内存优化、释放 300+ TiB;推动 C/C++ 到 Rust 迁移,包括 Fuchsia Zircon 内核 80 万+ 行代码,并让 libgav1 视频解码器 Rust 版本速度达 C++ 优化版接近、比原 Rust 快 2.7 倍。 网络安全方面,Wiz 已用 Argon 发现一个跨全球医疗软件的关键漏洞;首批通过 Fairwind 计划向受信任防御者开放,后续将逐步向开发者、企业和消费者推出。
评论点赞收藏14 小时前

SynthID Bio:用于合成生物学的水印方法 – Google DeepMind

Google DeepMind 发布 SynthID Bio,将 SynthID 水印技术延伸到合成生物学:在 AI 设计的蛋白质序列中嵌入可检测的"隐写"信号,同时保持蛋白在湿实验中仍具备生物功能。 团队用 AlphaProteo 和 SynthID 改版的 ProteinMPNN 生成带水印的 VEGF-A、SARS-CoV-2 spike RBD、PD-L1 三种靶点蛋白结合子,其结合亲和力和命中率与无水印版本相当,属于首个"功能完整"的带水印蛋白。 对 3D 结构预测,方法微调 AlphaFold 3 扩散网络的一小部分,将水印烧进模型权重,使任何调用该模型生成的结构都天然携带可检测签名,精度接近无水印版本。 文章还把 SynthID Bio 定位成生物安全"瑞士奶酪"防御的一层,帮助 DNA 合成商识别 AI 设计序列、保护 PDB/UniProt/GenBank 等公共数据库。 还提到与 Stanford Hie 实验室和 Arc Institute 合作,已把水印接入 Evo 2 基因组模型,设计出带水印且功能性验证的噬菌体,后续将开源代码、体外数据和模型权重。
评论点赞收藏19 小时前

推出 Gemini 3.8 Live 及 Live Avatar

谷歌 DeepMind 发布 Gemini 3.8 Live with Live Avatar,将实时视频生成与语音对话结合,实现带视觉形象的实时多模态交互。核心特性包括:精准唇形同步、自然表情、流畅对话轮次切换,支持 97 种语言无缝切换;后台异步工具调用(如酒店入住),对话不中断;企业可通过参考图定制专属虚拟形象,目前仅限企业白名单。 所有内容均带 SynthID 水印。该功能已在 Gemini Enterprise 上线,定位为企业级客服、互动演示等场景。技术亮点在于低延迟流式视频与原生实时对话的耦合,以及跨语言唇形同步不漂移。 整体是产品发布公告,信息增量有限,偏机构任务式发文,但多模态实时交互方向本身有一定讨论价值。
评论点赞收藏6 天前

通过安全的服务器端内存推进私有 AI 计算

Google DeepMind 宣布为其"Private AI Compute"(面向个人 AI 的私有算力服务)引入服务器端安全内存模块,强调用户数据在服务器侧的隐私保护。 这是大厂在端侧/云侧 AI 隐私边界上的又一次布局,技术读者会关注其架构细节与"server-side memory"如何实现隔离。内容偏官方通稿,信息密度一般,但"私有 AI 计算"这个概念本身有讨论空间——个人 AI 时代的数据主权、信任模型、与端侧方案的对比都是可延伸的话题。
评论点赞收藏7 天前

Gemini 3.8 文本转语音说你好

Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS,主打“从静态预设到动态创作”的语音生成升级。核心能力包括:用自然语言从零设计音色(覆盖 100+ 语言/方言)、2000+ 生产级语音库、30 秒样本克隆并带同意验证和 SynthID 水印、逐行导演式台词控制、双人对白与背景反应(笑声、叹息等)的原生场景编排,以及数小时长音频下保持音色稳定。 基准方面,Flash TTS 在 Hume AI Voice Design Benchmark 综合 71.4 分排名第一、口音建模 60.8 领先;Quality Index 第一第二分别是 Flash 与 Flash-Lite;盲测 Voice Arena 在日语、葡语、越南语、阿语、西语、印地语等关键语言位列头部。 落地渠道:Gemini API、AI Studio(含音频 playground)、Gemini Enterprise(企业版即将上线)、Gemini Notebook(通用)与 Google Vids;同时已接入 Agora、LiveKit、Pipecat、Vercel 等开发者平台,并与 Figma、HeyGen、Linguana、Wondercraft 等合作方集成,用于全球配音、区域口音本地化和大规模语音 Agent。
评论点赞收藏7 天前

谷歌发布 Gemini 3.8 Live 实时语音模型与扩展推理版本

谷歌发布两款实时语音对话模型:Gemini 3.8 Live(面向大规模/低成本场景,支持 97 种语言自动切换、视觉实时理解、后台并行工具调用)和 Gemini 3.8 Live Extended Thinking(面向高复杂度任务,可"边思考边说话",用早期口头提示词如"让我查一下"保持对话流畅)。 基准方面,Extended Thinking 在 Artificial Analysis Speech-to-Speech Quality Index 排名第一(82.6),τ-Voice 代理任务完成率 68.6%,Big Bench Audio 97.7%。 3.8 Live 在 Speech Agent Arena 排名第二,主打成本效率。已同步上线 Gemini API、AI Studio、Search Live、Workspace 及企业平台,并集成了 Agora、LiveKit、LangChain、Vercel 等开发者生态。 所有 AI 生成音频带 SynthID 水印。
评论点赞收藏15 天前

Gemini 3.8 Flash 模型卡发布

谷歌 DeepMind 发布 Gemini 3.8 Flash 模型卡,基于 3.7 Flash 迭代,面向软件工程与智能体工作流优化。支持 100 万 token 上下文窗口、64K 输出,提供可调节的质量/成本/延迟档位。 知识截止 2026 年 3 月,多语言安全性能较 3.7 略有下滑。
评论点赞收藏27 天前

Google 发布 WeatherNext 3:实时卫星数据驱动的全球最强 AI 气象模型

Google DeepMind 发布 WeatherNext 3,全球最精准的 AI 气象模型,独立评估机构 Brightband 验证。采用实时静止卫星数据,每小时更新,地表变量分辨率达 5 公里,是上一代的五倍。 降水预报 CRPS 提升最高 60%,新增 100 米风速、云量、日照等清洁能源预测变量。已接入 Google Search、Gemini、Google Maps、Earth Engine 及 Cloud,开发者可通过 BigQuery 和 Google Cloud Storage 直接调用。
评论点赞收藏27 天前

谷歌推出Fairwind计划:AI驱动的企业与政府主动网络防御

谷歌DeepMind推出Fairwind Program,向政府和可信企业伙伴开放Gemini 3.8 Flash Cyber模型与CodeMender工具,用于自主发现并修复漏洞。 目前已有650多个全球参与伙伴,涵盖政府机构、关键基础设施运营商和核心技术平台。谷歌在网络安全领域累计投入超1亿美元,其中3600万美元用于资助35个网络诊所,为1250多家医院、公立学区和市政设施提供免费安全支持。
评论点赞收藏28 天前

发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两个模型,价格与 3.7 Flash 相同($0.75/百万输入 token)。3.8 Flash 在软件工程、agent 任务和 multi-step reasoning 上有显著提升,DeepSWE v1.1 基准上超越多数更大成本的前沿模型。 3.8 Flash Cyber 专注网络安全,Chrome 安全团队实测其补丁正确率是其他商业模型的 2.6 倍,Wiz 测试召回率提升 7.5-9.7% 且成本降低 2.3-5.2 倍。
评论点赞收藏28 天前

Gemini 3.8 Flash 模型卡发布

Google DeepMind 发布 Gemini 3.8 Flash 模型卡,基于 Gemini 3.7 Flash 迭代,支持 100 万 token 上下文窗口和 64K 输出,提供可调节的质量/成本/延迟档位。 安全评估显示多语言安全性能下降 5.4 个百分点,语气和误拒率略有改善。知识截止 2026 年 3 月。
55 条评论点赞收藏28 天前

Gemini 推出智能体视频理解功能

Google DeepMind 推出 Gemini agentic video understanding 功能,用动态搜索替代固定帧率处理视频,声称 token 消耗降低 88%、成本降低 66%、精度提升 7%。 该功能已在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上支持,通过 API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 可用,代码示例显示只需在配置中设置 processing 为 agentic 即可启用。
评论点赞收藏29 天前

Gemini Omni 1.1 Flash 发布:新增更多可控的视频生成功能

Google DeepMind 发布 Gemini Omni 1.1 Flash,新增多项视频生成控制功能。场景延伸支持最多 10 秒上下文分析,可分段延长至 40 秒。 360p 草稿模式比 720p 快 60%、成本低三分之一,适合快速迭代。支持指定首尾帧实现平滑转场,以及视频参考保持角色一致性。已在 Google AI Studio、Agent Platform API 和 Gemini 应用上线。
评论点赞收藏34 天前

DeepMind 启动全球首个双盲 AI 评估试点

DeepMind 宣布启动全球首个双盲 AI 评估试点,评估者不知道模型身份,模型也不知道评估者身份,以减少偏见。这是 AI 评测领域的一次方法学实验,结果尚未公布。
评论点赞收藏34 天前

Google 发布 Gemini 3.7 Flash:编码能力跃升,价格腰斩

Google DeepMind 发布 Gemini 3.7 Flash,编码和 Agent 能力较 3.6 Flash 大幅提升,定价仅为一半(输入 $0.75/百万 token,输出 $3.75/百万 token)。 FrontierCode 1.1 Main 从 34.4% 升至 43.6%,DeepSWE v1.1 从 49.0% 升至 65.3%,GDP.pdf 文档理解从 22% 升至 34%。Gemini Spark 同步升级,面向 Google AI Pro/Ultra 订阅用户。
评论点赞收藏48 天前

DeepMind 模型产品矩阵

Google DeepMind 展示了其 AI 模型产品线,包括 Gemini Robotics 2(机器人智能层)、Lyria 3.5(音乐生成)、Nano Banana 2 Lite(图像模型)、Gemini 3.5、Gemini Omni(多模态)、Gemma 4(开源模型)等。 页面同时提供各模型的试用入口和提示词指南。
评论点赞收藏49 天前

Google DeepMind 开源 WeatherNext 模型:飓风预测精度提升相当于十年气象进展

Google DeepMind 开源 WeatherNext 飓风预测模型,3天预测精度相当于此前模型的2天水平,相当于十年气象进展。模型在2025年飓风季帮助美国国家飓风中心提前预警了飓风Melissa的快速增强和牙买加登陆。 现在每次可生成1000个可能场景,训练数据为近20TB全球大气数据加约5000个历史风暴记录。模型仅需28×28km分辨率输入,比传统模型粗100倍,这一发现仍让科学家惊讶。 WeatherNext 2-mini版本可在单个TPU上运行。
评论点赞收藏54 天前

AI模型在气旋预测上取得突破——Google DeepMind

Google DeepMind的WeatherNext AI模型在气旋预测上实现突破,3天预报精度相当于此前2天水平,提升幅度约等于十年气象学进展。该成果已发表于Nature,并在2025年飓风季帮助美国国家飓风中心(NHC)提前预测了飓风Melissa的急剧增强和牙买加登陆。 模型仅需28×28km分辨率数据即可运行,100倍于传统模型的低分辨率下仍能保持高精度。DeepMind已开源WeatherNext 2和WeatherNext Cyclones模型代码及权重,并提供可在单TPU上运行的mini版本。
评论点赞收藏55 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。