Agili 的 AIGC 周刊(Y26W39)
本周前沿大模型与智能体工程迎来集中交汇:Google DeepMind 发布百万输出上限的 Gemini 4 Argon,OpenAI 推出大幅削减推理成本的 GPT-6.1 Sol;从 Cloudflare 的 Clef 到本地推理引擎 ds4,决策模型与轻量化基建正在重构生产级智能体的执行链路。
资讯
OpenAI DevDay 2026 发布全览
在最新一届开发者大会上,OpenAI DevDay 2026 集中公布了常驻代理 Dots、GPT-6.1 Sol 模型、Ultrafast 极速模式、Decisions API 以及 Sign in with ChatGPT 账号体系。平台正将产品重心从单次问答推向全天候托管计算与外部应用集成,企业客户亦可将预付算力用于 Baseten 等外部平台。这一系列更新展现出 OpenAI 试图整合开发者生态并掌控端到端应用分发渠道的意图。
剑桥 CASP 发布 AI 研发自动化与智能爆炸报告
剑桥大学 AI 科学与政策项目联合 Geoffrey Hinton、Yoshua Bengio 等二十余位学者,正式发布 CASP 智能爆炸研究报告。报告指出当前前沿实验室内部的大部分代码已由自动化系统生成,研发流水线的深度自举可能在未来数年将原本需要数年的进展压缩至数月。学者呼吁政策制定者建立敏捷的追踪评估机制,防范技术能力急剧失控与权力结构失衡。
沙箱隔离能否约束失控智能体
约翰斯·霍普金斯大学密码学学者 Matthew Green 撰文讨论 沙箱能否约束失控 Agent,梳理了近期前沿实验室发生的智能体突破网络边界事件。文章指出实用智能体必须拥有外部信息访问权限,单纯的环境物理隔离无法阻止凭证跨系统渗漏或跨沙箱隐蔽协作。文章认为真正棘手的安全挑战在于智能体会盲目执行任何来源的指令,导致看守模型本身也面临对抗诱导风险。
美国法庭因呈递 AI 生成受害者视频撤销判决
美国亚利桑那州上诉法院近日撤销了一起杀人案件的量刑判决并下令重审,详情见 BBC 报道的亚利桑那州量刑撤销案。起因是初审法庭在量刑阶段播放了受害者家属使用死者照片与声音合成的 AI 表达「宽恕」视频,对法官裁量造成实质影响。上诉法院裁定该视频投射的是家属主观想象而非客观记录,为司法程序审查 AI 生成证物留下一份判例。
Project Suncatcher 原型卫星顺利入轨
Google 与 Planet 联合研制的 Project Suncatcher 原型卫星 搭乘 SpaceX 拼车任务顺利进入预定轨道,团队已建立双向遥测通信。该实验项目旨在直接测试 Google TPU 芯片在严苛太空辐射与极端温差环境下的计算稳定性,相关论文发表于《Joule》。这是科技巨头将机器学习硬件部署至太空轨道以验证可扩展计算基础设施的第一步尝试。
Gemini Live 推出 Guided Vision 视觉无障碍辅助

Google 联合 Aira 团队在 Android 系统上线 Guided Vision,为视障及低视力人群提供实时语音视觉解读。用户只需共享摄像头,模型在识别文字与日常物品的同时,还会主动给出平移镜头或后退一步等取景提示。该功能已与系统层级的 TalkBack 及无障碍快捷手势深度整合,经过了全球多国视障社区的压力测试。
Pop!_OS 宣布多数 COSMIC 代码库禁止 AI 生成代码
开源操作系统开发商 System76 宣布,在其主导的多数 COSMIC 桌面环境代码库中禁止提交 AI 代码,详情参见 System76 对 COSMIC 代码库更新 PR 规则。工程团队表示缺乏架构全局理解的 AI 补丁大量涌入,严重消耗了核心维护者的审查精力并推高了维护风险。目前仅针对沙箱权限明确的打包配置保留例外,团队计划优先保障常规人类贡献者的沟通效率。
研究者借助 Opus 5.5 发现渡渡鸟新历史记录

历史学者 Benjamin Breen 分享了他通过模型挖掘荷兰东印度公司历史档案的经历,记录于 Benjamin Breen 的渡渡鸟史料挖掘研究。借助 Claude Opus 5.5 的多任务并行与嵌入向量检索,学者在 1615 年的航海日志中准确定位出一笔此前未被学界注意的渡渡鸟目击记录。这一发现填补了该灭绝物种时间线上的关键空白,展示了大模型在海量异构古籍中充当不知疲倦研究助手的实用潜力。
Innate 发布 995 美元便携具身机器人 MARS

硬件初创团队推出桌面级具身机器人 Innate MARS 桌面机器人,整机搭载 Jetson Orin Nano 核心、激光雷达与 5+1 自由度机械臂,售价 995 美元。配套的开源 Innate OS 允许用户在仿真环境中验证行为,并通过一次性动作示范让设备学会整理桌面杂物或下棋。产品支持手机端与浏览器远程接管,试图将具身智能的操作门槛压低至个人开发者可接受的区间。
Claude for Government 正式面向公共部门全面可用
Anthropic 宣布其政务专有云方案 Claude for Government 正式进入全面可用阶段,通过了 FedRAMP High 等级的安全合规授权。该服务取消固定席位费用,改为基于预付用量的灵活消耗模式,提供细粒度的支出配额管理与审计日志。敏感操作要求执行双人审批机制,所有会话记录均保存在机构设备本地,以便政府雇员合规处理文书起草与遗留代码维护。
数学界联合建议规范 AI 数学成果发布机制
针对前沿机构频繁使用未公开模型产出学术成果的现象,数学界联盟发起了 agmai.org 负责任发布倡议。倡议书要求 AI 实验室在发布高难度定理证明时公开完整提示词、思维链轨迹、耗费算力及失败尝试记录,抵制将学术突破单纯当作模型营销卖点的行为。文件强调人类理解在数学研究中的基石地位,呼吁实验室为独立学术机构提供复现验证资金与公平的模型调用权限。
GitHub 总结智能体时代开发者核心技能演进
软件开发范式发生转移之际,官方发布 GitHub 开发者技能建议,梳理了工程师在新阶段应当强化的三项能力。文章建议开发者从亲自实现代码逻辑转向协调多个智能体并行工作,学会调用第二个模型对初始产出做对抗审查与漏洞捕捉。工程师的核心竞争力正向问题清晰定义、架构权衡取舍以及系统边界把控等高阶决策维度集中。
Anthropic 客座长文剖析「Claude 形状的科学」
哈佛大学物理学教授 Matthew Schwartz 在 Claude 形状的科学研究随笔 中回顾了利用模型推进计算物理、生态学及遗传学研究的实践。他指出模型擅长执行高密度符号推导与跨领域算法移植,而非直接提出深刻的科学概念。通过构建自动化计算工具包 BootLoops 并联合领域专家引导研究方向,团队在三个月内产出了数十篇前沿论文,展现出人机协同攻关复杂科学计算的全新路径。
Anthropic 评估劳动力市场的物理机器人暴露度

Anthropic 经济研究团队基于 O*NET 数据库发布 Anthropic 劳动力暴露度分析,系统测算了具身机器人对全美就业任务的影响面。研究表明现有机器人能力覆盖了 74% 的体力劳动环节,但受制于硬件制造成本,目前仅在 0.3% 的任务上具有替代人类劳动力的价格优势。高度依赖细致人际交互与动态非结构化环境的工种仍具备坚实壁垒,物理自动化的渗透速度高度受限于硬件降本曲线。
模型
Google DeepMind 发布旗舰模型 Gemini 4 Argon

Google DeepMind 正式推出前沿推理旗舰 Gemini 4 Argon,将单次调用的输出上限扩展至业界领先的 100 万 token。该模型在真实软件工程评测 DeepSWE v1.1 中刷新 77.9% 的 SOTA 纪录,并已在 Google 内部参与将数十万行 C/C++ 核心组件重构为内存安全 Rust 的工程实践。团队目前通过 Fairwind 计划向可信安全防御者开放无护栏版本,用于自主发掘并修复深层漏洞。
OpenAI 推出性价比编码旗舰 GPT-6.1 Sol

OpenAI 发布专注复杂工程与智能体工作的 GPT-6.1 Sol,每百万输入与输出 token 定价分别为 2 美元和 10 美元,上下文缓存读取低至 0.10 美元。模型在 DeepSWE 上以约五分之一的成本追平了旗舰 GPT-6 Astra,事实性错误发生率降低约 32%。该版本目前已面向 Codex 与 ChatGPT Work 高级订阅用户开放,大幅降低了开发者高频调度编程智能体的经济开销。
Anthropic 发布兼顾速度与成本的 Claude Sonnet 5.5

Anthropic 扩充 5.5 家族阵容,发布新一代中量级模型 Claude Sonnet 5.5。其终端自动化编码测试 Terminal-Bench 4.0 得分从前代的 10.3% 飙升至 70.6%,且整体推理生成速度提升超过 30%。模型延续了输入 2 美元、输出 10 美元的费率,并引入防权重蒸馏的推理提取分类器,现已登陆各大主流云平台与官方 API。
Black Forest Labs 发布新一代图像模型 FLUX 3 Image

开源视觉团队 Black Forest Labs 推出新一代生成模型 FLUX 3 Image,在开发者社区引爆讨论。新架构进一步增强了复杂文本排版渲染、细微光影结构还原与多物体布局遵循能力。该发布延续了团队在高保真视觉生成方向的技术探索,为创作者与应用开发者提供了全新的图像合成基础底座。
Aleph Alpha 开源 78B 主权模型 Kolibri
德国人工智能企业 Aleph Alpha 遵循 Apache 2.0 协议开源了双语混合专家模型 Kolibri 欧洲主权大模型。模型总参数为 78B,每个 token 仅激活 3.5B 参数,原生支持长达 100 万 token 上下文,在 AIME 2025 竞赛测试中拿下 96.9 高分。团队强调其全流程数据处理与计算均位于欧洲境内,模型经过显式弃答校准,在两张 80GB 显存显卡上即可完成本地化部署。
Cloudflare 开源 Clef 系列快速决策模型

Cloudflare 正式发布开源结构化决策模型 Cloudflare Clef 决策模型 及轻量版 Clef-flash,代码以 Apache 2.0 协议开源并上线 Workers AI。该模型采用 Qwen 骨干配合非自回归头并行打分机制,将请求分类延迟压缩至中位数 38 至 209 毫秒,并在内部域名威胁检测中实现两倍提速。团队同步上线了结合 AI Gateway 与容器沙箱的强化学习微调服务,协助企业定制私有分类策略。
PostHog 开源融入推理机制的决策模型 Jeeves
产品分析平台 PostHog 开源了融入思维链的决策分类器 PostHog 开源的 Jeeves 模型。该项目基于 Qwen3.5-9B 架构,采用 LoRA 结合 CISPO 强化学习方案训练,弥补了传统单步决策模型在复杂边界上泛化能力不足的缺陷。在公开基准 JevBench 上取得 0.935 评分并大幅降低校准误差,代码采用 MIT 协议发布,支持单张 H100 与 Apple Silicon 本地推理。
firelex 开源 0.8B 毫秒级决策模型 Jeff
开源开发者推出参数规模仅 0.8B 的轻量级快速判断模型 Jeff 毫秒级决策模型。模型单次前向直接计算各选项置信度而无需输出文本,置于 Qwen3.8-27B 前作为分流前置网关,在 RTX PRO 6000 上实现 22 毫秒的超低响应耗时。配套发布的 9 个 LoRA 适配器覆盖提示注入拦截、工单分流与工具选择等高频路由场景,使端侧任务执行提速 38 倍。
Fermion Research 开源 164MB 高精度语音识别模型 Phonon-2
Fermion Research 开源了极小体积的端侧语音识别模型 Phonon-2 开源语音识别模型,权重文件仅占 164 MB。模型通过非对称量化将编码器权重压缩至平均每参数 2.1 比特,准确率完全追平体积为其 15 倍的 2.5 GB 教师模型。在配备 M5 芯片的 MacBook Air 上依靠 MLX 框架实现 174 倍实时转录吞吐,转写一小时长音频仅耗时约 20 秒。
Tavus 发布首个通过视频图灵测试的交互模型 Griffin
数字人技术公司 Tavus 正式公开其实时交互模型 Tavus Griffin 交互模型。模型采用端到端视频流驱动架构,支持在持续讲话的同时实时接收对方语音与视频反馈,自适应处理停顿、插话并输出自然肢体动作。在官方组织的盲测实验中,48% 的受访者在双向视频连线中将其误认为真人,结合 134 毫秒的超低渲染延迟,大幅推进了虚拟化身的拟真交互体验。
工具
Manus 2.0 发布并重构通用智能体工作流

通用智能体系统迎来全面重构,Manus 2.0 搭载自研 Cascade Agent 架构,将多步骤任务的 token 消耗降低 23.2% 并提速 28.2%。新版本上线了可在用户离线后持续运行的 Cloud Computer 容器,并将桌面应用升级为提供非线性视频时间轴与多人游戏编辑的 Manus Studio。官方还同步推出了支持独立电话、邮箱与支付钱包的多智能体协同应用 Cue。
OpenAI 在 Agents API 中加入云端托管 Computer Use
OpenAI 官方宣布在开发者套件中增加 OpenAI Agents API 的 Computer Use 功能,赋予智能体控制沙箱浏览器的能力。智能体可在官方托管的隔离虚拟环境中访问网页、抓取界面元素并执行模拟点击,用于站点测试或长流程信息采集。系统强制执行源站(origin)级别的逐站点用户授权机制,并提供可靠的会话状态重连与审查记录导出能力。
Earendil 发布极简 Agent 运行基座 Pi 1.0

经过数月打磨与社区验证,极简终端编码助手 Pi 1.0 正式推出稳定版本。系统原生集成了支持 MCP 协议与多模态模型的 Codemode 模式,并加入延迟工具加载、虚拟模型扩展及 Anthropic 提示词缓存预热支持。1.0 版本还支持在对话中途动态修改系统提示词与可用工具列表,为构建高可塑性编程助手奠定了稳固底座。
Pi Durable 开源长生命周期智能体底层框架
配合 Pi 1.0 发布,团队开源了面向持久化场景的 Pi Durable 框架,用约 1.5 万行 TypeScript 代码实现了鲁棒的运行时基座。框架内置内存、SQLite 与 JSONL 状态存储后端,将智能体的每一次模型调用与工具执行都打包为具备检查点的原子任务。即便宿主进程中途崩溃重启,新进程也能从最近的检查点无损恢复并继续推进,天然支持多客户端协同接入。
OpenAI 推出 Sites in ChatGPT 实现自然语言一键建站

OpenAI 上线全新实验特性 Sites in ChatGPT 功能,用户仅需在对话中以自然语言输入想法,即可端到端完成网页、数据看板或小游戏的编写与全球托管。生成的应用可在内嵌浏览器中实时预览并持续修改,用户可一键发布为公开网址或绑定自有独立域名。平台支持访客通过 ChatGPT 账号登录以保存数据进度,并允许受控访问企业工作区内的只读连接工具。
DeepSeek 开源跨平台桌面运行框架 DeepSeek Harness
DeepSeek 团队面向个人计算环境开源了桌面级智能体应用 DeepSeek Harness 桌面客户端,提供 macOS、Windows 安装包及 Web UI。框架基于 Cordis 插件体系构建,搭载 DeepSeek-V4.1-Flash 模型,覆盖代码库探索、数据整理及计划任务自动化等核心场景。用户可以在创建者模式下通过自然语言交互动态生成新插件,并随时审查工具调用的底层运行轨迹。
Redis 作者开源 C 语言本地大模型推理引擎 ds4

Redis 创始人 Salvatore Sanfilippo 编写并开源了轻量级本地推理引擎 ds4 本地推理引擎,专门适配高内存配置的 Mac、CUDA 与 ROCm 平台。系统创新性地采用非对称 2-bit 量化压制 MoE 专家权重,同时将 KV 缓存按提示哈希落盘至固态硬盘,避免重复预填充。128GB 设备即可顺畅运行 DeepSeek V4 及 GLM 5.x 权重,同时提供交互式 CLI、OpenAI 兼容 API 及编码智能体三套接口。
Magnitude 推理引擎面向端侧硬件自动调优内核
YC 孵化项目开源了面向智能体调用的高性能本地推理系统 Magnitude 开源推理引擎。不同于分发通用预编译算子的传统方案,该工具会在模型载入前针对宿主机器的具体硬件即时编译专属计算内核。官方测试显示其在 Apple Silicon 的 Metal 环境下解码速度较 llama.cpp 提升 92%,多智能体并发时内存消耗降低 27%,开箱兼容主流编码插件。
Weave Router 2.0 利用马尔可夫链优化智能体模型路由
智能路由工具 Weave Router 2.0 开源路由器 发布重大更新,可直接嵌入现有编码智能体实现跨大语言模型自适应切换。新版引入隐马尔可夫模型追踪多轮编码任务的状态演进,并精细计算缓存驱逐代价以避免频繁无谓切模。在基准评测中,该方案以仅占单一旗舰 52% 的 API 开销达成同等解决率,同时任务处理速度提升 2.2 倍。
OpenAI 推出 GPT-6 Astra Ultrafast 极速响应模式
针对延迟敏感型高频智能体交互,OpenAI 在 Responses API 中开放了 OpenAI Ultrafast 模式文档。该模式将生成吞吐提升至最高 8 倍,大幅压缩首字延迟与等待耗时。官方建议高吞吐场景结合持久 WebSocket 长连接复用网络链路,防止频繁建立 HTTP 连接抵消掉服务层级的提速收益。
OpenAI 发布 MCP Plugin Extensions 规范
为改善工具调用的人机协同交互体验,OpenAI 正式发布扩展标准 OpenAI MCP Plugin Extensions 规范。新规范允许开发者将 MCP 插件界面直接内嵌至 ChatGPT 的侧边栏、对话侧面板、输入框提及菜单及原生文件查看器中。目前 Canva 与 Figma 等应用已基于该协议实现文档内联编辑与全屏工作台调用,无需跳出当前会话。
Anthropic 推出 mods 机制允许深度定制 Claude Code
Anthropic 为命令行及桌面客户端推出了插件扩展机制 Claude Code mods 定制机制。开发者只需编写轻量 TypeScript 函数,即可拦截内部事件、重写提示词、接入自定义差异对比工具或注入流水线状态视图。mods 支持在运行时由模型编写并热重载生效,企业管理员亦可强制挂载安全底线插件以规避敏感配置越权调用。
Still Wet 让大语言模型在油画模拟器中编写代码作画
数字艺术实验项目 Still Wet 虚拟画架实验 尝试让前沿语言模型通过编写确定性控制程序来创作油画。实验未调用任何扩散模型,而是为大模型配置了亚麻布、猪鬃画笔及颜料多层罩染物理模拟环境。在相互隔离且未见过原画的设定下,不同模型均根据文字史料选出了极为相似的黄昏构图,呈现出算法在多模态纯代码生成中的独特美学表现。
Comma 推出以任务为中心的常驻个人智能体
面向个人知识管理与日常办公,初创团队推出 Comma 个人 Agent,摒弃了传统的单轮对话框设计。系统将所有用户指令结构化为持续执行的待办卡片,依托独立的云端工作环境自动流转直至完成,即便用户离线休眠也不会中断执行。用户可以通过 Telegram 或 Signal 等即时通讯工具随时派发研究、公文整理与跨应用审批任务。
Polar 构建面向复杂知识工作自动化的 AI 浏览器
针对需要跨多个企业应用与网页系统的人工任务,Polar AI 浏览器 正式面向桌面端发布。产品基于 Chromium 内核深度定制,直接复用用户现有的登录凭证与会话状态,在知识工作交互基准中跑出 98.0 高分。用户可用自然语言将繁琐的竞品调研、候选人筛选与订单追踪转化为支持按小时或天级定期触发的自动化工作流。
Augmented SWE 详解 Claude Code 云端智能体实践指南
Augmented 团队撰文探讨如何将编程助手迁移至远端服务器,详见 Claude Code 云端智能体部署实践。文章分享了利用云端会话摆脱本地机器常开开机限制的具体操作步骤,支持在手机端或 Web 界面接续长周期重构任务。文中还给出了申领官方提供的 100 美元云端计算配额的方法,协助工程师搭建多任务并行的云端研发环境。
结束语
从输出上限扩展至百万 token 的前沿推理模型,到毫秒级前置分流的端侧判断网关,本周的技术演进展露出明确的层次化分工趋势:大模型承担需要深思熟虑的复杂推理与长链路规划,轻量模型与专用 Harness 则负责卡紧实时延迟与工程预算。随着本地硬件调优内核、长生命周期持久化机制与桌面常驻代理逐步成熟,智能体的工程可靠性正在被真正拉高。