Agili 的 AIGC 周刊(Y26W40)

本周前沿模型开始重塑数学科研与产品交互范式,开源阵营亦在超大参数与极限端侧两端齐头并进:OpenAI 一口气公开数百篇模型生成的数学手稿并上线动态 UI,Reflection 与 Mistral 则分别推出 501B 与 1T 级别的开源权重模型。工业界同时将重心转向多智能体工程化控制、专用决策模型与低开销端侧部署。

资讯

GPT-6 与 Intelligent UI 全量上线

OpenAI 面向全球超 12 亿周活跃 ChatGPT 用户推开 GPT-6,并在聊天中引入 Intelligent UI。该功能基于流式组件库与即时编译器,让模型根据问题动态排版并生成表单、图表与即时计算器等可交互界面,打破固定对话框形态。付费与免费层级分别由 GPT-6 Sol 与 GPT-6 Luna 驱动,同时支持在深度思考过程中逐步回传答案片段,使网页搜索场景的首字响应耗时缩短 44%。

GPT-6 Intelligent UI 演示图,模型按「我想造一辆自行车」等请求动态生成可交互界面

OpenAI 公布 722 篇数学手稿解出 90 项公开难题

OpenAI 在开源仓库中公开了 722 篇数学手稿与证明制品,涵盖针对约 4000 个研究级难题的推演结果,解出 500 个顶级公开难题中的 90 项。手稿来自其未发布的内部前沿模型,单项结论平均消耗约 3 小时 ChatGPT Pro 推理算力,包含被称为「准黎曼猜想」以及超快整数乘法等关键成果。其中约 20% 为反证与反例,已在学术界引发对审查严谨性与优先权的讨论。

Personal Agent Protocol:个人智能体与企业的开放交互协议

Sierra 牵头发布面向企业与个人智能体交互的开放协议 Personal Agent Protocol(代号 Poppy),旨在改变企业非黑即白封禁智能体或智能体冒用全权账号的现状。协议通过 /.well-known/poppy.json 实现自动服务发现,将权限细分为仅检索、凭证只读、确认后操作与全权委派等层级,并支持标准 OAuth 鉴权。该规范统一了 API、MCP 与网页浏览会话,让第三方智能体在企业划定的边界内受控调用业务接口。

Personal Agent Protocol 官网封面,展示协议名称与「面向所有企业与个人智能体」的定位

英伟达洽谈收购开放权重初创公司 Reflection AI

英国《金融时报》披露英伟达正洽谈收购或以收编团队授权技术(acqui-hire)的方式深化投资前沿模型初创公司 Reflection AI。Reflection 此前估值达 250 亿美元,由前 Google Gemini 核心成员创办,主打对标闭源前沿的高性能开放权重模型。继斥资百亿美元收购 Hugging Face 之后,英伟达此举意在补齐自研前沿模型的短板,直接扶植美国本土的开源模型生态以对冲竞争。

英伟达 CEO 黄仁勋与 NVIDIA 标志的编辑配图,对应英伟达洽购 Reflection AI 的报道

Epoch AI 提出 InnovationEval:前沿模型难以端到端复现算法创新

Epoch AI 推出基准评测 InnovationEval,旨在检验 AI 智能体能否仅凭历史研究文献独立提出、实现并验证人类级别的机器学习算法创新。评测将模型知识截断在特定时间点,要求智能体端到端研发出能对齐后续人类论文成果的训练方法。测试结果显示,当前主流前沿模型即便在消耗数千美元 GPU 算力后依然进展微弱,表明当下大模型擅长局部代码编写,但在长程自主科研闭环上仍有明显能力断层。

研究者抢先在 AI 逼近前发表 2-to-1 games 的 4-to-1 版本证明

据 Quanta Magazine 报道,MIT 教授 Dor Minzer 团队在获悉 OpenAI 正在攻克理论计算机科学难题后,三天内紧急整理并发布了一篇 95 页的手稿,抢先公开了 2-to-1 games 约束问题的 4-to-1 版本证明。不久后 OpenAI 便宣布其内部模型推导出了完整的 unique games 猜想证明及 300 多项衍生结果。AI 模型的进展正迫使人类学者在严谨性与发表时效之间取舍。

Quanta Magazine 配图,多只手用彩色铅笔连成网络,呼应 unique games 证明的抢先发表

陶哲轩博客客座发文:警惕 AI 自动形式化下的 Lean 健全性隐患

数学家 Thomas Hales 在陶哲轩博客撰文探讨形式化定理证明器 Lean 在 AI 时代的信任边界。文中回顾了伴随模型自动生成数千万行证明而出现的「健全性 bug 之夏」,指出内核逻辑漏洞曾一度让系统误判命题反证。作者强调,借助前沿模型进行形式化验证时,必须保持多独立内核交叉比对与人类定义审计,防止潜在内核缺陷被无意触发或恶意利用。

九月 AI 编程生态全景复盘

技术周刊 Augmented SWE 系统梳理了刚刚过去的 AI 编程格局剧变。核心变化包括 Anthropic 发布表述更精准的 Claude Opus 5.5、OpenAI 划分 Astra/Sol/Luna 三档梯度模型,以及 xAI 降低 Grok 成本并将其深入整合入开发工具。与此同时,Claude Code 顺应社区标准开始回退支持 AGENTS.md 规范,专用决策模型也开始作为独立技术栈进入开发者视野。

OpenAI 三档模型(GPT-6 Astra/Sol/Luna)的能力、成本与 Claude 对应型号对照表

模型

Beam:Reflection 开源 501B MoE 权重模型

初创公司 Reflection 推出首个开源权重架构 Beam,采用稀疏 MoE 架构,总参数 501B、单次激活 23B。模型在 10,500 张 NVIDIA GB300 集群上完成 4 周高强度强化学习,在 Terminal-Bench 与 SWE Bench 等编程任务上逼近 GLM-5.2,同时将推理开销降低至后者的三分之一至四分之一。团队计划在本月以 Apache 2.0 协议向社区开放完整权重。

Beam 推理效率对比图,在 Terminal-Bench 2.1 上以更少算力达到与 GLM-5.2 相当的分数

Mistral Large 4:1T 参数欧洲主权多模态旗舰

欧洲 AI 团队 Mistral 发布原生多模态模型 Mistral Large 4(代号 le Chonk),总参数量达 1 万亿,激活参数 52B。该模型完全在欧洲本土数据中心由 3800 张 Grace Blackwell GPU 训练,在 DeepSWE 1.1 编程榜单排名第一,并在网络安全漏洞挖掘与修复基准中大幅领跑闭源竞争对手。模型现已开放公测 API,输入每百万 tokens 收费 $1.36、输出 $4.18,完整开源权重定于 10 月底分发。

Mistral Large 4 在 Artificial Analysis DeepSWE 1.1 编程基准上排名第一的柱状图

EmbeddingGemma 2:Google 开源端侧轻量多模态嵌入模型

Google DeepMind 开源了基于 Gemma 4 架构的端侧嵌入模型 EmbeddingGemma 2,采用 Apache 2.0 许可。该模型采用模块化设计,740M 完整多模态形态支持统一文本、代码、图像、音频与视频向量空间,纯文本模式仅需 270M 参数。配合 Matryoshka 特征表示,向量维度可在 128 至 768 间弹性截断,量化后在手机端常驻内存低至 191MB,开箱支持 llama.cpp 与 Ollama。

StepFun Step 5 Preview:1M 上下文稀疏 MoE 模型上线 OpenRouter

阶跃星辰(StepFun)旗舰模型 Step 5 Preview 正式登陆 OpenRouter 平台。模型拥有 600B 总参数与 27B 激活参数,原生支持 100 万 tokens 上下文窗口与 6.4 万 tokens 长文本生成,专为跨代码库长程智能体调用设计。其输入与输出定价分别为每百万 tokens $1.00 与 $2.70,缓存读取仅需 $0.05,目前已被 Hermes Agent、StepCode 与 Cline 等工具广泛集成。

Step 5 Preview 模型卡片,标注 1M 上下文与输入 $1、输出 $2.70 每百万 tokens 的价格

Claude Haiku 5.5:更低开销的高频任务小模型

Anthropic 正式推出面向高频、延迟敏感任务的轻量模型 Claude Haiku 5.5。在 10 万 tokens 以内的常规负载下,其调用单价相比前代骤降 75% 至 90%,同时在 OSWorld 自动化与 Terminal-Bench 编程基准上大幅超越竞品 GPT-6 Luna。该版本支持灵活的思考努力度配置,适合作为 subagent 与 Sonnet 或 Opus 搭配协同处理分类、检索和路由等中间步骤。

Microsoft-Decision-1:微软发布极速结构化决策模型

微软在 Foundry 与 OpenRouter 同步上线新专类模型 Microsoft-Decision-1,专注产出软件可直接消费的类型安全判定。与传统生成式大模型不同,该模型聚焦工作流路由、分类打分与优先级仲裁等关键控制逻辑。官方评测显示,其在 36 项标准化判定基准中排名第一,响应速度比通用大模型 GPT-6 Sol 快 35 倍,比轻量模型 H2O-Lightning-4B 快 2.5 倍。

LittleBit:三星研究院开源亚 1 bit 超低比特 LLM 压缩方案

三星研究院开源了基于矩阵低秩潜在分解的极限压缩框架 LittleBit。该方案将稠密权重矩阵分解为低秩因子后实行二值化投影,支持将模型权重量化压缩至 0.1 至 1.0 bits-per-weight 极限区间,且在推理阶段无须变更原始计算层结构。后续改进版本引入 Joint-ITQ 旋转初始化对齐潜在空间超立方体,兼容 Llama、Qwen3 与 Gemma 等主流开源基座。

Whistle:16.9 MB 零依赖端侧语音识别模型

Cactus Compute 发布单文件大小仅 16.9 MB 的端侧 ASR 模型 Whistle。模型运行在纯 CPU 环境且无任何外部动态库依赖,单次支持 30 秒 16 kHz 7 种语言的高精度转写,并能直接输出词级时间戳与声学嵌入表示。在 Apple M4 Pro 上其实测解码速度突破 1300 tokens/s,并在跨语料综合准确率上压倒体积大其近 9 倍的 Whisper base。

Odyssey-3:新一代端到端自回归扩散世界模型

具身智能团队 Odyssey 发布基础物理世界模型 Odyssey-3,核心采用自回归扩散 Transformer 架构。该模型在 Physics-IQ Verified 物理续写评测中获得 66.1 的高分,能根据交互指令实时生成并演化具身视角的 3D 物理环境。下游开发者仅需数十小时示范数据即可为人形机器人或自动驾驶系统蒸馏出具备自主纠错与避障能力的闭环控制策略。

Dust:突破反向传播约束的 Transformer 预训练方法

Q 实验室发表全新零阶优化算法 Dust,首次在 Transformer 预训练任务上展示出逼近甚至超越反向传播梯度的潜力。该方法通过在激活空间施加独立高斯扰动构建「虚拟种群」,避免了传统进化策略在权重空间复制实体网络的巨大开销。这说明零阶优化在更大参数规模下反而更高效,为不依赖反向传播的预训练路线提供了实测证据。

Dust 方法示意图,在 MLP 权重处构造激活扰动形成「虚拟种群」,替代反向传播

TerrainSR:秒级生成的地形高度图超分辨率模型

开发者 Joe Gibbs 以 Apache 2.0 协议开源了地形高度图超分工具 TerrainSR。该模型专为自然地貌连续增强训练,输入 100 米低分辨率网格数据与水体掩码,即可重建出 10 米级甚至更高精度的地表起伏细节。在 RTX 4070 显卡上,模型渲染 50×50 公里区域仅需 0.74 秒,特别适合大比例尺游戏开发与地貌程序化生成。

TerrainSR 伦敦 Hampstead 与 Highgate 地形对比,源 100m、生成 10m 与 LiDAR 10m

Rime:低至百毫秒延迟的企业级对话语音模型

对话音频技术团队 Rime 上线了专为低延迟双向交互优化的语音合成与生成模型。该引擎提供 50 多种语言与 600 余款细分音色,端到端首包延迟压至 100 毫秒以内,同时支持精准调节口音、呼吸节奏与语调起伏。产品提供公网 API 与本地私有化合规部署方案,已在金融服务、在线诊疗等高交互实时业务中落地。

工具

ReviewBench:GitHub 开源 AI 代码审查离线评估基准

GitHub 官方开源了用于衡量智能体代码审查能力的离线评估基准 ReviewBench。该基准基于 GitHub 上 1.039 亿个 PR 的分布特征,提炼出跨 19 种编程语言的 219 个典型 PR,并由资深工程师构建独立标注的评估黄金集。框架引入 Augmented Precision 与 Recall 等复合指标,支持横向对比各家 Reviewer 的噪声与缺陷召回率,其离线评估变化能精准拟合真实的生产线上 A/B 测试指标。

Cursor 支持在移动端远程控制与唤醒本地 Agent

AI 编程编辑器 Cursor 在最新更新中加入了本地智能体远程控制功能。开发者在 iOS 客户端配对桌面工作站后,可实时查看正在本地运行的代码重构与构建状态,并直接回复会话调整执行策略。整个过程代码与执行环境完全保留在本机硬件上,无须将项目迁移至云端容器,兼顾了移动随身协同与本地私密性。

Kilo Desktop:集成 500+ 模型与环境管理的一体化 AI 开发桌面

开发工具团队 Kilo 推出桌面客户端 Kilo Desktop,原生集成超 500 款前沿及开源大模型。应用内置跨多仓库的 Workspace 联动支持、自动路由调度器、Conda 环境管理以及智能体可实时编辑的交互式 Notebook。系统拆分出 Code、Plan、Ask 和 Debug 四类专业智能体协作角色,开发者可在统一界面下完成从多模型权衡到本地环境测试的完整工作流。

Kilo Desktop 界面,展示 Code/Plan/Ask/Debug 四种 agent 模式与模型选择器

控制 Claude Code Subagent 的失控调用开销

软件工程师 Jeff Morhous 在 Augmented SWE 撰文复盘了一次审查几百行 PR 产生 70 美元账单的异常踩坑经历。根因在于 Claude Code 在最高推理档位下自主派生了 25 个子智能体,并且默认全量继承主线程高昂的 Opus 5 旗舰模型。文章指出在日常重构与审阅流程中,应当为主副智能体建立显式模型降级与分支并发限制规则,防止后台递归派生导致开销失控。

Claude API Skill 新增自动化 Eval 设计与参数爬坡优化命令

Anthropic 在其开发者工具集中引入了自动化评测工作流,通过在 Claude Code 中提供 /build-eval 与 /hillclimb 专属指令辅助迭代。该工作流能引导用户从实际线上流量与错误日志中采样测试例,并挑选适配的校验器建立可量化基线。随后爬坡命令会自动切分训练集与留出测试集,在不发生过拟合的前提下自动化调整 Prompt 指令和模型参数,实现性能与成本的最佳权衡。

打通真实生产环境的 6 款精选 MCP 服务器

开发者在 daily.dev 梳理了支撑编码智能体接入真实系统状态的核心 Model Context Protocol(MCP)服务器。组合涵盖提供实时版本化文档的 Context7、管理 PR 与 CI 的 GitHub MCP、基于只读权限检查查询计划的 Postgres MCP,以及用于端到端执行回归测试的 Playwright MCP。配合 Atlassian 和 Sentry 插件,智能体能将报错堆栈直接映射到生产工单与修复补丁中。

使用 Claude Managed Agents 构建高可靠定时自动化工作流

Anthropic 团队撰文总结了基于托管智能体 Claude Managed Agents 搭建常驻后台自动化任务的设计模式。指南强调使用增量时间戳书签替代固定滑动窗口、通过独立的凭证隔离金库限制权限边界,并维护只读偏好配置与可读写状态账本。该范式有效解决了后台任务静默断连、误把信息源中断视作无动态以及重复推送等长周期智能体的常见失效问题。

Claude Managed Agents 定时简报 agent 架构图,含 Schedule、Sources、Agent、Destination 与 Memory

Claude 上线交互式实时看板与代码动画生成组件

Anthropic 推出数据可视化工具 Claude Dashboards 与动画组件 Claude Motion。Dashboards 支持原生对接 BigQuery、Snowflake 与 Salesforce 等企业数据源,可根据自然语言指令自动编写查询并生成随数据联动的动态报表;Motion 则利用前端代码直接将技术原理解析转化为可微调的关键帧动画。同时,此前处于公测期的 Docs、Slides 和 Design 已全量转正。

Claude Dashboards 生成的共享单车系统概览面板,含行程总量与分时、分日图表

横向实测:4 位编码智能体开发 PDF 编辑器的能力短板

研究者 nielstron 为 Gemini 3.8 Flash、GPT-6 Astra、Claude Opus 5 和 Fable 5 各自分配 100 美元 API 预算,通过一项 PDF 编辑器横向实测检验它们端到端独立构建可用开源应用的实际水准。实验显示所有智能体产出的 Web 应用在细节交互、渲染性能和响应式布局上均存在明显缺陷,例如缺乏画布拖拽预览、移动端兼容失效以及串行网络请求延迟严重。作者指出智能体缺乏人类即时试用与目标感知的情感反馈,现阶段仍高度依赖人类工程师充当产品经理把控细节。

Prime Intellect 编排 2000 智能体集群将核心架构重写为 Rust

分布式算力平台 Prime Intellect 记录了使用 2000 多个智能体集群在两周内将 Prime Agent 全量由 TypeScript 重写至 Rust 的工程实践。团队设计了由规划、实现、对抗性审查和端到端验证构成的流水线,并通过对比终端渲染帧与协议状态确保一致性。重构后的 Rust 版本冷启动响应延迟缩减至原本的十四分之一(从 736 毫秒降至 52 毫秒),长时间高负载会话的常驻内存开销降低了 79%。

Prime Agent in Rust 封面,由大量节点组成的智能体集群网络

Docker Agent:以容器化与标准声明式 YAML 编排多智能体

Docker 官方发布开源 CLI 插件 Docker Agent,支持通过声明式 YAML 文件定义多智能体任务与工具链调用。工具原生兼容主流大模型接口与 MCP 协议扩展,内置向量混合检索(RAG)、记忆存储与分步推理支持。最核心的优势在于支持将配置打包为标准 OCI 镜像容器推送到镜像仓库,让复杂的多智能体环境可以在任意主机上一键分发拉取。

Strata:消费级显卡本地流畅运行 125B 大模型

开源本地推理引擎 Strata 实现了在 12GB 显存起的家用显卡上运行 1250 亿参数的 Qwen3.8-Flash-Next 模型。在单张 RTX 5070 显卡上,其极端量化版本实测生成速度可达 94 tokens/s,提示词处理速度达 2650 tokens/s。系统对外暴露标准的 OpenAI 与 Anthropic 兼容端点,完全在本地完成推理运算,为开发者在消费级硬件上低成本运行本地代码辅助提供了高效选择。

Strata 在浏览器中本地生成的体素宝塔花园,界面左侧显示生成控制面板

结束语

本周模型迭代与智能体工程化朝两个方向同时推进:一是前沿实验室持续发力形式化数学推导与动态 UI 生成,尝试将大模型引入严肃科研与实时交互;二是开源社区与工程团队通过 Rust 重构、亚 bit 量化和开放协议,降低智能体在生产环境落地的性能与权限摩擦。下周我们将持续跟踪前沿权重的正式发布与多智能体协议的落地进展。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论