前沿实验室如何打造微妙的开发者锁定效应

前沿实验室如何打造微妙的开发者锁定效应 图片 1

关于AI厂商锁定的讨论通常集中在模型权重、专有微调格式或自定义提示语法上。然而,随着前沿模型从简单的单回合完成引擎转向长期运行的多回合智能系统,前沿实验室正悄悄构建一种更深层次的锁定形式:状态和执行基础设施锁定。

OpenAI 最近的帖子,两个设置如何让我们的ARC-AGI-3分数翻了三倍,清楚地展示了这一转变。通过实现跨回合隐藏推理的持久性和自动上下文压缩,GPT-5.6 Sol的ARC-AGI-3得分从13.3%跃升至38.3%,同时消耗了6×的输出代币。

性能提升是真实存在的,但对于开发者构建开放、可移植代理系统的架构影响同样重要。

无开发者控制的状态持久化

在OpenAI的响应API下,多回合推理可以使用以下任一服务器管理的延续previous_response_id,使后续响应能够访问存储的对话状态和兼容的持久推理项,或由客户端管理的无状态延续,使用商店:False,客户端保留并重放完整的响应输出项,包括不透明的reasoning.encrypted_content.

随着讨论的深入,OpenAI 也可以使用压缩在延续选定状态和推理的同时,减少了它们的语境。由此产生的加密压缩项对开发者来说是不透明的:它可以存储并重放给OpenAI,但不能被检查、解密或翻译给其他模型提供者。

这不仅仅是OpenAI API的特殊性。人性化的思维障碍以及双子座思维签名都被加密了,并且像OpenAI一样,这些提供者都不公开模型的原始推理令牌给开发者。

开发者仅获得可见输出、可选的推理摘要和不透明的延续状态。因此,与该隐藏状态相关的推理连续性不能直接转移到其他提供者或开权模型,如Llama、Qwen或DeepSeek。

明文切换可以保留结论和选定的上下文,但它重建而非转移模型积累的内部推理状态。

专有执行工具与基准通胀

ARC-AGI-3 文章还强调了另一个日益增长的趋势:前沿实验室通过将模型与封闭专有执行工具配对来强化锁定机制。

前沿模型经过大量强化学习(RL)训练,并针对特定专有编码工具和执行沙盒(如代码解释器环境、自定义文件系统包装器、专有浏览器代理)进行了优化。

在评估使用通用开放式线束的模型时,性能常常滞后。但结合供应商的原生线束和隐藏状态持久性,基准得分会翻倍甚至三倍。

这制造了微妙的错觉:ARC-AGI或SWE-bench上的分数不再反映只是底层模型的原始能力,而是Model + 专有状态管理 + 自定义执行环境。

基准测试的作者避免将提供者特定的设置纳入验证评分正是为了确保各供应商之间的评分保持可比。

要在提供者原生API生态系统之外复制这些结果,开发者需要重新架构其硬件连接的重要部分。

隐藏内存与黑盒会话存储

除了单线程内隐藏的推理痕迹外,实验室越来越多地将持久的跨会话内存层直接嵌入到其API端点中。

当内存、实体跟踪和会话压缩发生在提供者的黑箱内时:

  • 开发者失去细致管理:你无法轻易查询、编辑、过滤或导出存储在提供者内存层的特定事实或关系。
  • 合规与数据治理变得模糊不清:检查模型“记忆”的内容或选择性删除敏感数据需要复杂的API变通方法。
  • 跨模型编排中断:多模型代理架构(例如,路由规划到模型A,代码执行到模型B)无法在没有自定义外部状态基础设施的情况下访问共享内存状态。

显式、开放代理状态

在我们之前的观点中,开放模型已经准备好接受代理,但他们的API还没有我们认为,开放权重模型完全有能力处理复杂的代理工作流,但开放API标准和工具仍落后于专有生态系统。

OpenAI的Responses API和隐藏推理持久化在专有标准基础上加倍强调。为了构建具有弹性、供应商无关的软件,开发者必须将提供者特定的状态管理视为短暂优化,不是作为正史真相来源。

ARC-AGI-3 上三位数的性能提升证明了状态管理和持久性对于长期代理推理至关重要。但随着 frontier labs 将模型智能与不透明、不可转移的基础设施纠缠在一起,开发者可以选择以牺牲完全的提供者锁定为代价,接受便捷的性能提升,或者投资于显式、开放状态管理,以保持代理智能、韧性和可移植性。

在Mozilla AI,我们相信人工智能的未来属于开放、互操作的代理系统。

这正是我们建设的原因海豹:一个开源的LLM控制平面,旨在赋予开发者对其模型基础设施和代理工作流的全面运营所有权。

今天设计便携式状态架构,是实现开发者明天独立的第一步。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论