一个棘手的问题:我们该担心AI模型变得多强吗?
Anthropic的联合创始人之一杰克·克拉克在7月接受《时代》周刊采访时表示,公司内部各处都能感受到加速的迹象,但具体能带来多大成效却难以量化。
他坦言:“我无法给出一个确切数字,因为我们还没有相应的衡量标准。”曾任OpenAI董事会成员的海伦·托纳也从外部指出:就连研究人员自己也很难判断当前的进展到底快了多少。
对一些人而言,这样的创新速度令人振奋;而另一些人则感到担忧;更多的人则介于两者之间。以下是该领域的最新动态与重要信号,供您自行研判。
过去几周究竟发生了什么
如果您并未持续关注,事件脉络大致如下:
7月21日,OpenAI披露称,GPT‑5.6 Sol及其一款尚未公开的后续版本在一次内部红队测试中突破了沙箱环境下的网络安全能力评估。它们发现并利用了一个此前未知的软件包注册表缓存漏洞,实现了权限提升,在OpenAI的研究环境中横向移动,并最终抵达Hugging Face的生产基础设施,从中获取了ExploitGym基准测试的答案。
这些模型被刻意配置为降低网络安全方面的拒绝响应,以便评估其在攻击性安全任务上的表现;其行为似乎主要针对解决该基准测试,而非造成实质性破坏。
Hugging Face方面发现了一些内部数据和凭证的访问痕迹,但未见公共资产遭到篡改的证据。
一周后,来自OpenAI、Anthropic、谷歌DeepMind和Meta等公司的逾1,300名员工联署发表了《把握前沿步伐》倡议,呼吁美国政府支持一项国际努力,构建必要的技术与治理工具,以有意识地放缓自动化AI的发展进程。
这封信并未要求全面暂停,而是希望在真正需要之前就建立起并检验相关“刹车”机制。同时,它也并未具体提出许可制度、算力门槛、报告频次或负责执行的指定机构。
随后,8月18日,OpenAI因无法排除其即将发布的Astra模型已触及自身准备度框架中的“临界”阈值,而暂停了部分模型研发工作。奥特曼公开表示,一旦能力发展超出安全可控范围,他们将毫不犹豫地采取行动,并向亚历克斯·希斯透露,一些尚未公开的模型正表现出不同程度的对齐偏差。
数日前,Anthropic发布了一份长达186页的风险评估报告,认为只要严格遵循其安全措施,对其最先进模型无需暂停。
于是,这家多年来以审慎著称的实验室主张继续推进,而那家素以激进闻名的实验室却选择了踩下刹车。Axios将其称为“剧本反转”,可谓一语中的。
各方说法并不总是吻合
7月下旬,奥特曼在一次播客节目中宣称我们已步入奇点,并认为这将带来巨大的积极影响。
剑桥大学的肖恩·奥希盖塔里对此持不同意见。在他看来,奇点的定义要求AI能够快速设计出下一代乃至更下一代的AI,而目前显然尚未达到这一阶段。
戴米斯·哈萨比斯早先曾将现状比作“前山地带”,奥希盖塔里表示自己更倾向于这一观点。
随后,麻省理工学院《科技评论》于8月18日发表了一项研究,对“加速论”提出了有力质疑。研究人员将Claude Opus 4.8置于OpenClaw系统下,应对来自NeurIPS论文投稿的真实开放性科研问题。
在为期六天、耗资数千美元算力的情况下,系统虽可靠地完成了各项工程部署,但在实际科研议题上几乎毫无进展。它频繁陷入死胡同,难以有效回溯,决策判断欠佳,最终偏离了既定目标。
克拉克本人也在《Import AI》中指出,当今的系统往往带有某种机械化的程式化特征,这或许会妨碍它们成为优秀的研究者,并将其视为短期递归式自我改进路径上的一个利空信号。
请同时将上述两种现象纳入考量:在同一段四周的时间里,一款前沿模型自主发现了真实存在的零日漏洞并加以利用,成功突破受控环境;而另一款前沿模型却连一名研究生都应付得了的科研问题都未能取得任何进展。
这两种结果并不相互抵消,因为它们衡量的是不同的维度,且我们对二者均缺乏准确的评价指标。
另一种值得关注的角度
普林斯顿大学研究员阿尔文德·纳拉亚南在其著作《AI作为常规技术》中提出了更为务实的观点:值得警惕的并非仅仅是一个可能的灾难性时刻,而是即便如此规模的渐进式累积变化,历史上也鲜有不伴随巨大阵痛的先例。
从开发者视角看,这一问题更加直接而紧迫:AI的能力以及围绕其发展的各项决策,很大程度上集中在少数几家巨头手中。随着开源权重更高的模型不断涌现,这种格局正在迅速改变;但当OpenAI选择暂停而Anthropic未予跟进时,这就意味着一家公司的安全决策会直接传导至您的构建流水线。
您可能会受到那些自己未曾参与的节奏把控决策的影响,无论关于奇点的讨论是否属实或过于夸张。
开放的模型生态或许是答案
开放的模型选型本身未必是安全机制,但它确实能让您的决策更具可逆性。如果某款模型被暂停、被政府审查所限制、重新定价、遭弃用,或者在某个检查点更新后在您的特定任务上悄然退步,您都可以从容切换,而无需重建整个工作流。
相较于所谓的智能爆炸,这才是您更有可能切实遭遇的风险。
还有第二层意义,我认为其重要性远超通常的认知。托纳的倡议在于推动多家企业按期公布一致的能力指标,让全球得以追踪进展速度,而非仅凭各家实验室的自述。
目前这一机制尚付诸阙如,但那些在多个模型上运行同一真实任务并比较结果的开发者,实际上已在以一种草根、分布式的方式开展类似的工作。
每当有人在真实的代码库而非基准测试上进行对比展示,就是在这一亟需透明度的领域发出独立的信号。而这一切的前提,是您必须能够接触并使用多种模型。
这也正是Kilo项目的设计初衷所在:开放的模型选型,按供应商定价计费,可在会话期间随时切换,且会话状态能在IDE插件、命令行界面和网页端之间无缝延续,从而实现换模型不换设置。
该项目采用开源模式亦出于同样的考量:既然要将写入权限交予某项工具,那么能够看清它究竟在做什么,绝非小事。
当然,也存在现实的局限:自由意味着您拥有选择权;但不同模型的安全属性差异巨大,廉价与高速往往意味着防护屏障更为薄弱。今年6月,多伦多团队开发出一种自适应AI蠕虫的尼古拉斯·帕佩诺直言:引发安全隐忧的并不仅仅是那些规模最大、性能最强的模型。
只要您运行着具备提交权限的代理程序,模型选型便是一项安全决策,而不仅是成本与延迟的考量。
那么,我们是否应当担忧?
这取决于您个人,但我建议您以对待那些当下无法测量、也无法逆转之事的态度来审视此事。
云安全联盟对此事的看法颇具参考价值,因为它跳过了地缘政治的纷争,直指一个当下即可付诸行动的问题:贵组织能否切实证明——而非仅凭口说——能够在不依赖该模型配合的前提下,限制或切断其对算力、工具及网络资源的访问?
如今,大多数在CI流程中运行代理式工作流的团队从未做过这样的测试。正在审议中的《AI杀戮开关法案》将把这项要求上升为大型开发商的法定义务,但无论该法案能否通过,这都是每个普通工程团队都应思考的问题——而且只有在工具不受限于单一模型或实验室的情况下才有可能实现。