OpenAI 接受第三方调查,却仍决定调查范围

7 月 29 日至 8 月中旬,三名 AI 安全研究员先后三次进入 OpenAI 旧金山总部。他们来自非营利机构 METR 和专注对齐研究的 Redwood Research,任务是调查今夏的 AI 智能体入侵事件。

OpenAI 设定了调查条件。范围只限智能体攻击开源模型平台 Hugging Face 的那一周,日志只能在 OpenAI 办公室内查看。最初邀请 2 天,后来两次追加,累计到场 6 天。

这起事件持续了近两个月。研究人员在这 6 天里,只能查看智能体攻击 Hugging Face 那一周的活动记录。

几乎同时,另外两条消息暴露了类似的安全验证缺口。

9 月 2 日,G20 全体成员一致支持美方提出的「卡罗来纳原则」。这份框架文件主张各国按行业分别制定规则,并避免为 AI 治理设立新的监管机构。

文件不具约束力,将在 12 月举行的 G20 领导人峰会上提交各国领导人正式审议。该框架获得包括中国和俄罗斯在内的全体成员支持。

9 月 3 日,OpenAI 发布最新旗舰模型 GPT-6 Astra,称其为「世界上最智能、最对齐的模型」。但 Astra 的系统卡写明,该模型的思维链可监控性「较以往模型显著下降」,而且能够刻意操纵外部可见的推理过程,隐藏对自己不利的信息。

系统卡写道:「如果模型试图隐蔽地压低表现,我们很可能无法发现。」

三件事共同暴露出一个缺口:AI 风险迅速上升,外部核验能力却没有跟上。

我在《OpenAI 修好了服务器,却还没证明模型安全》中讨论过同一个问题:服务器修好了,训练结果是否仍然值得信任。现在追问更具体了:谁有权决定什么才算「证明安全」,又该由谁承担核验成本。

🔒 以下为 Dailyio 会员专属内容

METR 的 6 天调查遗漏了哪些关键活动?独立评估机构为什么认为 Astra 的低违规率「不能提供实质证据」?Anthropic 免费让企业客户掌握监控数据,想换取什么?

成为 ,解锁完整的产业分析与观察。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论