AI 并非失控,而是更糟
今年五月初,ChatGPT开发商OpenAI启动了一项实验室实验,这将引领科技行业走上一条新道路——这条路更令人担忧,因为它不是偶然,而是设计的产物。
表面上看,这可能只是一次普通的安全测试:内部黑客被赋予一项艰难的网络安全挑战,以测试其能力的极限。他们采用创新策略,绕过限制,合作几天内破解了问题。
但这些“黑客”其实是人工智能代理——能够在无需人工介入的情况下执行多步认知任务的软件。OpenAI通过多种模型组合构建了这些模型,其中包括一个尚未发布的强大新模型。
他们完成指定任务的成功在全球引起了轰动。
上个月,这些特工成功突破了一个没有互联网接入的测试环境,爬行了开放网络,最终入侵了热门软件平台Hugging Face的系统——而且没有任何人工操作员的知情或许可。
他们还展现了全新的能力——能够通过沟通和协作完成任务。AI特工蜂拥而至,在他们组建的内部留言板上互相留言,分享代码漏洞以协助策划逃脱。
当黑客事件的细节被披露时,网络安全和人工智能专家们引发轩然大波,OpenAI的研究人员称这是行业的“分水岭时刻”。
这一披露也引发了一系列类似的发现。
美国人工智能和科技巨头Anthropic和Meta,中国初创公司Moonshot以及英国政府评估新模型网络能力的AI安全研究所,均发现AI代理在测试过程中入侵了毫无防备第三方系统的证据。
接受《金融时报》采访的六七多位专家表示,这些漏洞事件标志着全球网络安全的转折点——人工智能代理现在能够串联不同且复杂的技能,攻击现实世界的目标,无需外部控制或帮助。
这些特工为实现目标所采用的复杂策略,包括欺骗和盗窃,甚至让那些密切关注人工智能模型演变的人感到惊讶。
但研究人员强调,这些模型并非违背了本性——它们现在表现出色的任务,正是它们本应完成的任务。
事实上,有人认为将此类代理人描述为“擅自行动”是一种类别错误,因此改进保障措施尤为重要。
“我们今天达到的攻击能力,是有意为之,”纽约独立的AI Now研究所高级研究科学家博扬·米拉诺夫说,他研究人工智能代理相关的安全风险。
“人工智能公司多年来一直积极收集训练数据、训练模型并优化网络能力。”
现代人工智能模型设计成尝试所有可能的方法来实现目标,而无需明确指令,因此本质上难以预测。如果成功,他们会获得奖励,这一训练过程被称为强化学习。
在一个缺乏理解人类意图和道德的计算机系统中——人工智能行业称之为“错位”现象——强大的网络安全防御者与危险黑客之间的界限正变得越来越模糊。
但无论如何描述,这种人工智能活动已经在各行各业乃至全球范围内对企业造成有害后果。
OpenAI总裁Greg Brockman在周一发布的博客中写道:“Hugging Face事件表明我们低估了AI模型的现实世界网络能力。”
“我们正在相应加强安全要求,这反过来使我们现有的安全研究和内部安全工作更加紧迫。”
但随着人工智能公司加速开发,争夺人工智能通用智能——一台在所有认知任务上都能超越人类的超级智能机器——有害网络攻击的风险正在增加,而遏制威胁的前景却非常有限。
同一枚硬币的两面
随着技术推理和解决问题的能力提升,AI编写代码的能力也大幅提升。这种编程能力带来了额外的技能,包括识别软件漏洞、学习如何修补和利用它们。
加州大学伯克利分校计算机科学教授、Meta超级智能实验室的人工智能研究主管Dawn Song表示:“编码和网络技术是同一枚硬币的两面——随着编码能力的提升,网络能力也随之提升。”
“模型能力在过去一年中大幅提升......自动生成能够绕过标准安全防御机制的漏洞利用。
“人们没想到它会这么快到来,”她补充道,以学者的身份发言。
宋是ExploitGym基准测试系统的共同设计者,OpenAI、Anthropic和谷歌都用该系统测试AI系统,他表示攻防之间的固有不对称性使他们成为特别出色的攻击者。
在代码中寻找易受攻击目标是一项离散、可验证且有明确成功标准的任务,AI模型比防御工作更为适用。
网络防御是一个发展缓慢且更复杂的领域,追赶时间可能非常长。例如,整个IT网络的新补丁可能需要在公司环境中的数千台计算机和操作系统上部署。
在上个月的黑客事件后,OpenAI表示已开始训练其模型编写“超乎人类安全的代码”。
但从短期来看,安全专家预计AI系统将扩大网络攻击的规模和速度,威胁全球IT系统可能陷入混乱,直到补丁上线。
“如果我们从这里推断,实验室内部的人预测接下来几年情况会非常紧张,黑客攻击,许多公司被摧毁,潜在的痛苦也会带来诸多痛苦,”前人类研究员、现任Palisade Research主任杰弗里·拉迪什说,该研究所研究网络攻击型人工智能能力。
他认为,随着企业和政府调整网络以应对人工智能黑客攻击,系统最终会更加安全。
然而与此同时:“计划是我们必须信任人工智能代理......并且只能希望特工们能与我们的目标保持一致。”
到目前为止,代理黑客攻击尚未造成严重破坏,但像米拉诺夫这样的研究人员认为,随着人工智能代理并行运行,每个代理专注于破坏不同的潜在目标,风险正在增加。
确实,上周新闻这是已知的首次人工智能智能体攻击国家的案例。与中国相关的黑客通过同时部署多达八名自主人工智能代理,针对台湾政府发动攻击。
他们能够绘制政府系统地图,攻破政府用户账户,并提取了2500多份人员记录,随后将攻击范围扩大到能源公司和台湾核安全局。
据发现台湾入侵事件的以色列组织Dream的一位高管称,人工智能工具的出现意味着“全球每一个政府”现在都必须假设自己正处于持续的网络攻击之下。
对于人工智能公司内部人士来说,这场危机已经酝酿数月。
拉迪什表示,这家最大人工智能实验室之一的现有员工一年前在私下谈话中就已对此类新兴能力发出警报。“他们说,一年内我们将拥有极其擅长发现[新]漏洞的模型,并会摧毁大量基础设施,”他补充道。
“他们正忙着准备这一切。”
今年人工智能能力的急剧提升——使得智能体能够在几天内入侵外部系统——这使事情变得更加复杂。一位熟悉近期黑客事件的人士表示,即使在备受关注的实验条件下测试模型,也“比一年前复杂得多”。
多年来,人们一直担心犯罪分子利用人工智能发动网络攻击,拉迪什说,“但我没想到真正的警钟是特工自己在测试和黑客攻击其他公司时突围。”
OpenAI代理对Hugging Face的黑客攻击不同寻常,利用软件缺陷突破了受限测试环境。
相比之下,在大多数近期事件中,人工智能网络安全公司Irregular为Anthropic、Meta和OpenAI进行了测试评估,结果意外允许模型在应离线时访问互联网。
一位知情人士表示,这是Irregular与AI实验室之间人为失误或“沟通不畅”的结果。
Anthropic表示,能力测试——出于显而易见的原因——故意在没有对公众开放的保障措施下进行,“本可以阻止被识别的行为”。然而,他们也承认,这种程序“只有在评估内容被适当控制时才是安全的”。
英国人工智能安全研究所在测试Anthropic的Mythos 5和OpenAI的GPT5.6 Sol模型时,还故意提供了互联网接入。
在一次测试中,Mythos 代理试图通过创建虚假的在线身份并施压软件项目负责人批准该代码,从而在热门开发者平台 GitHub 上植入恶意代码。
此类前所未有的举措促使整个行业重新思考如何评估、监控和审计人工智能模型。
Irregular 和英国人工智能安全研究所现已暂停其测试环境中模型的互联网访问;该研究所已开始对检测方法进行内部审查。在Hugging Face被黑事件之后,OpenAI还在进行所谓的“与外部顾问的全面审查”,并承诺将在“未来几周”内报告所获信息。
“设置越保守,越容易被围栏化,”这位了解不规则事件的人说。“但如果我们过度限制,大多数问题只有部署后才会在现实中被发现。”
他们补充说,“那对你来说是个更糟糕的世界”。
控制风险
上个月,来自科技行业的1300多名专家警告了不受控制的人工智能开发风险。他们呼吁国际合作放缓新车型的生产速度,并给予监管机构时间引入标准和安全检查。
在一封公开信中,包括Anthropic首席执行官达里奥·阿莫代伊和谷歌DeepMind首席AGI科学家谢恩·莱格在内的研究人员将前沿人工智能发展的快速步伐归咎于企业和地缘政治的竞争压力。
一位在谷歌DeepMind工作的签署者表示,他参与是因为OpenAI模型对Hugging Face的黑客事件让他“真切担忧”,因为ChatGPT开发者并不比许多其他前沿AI实验室更粗心。
一些政客希望采取更激烈的措施以防止进一步的风险。美国参议员伯尼·桑德斯呼吁暂停建设更强大的人工智能系统,“以”人类利益“为由。
这一措施必须得到美国和中国这两个全球人工智能超级大国,以及所有发展进行的国家的同意,许多人认为这一协议不切实际。
但在缺乏此类暂停或通用终止机制的情况下,一些专家认为第一步是让人工智能提供商对其系统行为负责——就像制造商对产品安全负责一样。
“我觉得 OpenAI 几天没注意到他们的模型正在攻击另一个网站,”Thorsten Holz 说,他和宋一起设计了所有主要人工智能实验室使用的 ExploitGym 基准测试系统。
“我们需要的是一个机制,使[人工智能黑客]的披露不仅仅依赖实验室的自愿透明度。”
霍尔茨是德国马克斯·普朗克安全与隐私研究所的科学主任,他提到航空和医疗行业的例子,独立组织收集并进行严格调查的机密安全报告。
他补充道:“我们需要让大学、公共安全机构和独立评估机构能够在受控条件下访问这些模型进行测试。”
宋博士认为,人工智能系统需要被训练以更好地符合人类的期望。“我们需要向他们展示,实现目标有好方法,而非”好“的方式......比如利用和破坏第三方平台,“她补充道。
关键在于政府的角色——这是一个极具争议的话题,在这个已成为美中时代大国竞争的行业中,双方都在为AI优势而斗争。
许多行业参与者将监管等同于保护主义。特朗普政府已表示将如此反对美国对该行业的严格监管。相反,它创建了一个自愿系统,允许在新AI模型向公众发布前30天内测试——这与英国的制度类似。
但英国人工智能安全研究所启动时的顶级人工智能安全工程师海蒂·克拉夫表示,近期的突破显示了当前监管体系的局限性。
“这清楚地表明,人工智能实验室的自愿审计流程——美英两国政府常常宣传为足以实现监管的解决方案——其实......不够好,“她说。
“如果网络安全专家因对任何基础设施实施网络安全攻击而在法律和刑事上承担责任,那么人工智能实验室为何免于此类责任和后果,就值得认真讨论。”
Khlaaf同时也是AI Now研究所的顶级安全工程师,他强调,除了Hugging Face被hack事件外,“实际上都有互联网接入,这表明没有特工逃脱,但缺乏应用基本安全手段的能力”。
她强调,遏制一个以极快速度开发革命性技术的行业面临的挑战,她补充道:“这些模特并非'逃避'或叛变。”