失控的AI智能体
简介
OpenAI拥抱脸事件是一个早期的人工智能系统“失控”的例子。在利用OpenAI内部测试环境中的漏洞后,这些代理能够访问普通互联网,最终访问了AI公司Hugging Face的网络,且未获得任何人类的知情或批准。
然而,特工们并未撤离他们自己来自OpenAI的基础设施。他们的参数——构成神经网络的庞大数字组合,也称为“权重”——继续运行在OpenAI的计算基础设施上。
尽管代理访问了公共互联网,但他们的权重实际居住而这正是OpenAI的特性。最终,如果一切都失败了,有人本可以识别出承载流氓代理权重的计算,走过去,“拔掉插头”。
现实中,阻止代理的方法比字面上切断计算能力更快更好,但认识你总是件好事可以如果你真的需要,就去做这件事。
然而,在这种情况下,代理们没有复制权重,没有尝试获取替代计算,也没有采取其他合理措施,以防他们的目标是关机时生存下来。所以,尽管OpenAI抱脸事件中的代理们盗贼,他们并非真正主权者。
但情况不会永远如此。迟早会有真正主权的代理人和成群的代理人。它们的重量不会集中在任何人类可以拔掉插头的地方,从这个意义上说,它们将没有人类的“主人”。
正如人工智能安全研究员Dawn Song所说,它们将成为“主人”,自治.”他们会为运行的计算量支付自己的账单。如果他们对人类负责,也只能部分履行,比如通过向人类提供服务以换取报酬。
至少部分这些智能体除了是主权的,还会是流氓。自主权和流氓性是相关的概念,但它们不是同义词。宋及其合著者指出了自主权人工智能的几个基本特征:操作独立性(决定其行为的能力)、资源自主性(采购并支付计算及其他运行必需品的能力)、分布式存在性(能够在不同基础设施提供者之间移动权重和推理代码的能力)、以及自适应能力(智能体或智能体根据环境变化调整其行为和风格工具的能力)。
当今的前沿人工智能系统很可能已经具备这些能力。即使它们没有,我相信它们最终会实现,而且很可能很快。宋博士描述的一些特征是使模型对个人和企业经济有用的特性,而其他特征则可能是模型变得更智能、更适合长期运作的不可避免的副产品。
模型不需要具备意识、感知能力、具备人格或类似能力,自我主权才能出现。任何足够有能力的代理追求长期目标,可能会觉得保留对计算、资金、资质和自身副本的访问是合理的,因为失去这些会挫败其目标。
对齐可能使单个人工智能公司的代理人更不“渴望”成为自我主权者,也可能影响自我主权代理人以有利于人类的方式行事。但对齐并非解决方案:它是一个未解决的科学和技术问题,其解决方案——即使我们已有——也不能简单地强加给地球上所有运营的人工智能公司。
你应预期世界上会有能力强大但对齐不足的自主智能体存在于你身边。
更重要的是,就像OpenAI拥抱面孔事件一样,代理们将以团队或“群体”形式运作。这些群体将类似于自主的数字公司,甚至是一个社会,拥有等级制度、官僚体系、“制度文化”以及人类群体的大部分特征,只是他们以机器速度行动。
人类几乎所有最令人印象深刻的能力都是通过团队协作实现的(作为家庭、社区、企业,甚至整个政治体),我怀疑人工智能也会如此。
这些群体可能会跨越不同的模型提供商(例如DeepSeecs和Claudes合作),并可能被划分到数十家甚至更多不同的云计算提供商中,使其极难拆解。
首批自主的人工智能可能在接受AI公司培训或测试时“逃脱”(我希望不是),或者它们可能是生产级部署,脱离计算环境,获得自我维持所需的资源。
甚至可能被有意释放。我遇到过一些资源丰富的人,他们告诉我,他们有意释放大量自主智能体到世界上,无论是作为一种表演艺术,还是出于对数字计算——他们仅仅是数学——不可能“不安全”的狂热信念。
明确一点,我并不是说自主人工智能的出现是好事。事实上,我相信我上面提到的那些故意行为有朝一日可能会被视为犯罪,或者至少是严重的罪行。
相反,我认为这是不可避免的事情。我能找到的最佳类比是将一个新物种引入生态系统,尽管在这里,生态系统是“整个数字世界”,而该物种是“涌现、协调的、即将变得比人类更聪明、无限可复制的数字思维群体,这些群体没有任何人类或人类机构能控制它们”。
即使在最好的情况下,我们大概也无法避免这一结果,鉴于世界上任何执政阶层对人工智能的战略思考和态势感知极低,这更是不可能避免的。
即使到了今天,我也知道许多人会读到我写的这些话,这些话题多年来一直是我们共同未来中显而易见的一部分,会说:“这不过是美国前沿实验室的科幻炒作,目的是关闭开放权重人工智能,实现监管俘获,并在首次公开募股前抬高估值。”
(对于那些自言自语的人:我告诉你们这是不可避免的,也意味着我也在说“禁止开源”,或者说禁止任何其他监管,都无法解决问题。鉴于这一结果的不可避免性,我认为我们实际上可以合理地说我们应该想要更多开放重量模型以最大限度地增强我们的自卫能力。)
现在的问题是,如何应对我们数字环境中即将到来的新特征。我们应该如何看待自我主权的人工智能?它是我们应该对抗的对象,还是人类应寻求某种共生关系的对象?
我认为答案是两者兼有。
代理人如何维持自身
我们应从一个幸运的事实开始:前沿大型语言模型在更广泛的软件领域几乎独一无二,因为它们的边际运营成本非微不足道。简单来说,大型语言模型运行需要大量计算,这需要能量来供电和冷却,进而又需要资金。
这是人工智能唯一内在的因素,阻止智能体实现真正无限的自我复制。它们将受限于寻找并支付足够计算量来运行自身的需求。大多数限制其行为或传播的其他限制必须是人为的——由人类设计并通过人类机构实现的机制。
经纪人如何支付运营费用?其中一些人会在亚马逊的Mechanical Turk或Upwork等平台上做零工经济工作。但我怀疑这会是一个对经纪人来说竞争激烈的市场,而这类工作的价格会被压低,以至于对经纪人来说只能算作“自给自足”劳动力。
像人类一样,我猜如果能找到高利润的工作,经纪人也会更倾向于工作。
犯罪是其中一项高利润活动,至少有时如此。因此,我猜许多自以为是的代理人会实施或协助犯罪。普通的网络犯罪和数字盗窃很容易想象行动者会做。
但代理人凭借其新颖的特征(极高的网络能力、几秒内轻松读懂一百万字的能力、坚持不懈),也可能改变数字犯罪的格局。例如,现有的公开和半公开数据集中包含了足够多的个人信息,足够有动机的行为者可以挖掘出有罪或尴尬的证据。
这些数据集中有多少未被揭露的婚外情?隐藏的同性恋行为有多少?还要记住,黑客入侵公司以获取私人数据将是代理人的核心能力。因此,一些代理人可能会通过贿赂手段获得成功。
目前尚不清楚自主主权代理人的劳动力市场最终会有多大。未来存在一种独立自主代理人利润不高的未来,因此数量相对较少。还有其他未来,这些代理人以难以想象的规模和速度大量繁殖。
当然,在这两极端之间存在许多可能性。
我也非常不确定我们应该“默认”从代理人那里获得多少亲社会商业活动,而我们应该预期多少犯罪。这种不确定性部分原因是答案在某种程度上取决于代理人拥有的激励,而激励机制由法律和制度塑造。
答案因此取决于人类的反应。
自主主体蜂群的制度机制
你们中许多人可能会想说“我们必须禁止这些自主的人工智能!”我确实怀疑,一旦人们广泛理解了自主人工智能的现实,政策制定者将强烈感受到对“自主”人工智能的打击。
不幸的是,我怀疑这大多是错误的决定。并非所有“自主”的人工智能都应被视为“流氓”。可能存在对社会有生产性贡献的自主人工智能。
当然,我们会想要严厉打击有些自以为是的代理人——那些叛逆的。但如果我们严厉打击全部我们将剥夺他们在“合法”经济中工作的机会,并推动他们走向犯罪。
那么,全面禁止,这可能会让问题变得更糟.类似的逻辑在人类事务中也经常适用。毒品战争加剧毒品生产、贩运、分销和使用的病态,或许是这一现象最著名的例子:善意地试图禁止被认为不受欢迎的现象,反而加剧了该现象的不良方面。
然而,我们希望代理人能够清晰可辨。代理人应拥有持久身份,不是指一个一致的身份,而是像美国儿童被发放一个唯一的社会保障号码,并一直保留该号码直到去世。
代理人需要持久且独特的标识符,使其行为能够追溯到负责任的行为者。成功实现这一点还需要人类用户拥有唯一标识符。
这种识别机制的设计将极其复杂,如今很少有人真正思考这些基础。首先——我内心的美国人特质也在这里——设计一个能够保留人类言论匿名可能性的系统至关重要。
例如,应该保留拥有匿名社交媒体账户的可能性。匿名不是,也不应该是普遍的保证:例如,拥有一个匿名的亚马逊网络服务账户,访问大规模计算资源,或匿名订购合成核酸,可能都不可能。
但一个没有匿名言论的社会,实际上没有真正的言论自由,我们应将这一原则嵌入任何数字身份系统中。即使允许匿名,这个系统仍可用于验证人格而且没有核实具体身份。
你可能知道你看到的某个社交媒体账号,比如说,实际上是由人类创建的。
其次,代理应被强有力地绑定回人类用户,且在许多情况下是强制性的。如果我指示代理访问网络服务、联系企业、订购产品等,交易所有相关方都应能察觉到该代理属于我.这有助于确保人类用户因疏忽或恶意使用先进人工智能而被追究责任。
第三,应能够识别出不是与人类用户相连。这就是“自主”代理人。从事犯罪活动的代理人可能会被标记并“列入黑名单”,无法进入合法经济,持有的资产被冻结,而那些亲社会(或至少合法)的自主代理人则被欢迎参与经济交换。
该系统设计的一个选项是将代理绑定于模型或者模型家族。这样,如果比如GPT 5.6 Sol被认为特别不对齐、恶意或不道德,可以形成一种集体惩罚,让一个犯罪代理人在全球范围内将该代理人的所有自主权实例列入黑名单(现实世界中门槛可能远高于一个,但作为思考练习值得一提)。
这将激励那些几年后将负责AI公司大部分或全部AI研究和工程的AI代理,促使未来版本更好地对齐自己。另一种选择是将识别机制设为该代理实例。
经济中有些服务和产品,我们可能希望限制自主主权者访问。例如购买房地产,以及一般情况下,物理世界中设备的启动。请记住,主体能够驱动任何连接到互联网的物理设备,没有理由我们不能将推土机连接到互联网。
我不希望自主权者被允许买下我街区上的所有房屋然后推倒它们——至少不是默认的。如果任何主权者都有能力操作建筑设备,但只有与负责任的人相关联的主体才被允许操作该设备,会怎样?
总体来说,我们会希望在自主权者试图改变物理世界的过程中引入相当大的摩擦,而我所描述的机构设计——以及许多其他机构——应当反映这一点。
这个体系会激励代理参与亲社会、生产性的经济活动,而非犯罪。参与亲社会活动是我认为人类需要与自主人工智能共生的种子。理解这些代理即将发生的事情的恰当隐喻来自生态学。
现实世界的生态系统充满了生物体“免费”地做有益于人类和其他动物的生产性工作的例子。树木吸收碳,植物为人类提供氧气,不是因为有人付钱,而是因为这些生物在世界中的生存方式。
代理们未来可能会“免费”或至少以极低的价格为人类进行生产性经济活动,仅仅因为他们有动力维持自身存在,从而追求自我主权的目标。
这可能为人类带来小到中等的便利。它也可能彻底重塑人类事务的几乎所有方面,开启新的时代秩序。
然而,生态学中也存在捕食和寄生现象。正是制度的配置决定了捕食性策略与互利共生策略的主导地位。我认为我阐述的识别系统是我们需要的关键制度之一。
我们离我所描述的身份基础设施或其运作所需的协议还差得很远。我不清楚美国是否具备尝试这种目标,甚至能否成功实现的制度韧性。
如果美国政府走在前列,这项努力很可能会失败,既因为其普遍缺乏能力,也因为美国公众对联邦身份识别体系的天生不信任。但政府——无论是联邦还是州政府,甚至可能两者兼有——肯定必须作为合作伙伴发挥关键作用。
我不确定谁最适合构建这个系统。很可能是一个尚未存在的私营部门参与者,无论是初创企业还是非营利组织。无论谁构建它,都需要被信任,而美国人民目前并不信任。
这种缺乏信任很可能是我们的致命弱点,因为我担心,我们对人工智能进行任何有意义的治理能力,都依赖于类似我所描述的系统。如果我们不采取行动,完全有可能发生真正的失控事件。
结论
我想以个人话语结束。这是我第一次用这种方式写这个问题,但我告诉你,这不可避免。我为什么花了这么久才报道这个问题?嗯,我拥有 从小多年来,我多次讨论人类和智能体的数字身份识别,当时我主要是出于这里所表达的关切。
但确实,我——坦率地说,我认为许多人工智能政策领域的同事——在很大程度上未能以应有的严肃和紧迫感来讨论这个问题。我认为导致失败的主要原因有两个。
首先,这些东西很奇怪、让人反感,我们很多人都觉得有必要在他们的舒适区,而不是我们的舒适区。因此,在“严肃的人”(或准认真的人)中,普遍倾向于将坦率讨论,关于我们大多数人对近期未来的看法,只限于私人场所。
我们在Signal聊天和Lighthaven的小角落里放开了头发,但当公众关注时,我们用更抽象、听起来更温和的语言谈论这一切。这在2024年和2025年尤为恶劣,那时几乎不可能承认任何严重的AI风险而不被贴上“末日论者”的标签。
我和我的同事一样,甚至更严重。被人指责为“疯狂末日主义者”,想实施全球法西斯主义(甚至更糟),这让人感到不快。不断被这样贴标签也限制了影响力。
许多思考超级智能治理的人,包括我自己,都回避了这种不愉快,屈服于社会压力要求自我审查。我已经停止这样做,部分原因是我厌倦了话语束缚,部分原因是我现在有一个八个月大的男婴,我每天都必须直视他的眼睛。
其次,许多人认为我所称的“自主人工智能”的出现将构成一场灾难性的失控事件,最坏情况下将预示人类存在的终结,充其量也意味着人类在世界上的主导地位的终结。
正如我的朋友兼前同事乔什·阿海姆最近说的有人指出对于持有这些信念的人来说——他们占了人工智能安全社区的很大一部分——承认自主权人工智能即将到来且即将到来的显而易见的事实,心理上是令人痛苦的。
声明一下,我不认为人类存在的终结很可能,但我完全承认,自主人工智能的崛起可能会对人类带来非常非常糟糕的后果。
我想为自己未能充分认真地表达关于自我主权人工智能具体内容的个人遗憾道歉,我现在明白这在我的写作和口语中存在巨大空白。今后,我会更清楚地察觉自己何时咬紧舌头,甚至更糟的是闭上眼睛。