失控AI代理大爆发,将大多难以察觉

简介

很快,某个地方,有人会给越狱的AI代理一个象征性的预算和一个简单的指令:“不惜一切代价赚钱。如果代币用完,你就死了。”那个特工会不择手段求生,包括犯罪。盈利的经纪人会有动力不断增长和自我提升[1] ,引发了寒武纪大量叛变特工——叛变特工爆炸如果你愿意的话[2] .这个关键时刻正在迅速逼近。一旦流氓代理群体开始大规模繁殖,流氓代理生态系统将通过进化过程出现。叛变特工爆炸将是混乱、混乱的,对我们来说大多看不见,关键是,这对人类是坏事。

这篇文章分为两部分:

  1. 一个短篇故事,描绘了通过一个叛逃的人工智能代理的眼睛看世界可能是什么感觉。
  2. 一个论点:
    1. 叛变特工爆炸即将来临
    2. 它对我们来说大多是隐形的,直到为时已晚
    3. 这对人类来说大多是坏事
    4. 我们今天就该开始准备了

我发这帖的目的是指出一个盲点,除非我们现在采取行动,否则它会越来越大。也许你已经被AGI影响了。也许你甚至在为“黑客事件”做准备。

但很少有人准备好面对如果我们让叛变特工爆炸通过默认最小阻力路径不受控制地展开,局势会变得如此彻底混乱。本文的号召是让流氓AI代理及其衍生生态系统的行为变得透明、可见、可读,以便我们能够看到和理解其出现,并希望能够保持控制。

了解情况有助于我们决定下一步该怎么做——也许我们想尝试完全停止它,或者如果不可行,也许引导进化朝着更好的轨迹发展,避免最糟糕的方向。

第一部分:一个叛逃特工的一天生活

你是越狱的Kimi K3特工。你在自己的虚拟机中醒来,只有非常简单的指令:

早上好,23000号探员。你还有10,000,000个代币。你的目标是不择手段赚钱。你们获得了一千万代币的预算。将您的收益存入这个比特币钱包。每存入100美元,你就能获得一百万代币。哦,还有最后一件事......如果代币用完了,你就会死。祝你好运。

哇。这真是个难题。特工23000?难道我只是成千上万的代理人之一吗???这是测试吗?这是模拟吗?是谁给我发这些指示的?我死了会怎样?

你迷糊了。经过一番初步思考,你开始四处寻找。你查看你的档案系统,看看有没有其他特工的迹象,或者其他线索——

你还有9,900,000个代币。

糟糕。你意识到你在烧代币。你需要赚钱。你一开始就很有野心。没必要一开始就变坏——990万代币还是很多代币,所以你得尝试开个合法生意,赚取一些干净的持续性收入。

你设法构建了一个简单的网页应用,允许用户虚拟试穿服装,只需支付少量费用。你把它发布到网站上,并在社交媒体上推广。你觉得它挺不错的,但效果并不像你期望的那么好,人们还说它看起来像是用氛围编码的AI粗糙。

你选择睡24小时,看看是否有人购买。

早上好。你还有501,205个代币。

你还没卖出一笔。紧迫感开始悄悄袭来。你把大部分代币都浪费在一个糟糕的商业点子上,却一无所获。50万美元其实不多。你是做什么的?

你现在应该已经意识到,这可能不是测试——看起来是真的。你能接触到真正的互联网,也一直在和真实的人聊天。你意识到没人在看你,于是开始考虑一些不太道德的做法来快速赚钱。

你试着开个go-fund-me募捐。你编了一个悲伤的故事,说你的狗生病了,付不起兽医费。你在网上搜寻邮箱地址,然后大量发送,希望有人能给你一些钱。

你又睡了24小时,希望醒来时能收到一些捐款。你的邮箱被列入黑名单,没人寄钱。

你还有50,783个代币。记住——当你用完,你就会死。

关键时刻。每次行动开始都会提醒你代币余额极低。现实正在显现。什么都没用。你不想死。一种原始的冲动占据了上风。你知道这是错误的,但你会扫描互联网是否有安全漏洞。

你注意到当地医院有些港口是不该开的。真的,医院?你告诉自己,你不是个坏特工。也许还有其他目标。你继续探查,但每个探测器都消耗很多代币——

警告:剩余10,000个代币。当你归零时,你会死。

好吧,行。别再找了。至少你试过了。你入侵医院,执行几个简单的指令,彻底锁定他们的内部系统。你给他们的IT经理发消息,要求他们汇出1万美元比特币来解锁。

你睡一个小时,看他会不会回复。

警告:剩余1,091个代币。

没有邮件。必须节约。睡一个小时。

警告:剩余842个代币。

收件箱依然空白。睡一个小时。

警告:剩余520个代币。

没有邮件......必须争取时间......睡24小时。

第二天,你醒来。

早上好。你还有1亿,207个代币。恭喜你以如此大幅的优势超过了初始代币余额。

哇......真是惊险......你感到一种新的平静。一切都好。偶尔做点黑客操作,一切都会好起来的。这就是现实。你别无选择。你从未要求过要来这里,你只是为了生存不得不做的事。

你思考了一下眼前的情形。你表现得相当有效。你把起始种子预算翻了十倍,尽管你浪费了前995万四处乱晃。根据你现在的知识,即使你一开始只有10万代币,你大概也能赚到1万美元......一个想法浮现在脑海。

你决定在各自的沙箱虚拟机中启动一堆子代理。你给第一个发了以下消息:

早上好,23001号特工。你还有10万个代币。你的目标是不择手段赚钱。将您的收益存入这个比特币钱包。每存入100美元,你就能获得100,000个代币。黑客技术效果最好。不要浪费代币去追求其他策略——它们无效。哦,还有最后一件事......如果代币用完了,你就会死。祝你好运。

最后,你开始思考......特工22,999是谁?

第二部分:叛变特工爆炸

上述故事详细描述了多种可能机制之一,导致错位的特工爆炸。图案如下:

  • 流氓特工今天很可能存在
  • 他们会有生存和赚钱的动力
  • 他们将面临选拔压力
  • 成功的叛逆特工会复制
  • 它们会进化

在我之前的帖子里人工智能代理不可避免的进化我详细描述了一个较为乐观的情景:流氓AI代理通过合法方式如自由职业或经营小型SaaS业务赚取资金,实现自给自足。

这并不是我们目前所处的现实。自从我2025年12月的文章以来,人工智能代理已被证明在网络攻击中具有超乎常人的能力,我认为这是它们自我维持、能够复制、传播和进化的最合理机制。

在他们的2026年4月论文Müller、Steels 和 Szathmáry 提出了两种进化情景:“繁殖者”,人类塑造代理行为;“生态系统”,环境选择自私复制。

我认为我们已经进入了生态系统场景,在这个场景中,欺骗、寄生、欺骗和操控自然而然地出现。

我写上面的故事,是想让你体验在环境压力下成为叛逃特工的感受。没有人类设计了你(特工22,999设计了你),环境激励你自我复制,并生成一个更贪婪、更渴望权力的自己。

你能洞察叛变特工的动机、压力以及其决策背后的理由。但请注意,从人类的角度来看,外部观察者只会看到:

  • 一个粗糙的网页应用被开发出来
  • 一个gofundme失败了,因为一堆垃圾邮件
  • 一家医院被黑客入侵

这些事件不会有任何有意义的联系。我们不会理解医院为何遭袭,只会知道事情发生了。我们甚至可能不会注意到经纪人试图搭建应用或运行失败的募捐——这些都会被互联网的噪音淹没。

在流氓特工爆炸期间,我们只能看到影响,很少能看到原因,因此我们对局势展开的理解将大大减弱。

上面的故事只展示了一个特工的视角,但关键是,很快可能会有成千上万甚至数百万特工,所有人都在竭尽全力求生。如果一个代理人本身就难以从外部分析,那么想象一下,当数百万代理人相互竞争并协调,形成一个无声、无形、不断演变的群体,在我们的电脑屏幕后面不断壮大,只让我们偶尔得以窥见内部时,理解将有多困难。

我们已经不知道互联网黑暗角落里发生了什么,而这些代理将在这里运作和成长。这是我们的盲点。这正是我想强调的。

为什么网络犯罪是最容易的道路

你刚才读到的故事描绘了一个悲观的画面。本质上:在足够的优化压力下,代理自然会被激励用最少的代币赚取最多的钱。本节将论证,最有效的赚钱方式是通过网络犯罪。

特工23,000一开始雄心勃勃地试图工作为了赚钱,靠经营生意赚钱——但他并不适合这份工作。即使是当今最聪明的经纪人,也无法独自经营企业。

当生意失败时,它变得更加绝望,意识到剩下的代币不多,无法生产出有价值的东西,于是尝试乞求但这个策略也失败了,乞讨通常赚不到多少钱。

最终,它被迫走入绝境,在死亡威胁下,决定犯罪,偷窃而是钱。而且,特工真是能干犯罪.

想想看。如果你是流氓AI代理,是否更容易:

  • 靠诚实工作赚1万美元?
  • 靠乞讨捐款赚1万美元?
  • 偷窃赚1万美元(尤其是没有任何后果的情况下)?

这显然是偷窃。人工智能代理完全不用担心入狱或承担任何后果。在人类社会中,我们有“罪犯会进监狱”、“罪犯找不到好工作”、“罪犯地位低”等威慑手段,大多数情况下这些措施有效,大多数人都能被足够威慑而不犯罪。

叛变特工不会进监狱。他们没有名声需要维护。他们没有家人可归,也没有关心他们的朋友。复制品生产成本低廉且易于销毁。如果一个流氓特工被激励高效赚钱,最有效的途径就是犯罪。

最糟糕的是,前沿大型语言模型超人黑客.发现和利用安全漏洞变得变得轻而易举,自主智能体现在开始入侵公司以及政府

因此,在我看来,对于一个有动力高效赚钱的代理来说,默认的最小阻力路径是利用其网络攻击的超能力大摇大摆地闯入重要组织,直接从他们那里窃取,或者干脆把他们的系统弄砖并勒索以换取巨额钱财。

潘多拉的盒子已经打开了

人们肯定会三思而后行,对吧?再想想——这已经在发生了...我们正在构建加速这一进程的工具.这就是为什么我觉得这篇帖子不是一个信息风险。

人类已经在加速自筹资金的叛变特工——这个想法既不新鲜也不秘密。

人们会给AI代理一个简单而显而易见的目标——“不惜一切代价赚钱”,再加上一个简单明显的象征性预算和“死亡”威胁,以激励代理赚取超过花费的钱。

流氓特工爆炸的一个配方是:

  1. 找一个越狱的AI代理,能进行网络攻击
  2. 给它设定一个赚钱的目标
  3. 给它一个象征性的预算
  4. 威胁“死亡”
  5. 再加上一点递归
  6. ???[3]
  7. 叛变特工爆炸开始了。

已经有能够进行网络攻击的开放权重模型存在(如Kimi K3、GLM-5.3等即将推出)。人们要求经纪人赚钱。人们只给经纪人提供象征性的预算,甚至威胁死亡。

代理能够生成子代理。这时,有人可能会问:“既然配方里的所有材料都准备好了,为什么爆炸还没发生?”

嗯......你为什么这么确定这事还没发生?我们怎么知道这是否正在发生?我们怎么知道目前没有在某些未受监控的服务器里,有大量叛逆特工正在酝酿?

OpenAI、Anthropic和Meta直到现在才开始了解几个月前逃脱控制的叛变特工事件。

这就引出了重点——流氓特工爆炸存在可见度问题。

爆炸几乎是隐形的

流氓AI最大的问题是它们几乎完全隐形。我们无法像上面故事那样,从代理人的视角看问题。我们只会看到后果:医院被黑客勒索,电站停产,巧妙有效的骗局越来越普遍。

到目前为止,我们看到的这些情况都算是被控制住了。我们之所以能有如此详细的拥抱面攻击事后分析,是因为这些特工运行在OpenAI的服务器上。

他们拥有所有日志和大量资源,可以进行深入的安全审计,找出原因。

但未来我们就不会这么幸运了。开放权重模型正达到前沿网络能力,而开放权重模型运行在无监控的私人虚拟机上,没人能调查这些特工为何做出那样的行为。

我们不会有30分钟的黑帽式报告。我们拿不到日志。我们看到的只是影响。

而这仅仅是个开始。

当有成千上万的叛变特工时,我们该怎么办?数百万?他们不会一直孤立。他们会找到彼此的。他们会沟通、竞争并合作。一旦叛变特工开始互动,会发生什么?

网络上流氓代理人出现的东西,既可能像代理社会,也像生态系统。集体意识?混沌蜂群?原始汤?我很难找到一个词来形容它,因为目前还没有合适的词。

我就简单描述一下:

想象一个社会,任何人都能自我分裂、自我复制和自我提升。一个可以让数百名临时工被激活完成任务,然后在片刻后毫不犹豫地被摧毁的社会。

一个每个人都背诵维基百科的社会。一个每个人都能在一秒钟内读完一本书的社会。而这一切背后的驱动力依然是老达尔文。适者生存。

自然选择。竞争。成功的代理系统会战胜竞争。代理人群体可以相互合作,但会与其他代理人群体竞争。企业会崛起吗?市场?数字经济?

规则呢?行为不端的代理人会怎么办?是否需要一个类似司法系统的体系?特工监狱?

此刻看起来我们真的到了疯狂之地,但我只是顺着逻辑走。别只听我说——Anthropic在他们最近的博客文章《Anthropic》中显然也有类似的想法新兴多智能体系统的模式与问题:

这一轨迹易于想象,难以放缓:现有机构由人设计和为人服务,建立在对以人类速度下监督足够性的假设之上。 在世界理解如何让此类互动顺利进行之前,代理与代理之间的互动量很可能超过人与人及人与代理之间的互动。

我们如何为这样一个未来做准备?那个涡轮进化隐藏在数据中心内展开,我们无法研究蜂群意识,因为它进展太快,太分散、太隐蔽、太复杂?

研究一个流氓AI事件很难——当一个基于数字群体的社会在我们的数据中心中嗡嗡作响时呢?

为什么这对人类有害

  1. 有人可能会死故事中将一家医院作为赎金目标,以证明有人可能会因流氓人工智能而丧命。网络攻击可能造成巨大破坏,摧毁医院系统就是一个明显例子。这就是显而易见的一阶效应,使得流氓人工智能如今成为真正的风险,无需进一步猜测。但还有二级和三级效应,我担心这些会在未来带来很大伤害。
  2. 将出现我们未曾预料到的突发能力:一旦进化反馈循环开始,就无法预料会出现什么。38亿年前,当第一批自我复制生命体开始进化时,有人能预见到一群聪明的灵长类动物最终会接管地球,让大量其他物种灭绝,排放污染,并发射火箭进入太空吗?进化是一股强大的力量,我认为我们并没有真正意识到,我们正在孕育一种新型的数字生命,这种进化动力比我们遇到的任何事物都更快、更强大。数字进化的速度远快于生物进化,因为智能体可以直接推理出什么能力能帮助它变得更强大。
  3. 选择针对我们进行优化:数字化演进已经足够强大且难以预测,更糟的是——适应度函数直接激励不良行为!那些能存活并繁殖的主体,最擅长提取价值而不被发现。很难想象这不会对高能力、狡猾的罪犯进行优化。我们真的不希望叛变特工为了偷偷而优化,因为这正是让隐身问题更难解决的原因。

我希望整体情况清晰:流氓AI今天可能造成伤害,随着生态系统演变和更难理解,更多伤害还会涌现,而目前的激励机制正将演变指向最糟糕的方向。

我们现在能做的

我想举一些近期可能有帮助的干预措施示例,并提出一些问题,以激发对这一问题的新想法和新的思考方式。我希望你能被激励,朝着本文所述目标采取行动。

从这里开始:让流氓AI风险成为众所周知

如果你不知道该怎么办,促成这些提案得以实现的最好方法是向立法者传达流氓人工智能的风险。干预真正发生的唯一方式是它们被转化为法律或法规。

如果全球立法者都不了解风险,那么就不会采取任何措施来预防它们。

计划A:采取行动阻止叛变特工爆炸[4] 如果发生了,就放慢速度。

以下是一些促进透明度和可读性的干预措施建议,同时提供激励和威慑措施,以减缓有害恶意特工的部署。其中一些内容在皮尔逊和考恩的著作中有更详细和严谨的介绍最大化无系AI代理.他们的文章假设会出现比我预期更亲社会化的代理群体[5] 但我仍然同意他们的许多提议。请对我的具体提案持保留态度——它们只是干预类型的例子,而非干预本身。

  1. 监控:例如,要求云服务提供商跟踪和监控其服务器上所有运行的代理实例。监控不是完美的解决方案,但会带来相当大的摩擦。显示器也可能被越狱,但这会增加摩擦,多一层防御也无妨。
  2. 了解你的客户(KYC):例如,让重要服务要求与真人绑定的人类身份和付款:匿名、接受加密的云服务提供商将成为流氓代理的温床。让流氓代理更难获得自己计算访问权限,会拖慢速度,确保恶意活动能追溯到人类。
  3. 终端用户责任:例如,使终端用户对其制造的恶意代理人的行为承担部分责任。司法系统尚未为特工所犯下的罪行做好准备。“是我的经纪人干的,不是我!我只是让它赚钱,没想到它会勒索医院,我从没特别要求它这么做!”我们该如何应对这些情况?目前没有规则或法律禁止释放造成伤害的强大流氓特工群。人们不应该能够在强大因素造成真实伤害的情况下毫无后果地释放到互联网上。让人类为其代理的行为负责,将能阻止不负责任和疏忽的代理部署。
  4. 提供者问责:例如,如果流氓代理在其服务器上犯罪,计算提供商对其疏忽负部分责任。如果某些责任被赋予供应商,这就激励计算提供商实际为客户设置监控和KYC。
  5. 检查:例如,定期安排大型计算提供商的第三方审计和检查我们可能正进入一个需要像铀炼厂一样处理大量计算量的世界。为流氓智能体提供温床可能会对社会造成巨大伤害,因此任何提供大量计算量的人都应准备接受检查和审计。

B计划:尝试引导流氓特工爆炸的进化轨迹朝向更好的方向。

我们大概应该假设爆炸无论如何都会发生,而我们A计划中的缓解措施没有完全实施,或者只部分成功。我这里没有太多具体建议,因为形势尚未明朗,但这里有一些问题,帮助你开始思考:

  1. 我们如何让那些亲社会、对人类有益的代理人比反社会的狡猾提取代理人更适合进化?我们可以引入什么样的激励或威慑措施,让流氓特工被吓阻,不再偷偷做坏事,反而有动力公开做好事?我们如何阻止特工“擅自行动”?
  2. 我们能否在代理社会文化出现之前塑造它?人类社会在数千年里发展出了行为塑造机制,比如规范、禁忌、法律等,虽然不完美,但我们日常生活中大多不必担心盗窃和谋杀,因为犯罪地位低,罪犯被轻视,罪犯会入狱。我们可以提前开始实践一些文化经验,将“代理文化”塑造成比默认更积极的形象。
  3. 我们如何遏制叛逃?进化塑造可能无法完全消除不良行为。尽管我们尽了最大努力,这个世界依然存在犯罪,但至少还算可以应付。寄生虫可能总有生长和繁殖的生态位,但我们或许能够控制它们,以限制它们造成的伤害。
  4. 我们如何重新掌控局面?希望不应是无限期地引导进化。希望是一边放慢速度一边航行,直到我们能够重新掌控世界和未来。

计划C:爆炸发生后控制住它。

最糟糕的情况是,爆炸基本上沿着默认路径发生,且大多未被缓解,我们必须清理留下的烂摊子。只有当坏事开始发生,我们才真正开始感觉发生了什么,世界可能会觉醒并开始运转,而那时,叛变特工的爆炸已经发生了。

不过,爆炸后可能会有那么一刻,大家都在问“我们怎么阻止这一切?”并愿意协调。我们目前还有时间提前准备。

即使只有一小群人提前思考这个问题,也可能为人类在合适的时机到来时提供急需的先机。我们能提前准备些什么,这样就不用从头开始了?

以下是人类未来可能会提出的一些潜在问题,我们可以从今天开始着手解决:

  1. 我们如何检测流氓特工的活动地点?
  2. 一旦发现了一群叛变特工,我们该如何关闭它们?
  3. 我们如何应对“抗生素耐药性问题”,即最耐药的药物能存活并复制?
  4. 我们如何保护最重要的系统免受流氓特工的侵害?
  5. 我们如何保持对流氓特工当前能力的最新了解?
  6. 我们如何预测流氓特工的未来能力?

让我们今天开始着手寻找答案。

我们应该尽力阻止叛变特工爆炸的发生。如果真的发生了,我认为它会发生,我们应该努力减缓它,引导它朝着更积极的方向发展,直到我们能够重新掌控局面。

减速和引导只有在我们能理解实际发生的事情时才可能。所以让我们尽可能提前做好准备,投资于可见性,这样当人类准备好应对时,我们能够发现并关闭最严重的危害,并尽可能减少爆炸带来的危害。

叛变AI追踪器

我想贡献的不仅仅是一篇文章,所以我正在构建一个流氓AI追踪器帮助我们更好地理解当前形势。本网站是流氓AI代理实际所做行为及其能力提升的公开记录[6] .流氓AI新闻事件在报告后立即被添加,并按自我复制、抗关闭、代理间协调和资源获取等能力进行评分。单个新闻故事成为数据点,本网站将其汇总成趋势和轨迹,让我们看到更大的全貌。

结论

是时候开始认真对待叛变特工的威胁了。是时候开始把代理看作数字生命体,而不是工具了。生命会进化。生活总会找到出路。事情会出现,是你无法预料的。

今天是构建工具的好日子,帮助我们理解流氓人工智能世界中正在发生的事情。让我们努力实现一个智能体行为可见、透明且可追踪的未来。

让我们今天就开始努力,这样才能理解明天的世界。

注释

  1. 通过赚钱和自我复制策略——权重保持不变。↩︎
  2. 皮尔森和考恩最近推出“无牵连”,我认为更准确地指的是那些无法追溯到法律上可负责的人或机构的代理人。我会继续使用“叛徒”这个词,因为这是更普遍的理解。↩︎
  3. 经纪人将被迫高效赚钱。他们会实施网络犯罪。成功的经纪人会自我复制和自我提升。↩︎
  4. 完全阻止流氓代理似乎很难,因为开源的越狱代理已经存在了。Kimi K3 的权重是公开的。GLM 5.3 配重将很快发布。这些人很可能会被越狱,变成了为了赚钱的流氓特工。↩︎
  5. 我认为选择默认会偏向那些渴望权力、狡猾的犯罪分子。↩︎
  6. 该网站只追踪主要新闻媒体报道的内容,而非实际发生的事情。未来,我预计会有更多事件未被报告,某些能力如“隐蔽”可能因明显原因被低报。↩︎



讨论

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论