马格努斯挑战
假设你是一名国际象棋俱乐部棋手,Elo等级分1500分(初级中段)。如果你能在每方仅一分钟的超快棋对局中击败Elo高达2800分的马格努斯·卡尔森,就能赢得十亿美元。
卡尔森只有1分钟的用时,而你则有一整年。
即便拥有这样的时间优势,你依然毫无胜算。不过,这里有个转折:在这一整年的时限内,你可以向任何其他棋手发起挑战。对方只有1分钟,而你可以随意支配自己的时间。
如果你赢了,对方就可以替你去迎战卡尔森,并用掉你剩余的所有时间;或者,他再去找下一个对手,后者又去找下一位……直到有人替你与卡尔森交手。
只要在任何一个环节你或你的代理人输掉一盘棋,挑战即告失败,你将一无所获。我们暂且忽略和棋的情况。
问题在于:击败卡尔森的最优策略是什么?你是否真的有足够的时间,至少让获胜的概率达到五成?
以下是一些假设:
- 根据Elo评分体系的规律,比对手强100分,意味着你在对局中约有64%的胜率;强400分,则约为91%;若要达到99%,则需高出800分。
- 额外的思考时间会让你发挥出高于自身Elo水平的实力,但收益会递减。你的用时是对手的10倍时,相当于额外提升了约250分;1000倍时,提升约500分;1亿倍时,提升约750分。若想凭一己之力与卡尔森打成五五开,你需要至少1300分的领先优势,然而没有任何时间优势能带来如此巨大的实力跃升。
你绝不能直接挑战卡尔森,否则必败无疑。相反,你应该先击败一个略强于自己的人,再由他去战胜更强大的对手,如此层层推进,最终轮到你来挑战卡尔森。
每一步都依赖于相应的时间优势。
那么,究竟该走多少步呢?步数太少,你会在第一轮就被碾压;步数太多,则意味着必须连赢太多场次。每一场都是一次风险,而且随着链条拉长,每一环的代理人所拥有的时间优势都会逐渐削弱。
你可以自主选择参赛者,使他们的Elo分布从你的1500分均匀延伸至卡尔森的2800分。这样一来,最佳方案便是将总时间优势平均分配到各环节。
比如,你决定进行20盘对局:自己先上阵,第一号代理人接棒,第二号代理人继续……直到第19号代理人对阵卡尔森。每一对手的Elo都比前一位高65分。
每盘对局你大约有18天,也就是对方1分钟用时的2.6万倍。这样的时间优势让代理人们实际领先约535分,胜率约为96%。听起来不错,但以96%的胜率连赢20盘,最终全胜的概率也仅有41%。
这显然还达不到我们期望的五成最低线。更何况,肩负十亿美元重压,连续经历20场紧张的棋局,实在令人望而生畏。反过来说,如果只安排两盘对决,中间只有一个代理人,情况又如何呢?
每一名对手的Elo都比上一位高650分,每盘对局是你6个月对对方1分钟,整体优势不过每盘10分左右。换句话说,每一场都像抛硬币一样,最终胜算仅为27%。
折中的理想方案是七盘对局,配备六名代理人。每一对手的Elo比前一位高185分,每盘对局你约有52天,即对方1分钟的7.5万倍,相当于额外提升了630分。
这样一来,你的棋手们净胜445分,胜率约93%。以93%的胜率连赢七盘,最终全胜的概率可达59%。也就是说,你确实有可能以超过五成的概率击败卡尔森!
如果我们尚未实现,那么第一批超人类智能终将到来(起初很可能是人机协作团队,随后才是纯AI)。为确保我们最终构建的类神级ASI能够与我们的价值观保持一致,就必须保证每一级前代智能同样被正确对齐。
只要链条上的任何一处出现偏差,后果都将不堪设想。
此刻的我们就像那位卑微的俱乐部棋手,寄希望于击败卡尔森。而能否成功,取决于AI的发展轨迹是否与“卡尔森挑战”故事相吻合。之所以选用这个比喻,是因为我能够基于国际象棋的规则估算相关变量,且它能清晰地传达核心理念。
不过,AI的故事也可能存在诸多差异:
- 在“卡尔森挑战”中,我们可以按自己的判断,在多个对手之间灵活分配时间,并自行选定最优的对局数量。而在AI领域,我们无法决定每一代智能之间的跳跃幅度。一旦出现过大的跃迁,可能就会导致失败;我们也未必能随心所欲地调配时间。新的人工智能模型会以不可预测的速度涌现,我们必须在发布前确保其对齐。暂停AI发展是我们调整节奏的唯一手段,但这一资源十分有限。请记住,在“卡尔森挑战”中,我们正是把更多时间留给那些Elo差距较大的对局。(由于各对手的Elo差距相等,我们才给予他们均等的时间。)倘若我们在某个本就容易对齐的模型问世前贸然启动暂停,反而不如把暂停用在应对最大跃迁之时。可若是拖得太久,又可能错失使用暂停的机会!(需要强调的是,这里的“对齐”并非指完全契合,而是达到足以让我们撑到下个版本的安全程度——所谓“交接式对齐”。这或许并不轻松,但我认为当前的多数模型大概已处于这种状态,只是尚未完全达标。)
- 每盘棋彼此独立,但有时用于对齐某一模型的技术也会显著影响后续模型的对齐效果,只是这种影响的程度有限。如果你凭借人类的“豌豆脑”想出一种对齐方法,那么比你聪明得多的超人类智能在尝试对齐其继任者时,很可能瞬间领会并照搬这一思路,根本无需你的帮助。
- 你和卡尔森都是人类,他的棋艺再高明,也不可能比你强太多。而人机之间的差距则要大得多。如果顶级人类智慧与类神级ASI之间的鸿沟,远甚于普通棋手与超级特级大师之间的差距,那么AI的对齐难度无疑会超过“卡尔森挑战”。(需要注意的是,这一差距不会无限制扩大:当ASI已经能胜任我们所需的一切任务时,即便它完成了对齐,却无法确保其更高级的继任者也能对齐,我们完全可以要求它不再创造新的智能——因为超出部分对我们而言既无必要,又潜藏严重的对齐风险。换言之,如果你仅仅满足于击败莱维·罗兹曼并就此止步,而非挑战卡尔森,那么总体风险就会低得多!)
- 棋手在面对不同对手时,因时间充裕而表现出的收益递减曲线,未必能反映AI安全研究者在应对下一代模型对齐难度时的递减规律。在“卡尔森挑战”中,固定Elo、1分钟用时的对手设定,旨在模拟对齐那些智力更高、训练期间又刻意抗拒对齐的模型所面临的日益严峻的挑战,但毕竟“与对手下棋”和“设计AI对齐方案”并非同一回事。
- 对齐并非非黑即白。一个模型可能在某些情况下对齐不足,而在另一些情境下表现尚可。此处的模型简化并未涵盖这些复杂性。
- 我们拥有的时间优势可能远不及“1年∶1分钟”的夸张比例,更接近“1小时∶1分钟”(在这种情况下,你击败卡尔森的概率约为8%)。你对自身优势大小的估计,将直接影响成功的可能性。
- successive AI models 可能运算速度更快,从而扭曲收益递减的曲线。AI的计算能力无疑远超人类,因此至少在起步阶段这是一个不容忽视的问题。
- 另一方面,由于递归式自我改进,AI模型的迭代速度可能越来越快;若其增长速度远远超过思维能力提升的速度,则会压缩前代模型对齐下一版的时间余地。
- 59%的胜率对于赢得十亿美元已是相当不错的概率,但对于避免末日危机而言仍显不足。对齐的可靠性要求更高。若要在七步之内达成99%的成功率,每一步都需要接近99.86%的胜率。
从一方面看,“卡尔森挑战”确实鼓舞人心:你这位Elo只有1500分的普通棋手,原本绝无可能单枪匹马击败卡尔森,即使他前6步都在换王后,只是为了捉弄你。 但通过逐层击败众多对手、借力打力,最终却有望实现逆转。
许多人建议将同样的策略用于AI的对齐工作。这真的可行吗?事实上,AI目前尚未完全对齐,某种意义上我们已经“失败”了。不过,我们并不需要链条上的每一步都做到完美对齐,只需确保在到达下个版本之前能够安然过渡,而当前的模型也应尽其所能协助完成这一目标(否则一旦被发现耍花招,必将付出代价)。
尽管如此,这仍然是一项极高的门槛,而且正如前述,AI的对齐链条很可能远不如国际象棋的胜利之路那般顺畅。
我们手中唯一的节奏调控工具——暂停AI发展——必须谨慎把握:既不能在无须之时贸然挥霍,也不能拖延到真正需要时却已无力回天。理想状态下,应在能力出现最大跃迁之前按下暂停,以便在风险最高的时刻争取更多缓冲。
鉴于当前的能力跃迁并不剧烈,我个人倾向于“暂不行动”,但同时也应提前做好基础设施准备,以便时机成熟时能够迅速响应。
无论如何,我们都不能仅仅满足于确保链条上的下一步不会酿成灾难。为了保障整条链条的安全,我们需要远更高的确定性。