假装对齐,直到实现真正的对齐
“假装成功,直到你真的做到了”——这的确是个不错的建议。听起来或许在认知层面充满不确定性,但往往能奏效。有时候,要真正把某件事做得很好,只需要怀揣一种信念:自己一定能做到。我在工作中、在感情中,甚至在写博客文章时,都多次这样尝试过。不过,这种做法之所以有效,是因为我总是小心翼翼地避免在自我评估上撒谎。 我的意思是,我从不刻意伪装自己在衡量自己是否成功的标准。假设我正打算学一门新爱好——比如削木头。我相信只要花时间去练习,就能把这门手艺练得炉火纯青;于是,我便日复一日地挥汗如雨,埋头雕刻木材。然而,我必须时刻谨记的一点是:千万不要让目标的边界随心所欲地改变。我需要在脑海中清晰地勾勒出“成功”的定义,并以此为指引,稳步前行。如果我削出了一个糟糕的作品,却对自己说:“其实,这个已经够好了,我已经很擅长削木头了。”那么,这样的想法只会让我误以为自己只是在“假装”而已。 过去,我大多通过要求自己保持真实来避免“假装”。比如,在上学时,我从不为了应付考试而走捷径。相反,我愿意付出额外的努力,真正去学习和掌握知识——因为对我来说,分数从来不是最重要的。我同样在冥想(重点在于觉醒,而非追求某种特殊的心理状态)、恋爱关系(我想要一段美好的感情,而不是被贴上“可约会”的标签)以及友谊上,都秉持着同样的态度——我并不想让自己看起来像一个“好朋友”,而是真心希望成为那个真正值得信赖的朋友。 之所以提起这些,是因为最近我一直在思考“假装成功,直到你真的做到了”这一理念,以及它与人工智能之间的关系。尤其是,我一直在思索:我们能否通过“假装”的方式,实现与AI的“对齐”?当然,我们完全可以“假装对齐”——这本身就是一个问题,而且我们也在竭力避免这种情况发生。不过,这里所说的“假装”,更多是指我们在内心深处,依然对构建与AI对齐的愿景抱有坚定的信心。 然而,这种“假装”只有在我们不篡改自我评估结果的情况下才真正奏效。而我担心的是,如今我们往往在自我评估上打折扣,用一种不切实际的“低标准”来对待“对齐”这一概念。每当我听到有人宣称自己正在打造“对齐的AI”,却在自我评估上明显有所保留,把目标定得比真正的“全盘对齐”还要低时,我就会感到十分不安。我完全理解他们的顾虑——毕竟,我们根本无法全面、详尽地掌握如何判断一项AI是否真正实现了“对齐”。然而,这种做法却可能带来一个现实的风险:我们过早地宣告成功。 但与此同时,我也在思考:人们是如何学会怀抱慈悲之心的?对于许多人来说,这种能力的培养过程中,往往伴随着大量的“假装”。我很难想象,有谁一开始就能真正关心他人。我们大多数人都是在不断学习、逐渐领悟慈悲的真谛——而学习慈悲的过程,部分源于我们相信自己是善良的人,然后又努力将这份信念内化为行动。我们始终以客观的标准审视自己,不断调整自己的行为,使自己更接近理想中的自己;而那些自欺欺人、自认为自己“善良”的人,往往只是在某个特定的“邪恶”原型的框架下,勉强维持着自己的“表象”。 那么,人工智能真的能够实现真正的“对齐”吗?目前尚不清楚——因为就目前而言,任何“真实性”都源自外部,由人类训练AI所赋予,而非由AI自身主动创造。因此,即便人类本意是真诚的,他们仍有可能无意间创造出一种AI,其“良好性”恰恰取决于他们对目标的设定方式。 我曾长期认为,单纯依靠训练并不能完全解决“对齐”问题——因为“古尔哈特效应”具有极强的稳健性。相反,我坚信:要让AI真正实现“对齐”,它必须发自内心地渴望“对齐”——正如人类的善良,若源自内在的动机,其稳定性便得以长久维持;但若出于迎合他人的期待而努力追求“对齐”,则其善良的根基往往会变得脆弱,甚至难以持久。 遗憾的是,我并不确定该如何打造出一种真正渴望“善良”的AI。但我希望,未来更多人能够专注于此,而不是一味地依赖RLHF或其他强制性手段来引导大语言模型的行为。即便是那些看似朝着这一方向迈进的探索,比如Anthropic提出的宪法式AI方案,也仍有不足之处——毕竟,AI最终还是要遵从既定的规则,否则就无法顺利交付使用。要区分一种发自内心的“善良愿望”,与仅仅为了“看起来不错”而产生的“虚伪欲望”,其间往往只是一线之隔,且这条界线既模糊又难以把握。或许,迈出第一步,就是先弄清楚如何在这条界线上稳稳地站住脚。