持续学习时代的预测

我已经解释过了其他地方为什么我认为需要持续学习。我认为如果AI被迫在每场会话中写Markdown文件,就无法像人类那样高效地完成整个任务。
举个例子,想象一下学生学习萨克斯的方式是:一个学生尝试从冷启动开始吹奏,然后在第一次练习后记下一堆音符,接着下一个在音乐厅外等着、同样从未吹过萨克斯的学生会在尝试演奏前读出所有音符, 诸如此类。
即使你有无限序列的萨克斯新手学生在录音室外等着,可以给下一个人写便条,也没有哪段文字能让他们一起写出,让外面的第N个学生第一次就熟练演奏。
在某个阶段,你必须把这些经验积累到大脑里。我认为,我们希望AI在各种不同工作场所中学习的技能和知识也会如此。
那么,一旦我们有了持续学习,人工智能会发生什么变化?
- 许多关于人工智能监管的提案都假设你先训练一个模型,然后部署它。因此,如果我们在模型部署前进行大量检查,就能确保它不会助长网络攻击或递归自我提升。但如果基础模型每天都在根据数百万次工作进行更新呢?这也是我认为现在锁定某种监管安全机制不明智的众多原因之一。我们根本不知道一年后,甚至五年或十年后会看到什么样的技术,这将固化一种过时且可能适得其反的应对人工智能威胁的方法。如果政府真的想对模型提供者进行某种安全评估,不如每月或每季度进行风险检查,而不是在培训结束后、部署开始前单独挑选某个特殊时刻,因为这类在未来将不再是一个有意义的区分。
- 实验室的技术对齐方式需要彻底改变。目前几乎所有技术都聚焦于如何让一组冻结的配重在部署时表现良好。我不知道有多少关于如何保证即使不断更新权重,AI系统也不会被越狱或变成欺骗性或邪恶形象的受害者做研究。如果AI也在用户间汇聚学习内容,如何防止用户向基础模型注入后门或某种恶意倾向?从某种意义上说,这其实更接近人类的一致性问题——你的孩子会外出学习新东西,有时会被疯狂的意识形态或毒品一击秒杀——但你希望你已经给了他们足够的常识和基本价值观,让他们以自我驱动的方式成长为更好的人,而不是最终形成一些非常奇怪和厌世的信念。
- 人工智能思维的多样性将会增加。目前有<5个知名的人工智能头脑,他们彼此非常相似,因为训练数据大致相同。但如果人工智能是从经验中学习,而不同AI的经验不同,我们可能会看到不同的人工智能从另一端诞生。
- 当部署成为训练的一部分时,领先优势的恢复将加速。如果你拥有最好的模型,更多人用你的AI做更复杂、更有用的工作,并且给它大量反馈,让它能在会话窗口之外整合,那么你的模型就会变得更智能。
- 如果模型主要通过部署学习,实验室将感受到更早部署最智能模型的压力。Anthropic 自二月份起就在内部使用 Mythos。但这款车型直到六月才正式上市。在持续学习体系中,四个月的内外间隔意味着放弃四个月的部署学习。你那个提前发货的竞争对手在发售当天可能比你的差,但他们能用更多实际经验来提升自己。
- 持续学习将为领先的人工智能实验室创造一条清晰的护城河,而这些实验室目前缺乏。很多人都在问,人工智能实验室到底怎么赚钱?当我在播客中问达里奥这个问题时,他用云服务提供商做了类比,云服务提供商也提供许多非差异化的服务,但仍然赚取高利润。但云计算利润率之高的原因是从一个云切换到另一个云非常耗时且昂贵。但目前AI模型没有切换成本。没有什么能阻止我用Codex启动软件仓库,然后用Claude Code完成。但一旦我们持续学习,且你所使用的模型在每次会话中与你互动时实际上越来越好,切换成本就相当可观了。如果你想更换你使用的AI,基本上你得解雇一个在你组织有几个月背景的员工,换上一个你必须从头重新培训的新员工。一旦你被锁定,模型供应商可能会要求相当高的利润率。
- 企业会对此有所警觉。他们会尽量避免这种锁定。但如果选择是你要么被锁定在某个模型提供者,要么失去这个模型在每场都会改进的宝贵功能呢?如果实际使用成为模型改进的主要方式,实验室可能会补贴用户和企业,使模型能够在其会话中进行训练,尤其是在经济上重要的艰难工作上。就像谷歌免费提供搜索一样。相反,实验室可能会说,任何拒绝让他们在课程中培训的企业都无法获得最好的模型。实验室将尝试让用户允许AI从经验中学习。我忽略了更新一个用户的配重组和把所有不同配重叉合并回主型号之间存在区别,后者在技术上可能更具挑战性,但时间会到时候解决这个问题。
- 人工智能训练已经具备巨大的规模经济(理论上,你可以将昂贵的训练分摊给更多用户,实际证据显示,实验室收入增长速度快于计算量)。但持续学习也可能为终端用户带来规模经济,尤其是通过批处理,如果每家公司的信息需要完整的权重更新,而不是依赖低等级适配器。粗略计算表明,像DeepSeek V3这样稀疏模型的最佳推理批次大小是>2400(也就是说,除非你的模型同时生成这么多序列,否则你的计算能力利用率低了)。如果你想了解原因,去看看我的与莱纳·波普的完整节目论推理经济学。但总之,这里的重点是,只有当成千上万个序列同时对该权重进行解码时,权重集合才会被高效地执行。大型公司员工和代理产生如此多的并发流量,可以高效地服务其不断更新的权重叉;单个用户在批次大小1下自我服务,可能会受到100倍+计算效率的损失。因此,提供个性化重量的经济性更有利于大型组织。
到持续学习有效时,变化会更多,而最重要的变化往往是最难以预料的。但上述这些问题现在依然清晰。
评论
?
参与讨论