大胆观点:大语言模型可以“跳跃”

我想表达我对大型语言模型如何通过重大突破推动科学进步的看法,以及我观点背后的假设对安全风险和持续学习意味着什么。

让我先说说我对ICML'26立场文件的不同意:“LLM不能跳跃” 作者:Tom Zahavy.

前奏

在“大型语言模型不能跳跃”汤姆引用了广义相对论的案例研究,爱因斯坦在试图构建数学引力理论时,受到电梯思想实验的启发。水星的异常轨道后来成为该理论的重要检验。

具体来说,这需要溯因推理:推断加速度与重力表面等价的最合理解释。汤姆解释说:“(爱因斯坦)依赖于物理先验。由于模拟的加速度感官体验与记忆中的重力感官体验无异,爱因斯坦推断它们必然是同一现象。盒子内的场不是假的惯性效应;它,按定义,是一个真正的引力场。”

汤姆还通过以下论点为自己辩护:

  1. 不需要新的引力理论,因为牛顿框架运作良好,水星异常轨道也可能用其他因素解释。
  2. 当时没有公理让他通过推理得出理论。

换句话说,Tom 强调的是,鉴于大型语言模型没有可靠的世界模型(这对物理先验来说是必要的),而且没有数据集可以真正推导广义相对论,大型语言模型不会突然做出突破。

总的来说,我相信我和汤姆大概会同意以下观点:

  1. LLM能够进行演绎或归纳。
  2. 溯因理论——特别是依赖感官体验——是爱因斯坦提出广义相对论的方式。

然而,我主要的分歧不是大型语言模型是否能通过相同的想象力进行类似的溯因,而是有人是否可以通过另一种更演绎的路径偶然发现广义相对论。

令人惊讶的是,这并未在ICML 2026 评测.

有没有其他方法可以推导出广义相对论?

我陷入了一个深渊,想知道是否有可能在广义相对论上有当代的发现。.我偶然发现了这个文章这表明爱因斯坦的溯因溯因路径并非通往广义相对论的唯一可能路径。

“我不打算用引力来解释物理学的其他部分,而是通过改变历史来逆转这一问题。假设爱因斯坦从未存在过......“ ——理查德·费曼

以下是相关文本的逐字摘录:“基于量子场论的一般原理和实验结果,可以得出结论:引力和其他任何力一样,必须通过虚粒子的交换来介导,这里的虚粒子是一个无质量的中性自旋-2量子,即引力子。因此,通过构造引力子的洛伦兹不变量量子场论并施加某些一致性要求,应恢复完整的广义相对论.”

好奇的读者可以在第4页详细阅读,费曼路线从狭义相对论出发,然后加入量子场论和引力的经验性质。这些假设并不直接预设爱因斯坦的理论。

请注意,我的观点并不是要确立费曼必然会从零开始重新发现广义相对论。他已经知道爱因斯坦的理论,重建已知结果比第一次发现它要容易。

此外,历史上量子场论是在广义相对论提出之后才发展起来的(但不是取决于广义相对论)。

我更狭义的观点是,只要拥有足够丰富的后期知识体系,广义相对论可以在没有爱因斯坦思想实验的情况下恢复。费曼的许多路径是演绎的,这也是大型语言模型在OpenAI的Astra模型中已经表现出的推理。

为什么互联知识使“跳跃”成为可能

超越Tom工作的案例研究,我认为关键在于LLM是否能提出合理的解释,从而实现突破。我同意汤姆的观点,即施密德胡伯对压缩即“寻找一个简洁解释观测的简单程序”,并不能解锁溯因跳跃(即提出合理假设)。

我更深层次相信大型语言模型能够取得重大科学突破的原因在于知识本身的结构.由于事实和公理通过数学结构或因果关系相连,一个事实主张或观察要么限制了可能为真的可能性(这有助于排除错误假设),要么揭示了可能从另一个领域传递的模式(从而帮助产生新的假设)。

基于这个框架,我认为:

  1. 模型已经可以提出新的联系。例如,为了推翻单位距离问题中长期存在的猜想,OpenAI的Astra模型将代数数论工具引入离散几何问题.
  2. 模型可以推理观察或联系的一致性.假设模型表现出强大的科学推理能力(给定这种能力在不同STEM学科中如何提升),模型可以通过公理或先验知识的推导来解释某个观察是否一致。随着模型变得更智能(即将从事实推理到事实),这种不一致就表明当前范式存在局限,或者推理中缺少“跳跃”。模型随后会提出合理的假设和解释(从1中)。虽然对假设的多样性保持猜测是正常的,但我看不出为什么假设1会成为失败点的解释,因为我们看到越来越多的未解决问题因(1)而被加注。
  3. 模型可以验证这些解释。LLM代理可以轻松执行代码执行、精益形式验证、模拟,甚至湿实验室实验以提供实验结果。因此,从(2)开始的假设生成转变为迭代的经验验证。

当然,我并不宣称模型已经足够好,能够解锁所有科学突破,但我预计,只要我们不断改进模型关于知识一致性和现实实验/验证反馈的推理能力,我们可以实现许多看似“范式改变”的成果。

安全影响:缺失的知识可以被重建

如果我们创造能够在高度互联的知识体系中导航的超级智能机器,仅仅从预训练中移除有害信息作为完整的安全策略可能不足以实现。删除一段明确的有害知识并不意味着剥夺其推导能力。

模型无需直接回忆被移除的概念。它可以简单地识别知识缺口,提出填补该缺口的方案,推导后果,并检查这些后果是否与其现有知识体系一致。

已有受控证据支持这一点。Treutlein 等(2024)模型能够从分布在不同训练实例中的间接观察推断目标事实或规则。他们假设的威胁模型正如我所说:审查危险知识会删除直接陈述,同时让隐含信息散布在文档中。

姚等人。同样,在合成知识图中,模型可以通过将保留的关系组合到训练数据中,回答悬而未决的多跳问题。

我确实相信数据过滤在一定程度上仍然有效,因为它增加了重建成本——假设知识足够复杂,需要CoT重建,这提供了可监控的时间窗口——如果我们成功弄清楚模型如何从隐性知识中推导出来,就能去除足够的信息,使重建变得不可能。

然而,如果超级智能机器能够弄清楚不同领域的知识如何相互交织,而我们却越来越依赖它们来取得科学突破,我仍然持相当悲观的态度。

不难推断,一个在“溶瘤病毒疗法”上表现不佳的模型——即用病毒治愈癌症——能够轻易推断出如何制造具有毒性的病毒株作为生物武器。科学知识往往具有双重用途。

持续学习的预测

我还预测,如果新模型能在不同领域形成更多相互关联的知识,新型号的持续学习会更容易.

我对持续学习的定义相当宽泛,也就是说模型或代理能够帮助完成需要新知识的任务,而这些知识在培训中看不到。它不必直接更新权重——只要能利用其处理新(背景)信息并满足用户任务的能力,这表明模型已经学会利用新知识。

这一观点与新兴的机器学习.

具体来说,我基于未来模型将成为更广泛领域专家的假设,提出了两个预测:

  1. 在体重领域直接学习知识变得更容易因为他们更为重要分配模型们看到的情况,随着模型在更广泛领域的专家不断成长。换句话说,现有算法可以被轻松应用,我们看到新模型带来的持续学习成功率提升,因为新知识只是对已有知识的延伸。
  2. 未来的模型将解决塑性丧失的问题——如果它仍然存在——发明将新知识与现有知识连接的方法。它可以以多种形式出现:新知识的数据增强,或直接连接新旧知识的新学习算法,对自身进行即时优化,使连接明确以激发新领域的能力,或者仅仅留下关于如何使用新知识的笔记(以避免进行破坏性的权重更新)。

结语

我提出了科学发现的相互关联知识观点——正如“站在巨人肩膀上”的格言相符——解释广义相对论如何被重新发现、潜在的科学突破、安全影响以及持续的学习进步。

我也不认为这种观点特别新颖(正如有人提出的那样)如2009年的文学但我更坚定地认为,鉴于LLM进展的速度,这足以引领科学突破。我很可能错了,但我还在写这些,因为我有X的承诺。

致谢

感谢李小晨雅各布为了有见地的讨论,帮助我更好地表达我的想法。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论