LLM擅长哪类数学?菲尔兹奖得主Tim Gowers的深度分析

为了方便那些在遥远的未来(比如一个月后)阅读这篇博客文章的人,我要提一下,我写这篇文章的正好是 OpenAI 宣布解决了数学和理论计算机科学领域的十个主要问题几天后,包括首次构造非 sofic 群,以及证明多色拉姆齐数(其中有 3)在 中超指数增长。
第一个,从我参加过的各种讲座来看,是群论中最重要的未解决问题之一;第二个是拉姆齐理论中一个重大未解问题,我并不一定指望在有生之年看到它被解决,尽管当然,这些预期现在必须被修正。
我想明确时间安排,是因为我将讨论大型语言模型目前的能力,完全预期这些能力会持续快速变化。所以很可能不久之后,如果我写的内容有任何有趣的内容,那主要是作为2026年8月初局势的记录。
这些结果以及列表中的另外八项都极为令人印象深刻,但似乎还不完全是大型语言模型在数学各个方面都优于所有人。如果他们能,那么他们对我们的巨大速度优势意味着比赛结果会更加丰富。
因此,人们自然会好奇大型语言模型擅长哪些类型的问题,以及哪些方面仍有改进空间。我不敢假装对这个问题有好答案,因为一个好的答案是清晰的分类,能很好地符合当前的例子,但排除一些错误答案,并尝试识别那些证据不明显矛盾的潜在答案,是一个有趣的练习。
大型语言模型特别擅长寻找反例吗?
首先要说的是,大型语言模型不仅擅长寻找反例,还能找到难题的证明。然而值得注意的是,他们解决的最著名问题几乎都是反例而非证明。
上述两个问题以及雅可比猜想和单位距离猜想同样如此。
如果有人想推测大型语言模型特别擅长寻找反例,那么有两件事可以让理论更有说服力。第一个听起来可能没什么问题:它要判断什么时候解决问题算是找到反例。
一旦这些问题解决,第二步是提出一个可能的解释,说明为什么大型语言模型特别适合解决这类特定问题。
找到反例意味着什么?
我为什么要说,找到反例的意义并不完全明显?有人可能会认为,这只是意味着你有一个形式的陈述:“每个某某类型的对象都具有某某性质”,而你展示了一个不具备该性质的给定类型的对象。
然而,这并不总是奏效。考虑维诺格拉多夫的一个著名结果,它指出每个足够大的正整数都是三个素数的和。该命题的否定是(或等价于)对于每个正整数,存在一个整数使得不是三个素数之和的命题。
换句话说,它指出每个正整数都具有某种性质。从这个角度看,维诺格拉多夫找到了一个正整数的例子,使得不是拥有给定的性质。我们想说维诺格拉多夫找到了反例吗?
显然不是——结果显然应被归类为定理,而非反例。
因此,我们不能简单地说大型语言模型特别擅长否定普遍量化的命题:必须存在某种关于自然全称量化的。以三素数为例,很明显维诺格拉多夫并没有想过“我怎么用这个性质求得?”他认为的更像是,“我有一个非常大的整数。我怎么证明它是三个素数的和呢?”换句话说,他所有的关注点都会放在普遍量化的部分,而存在量化的部分则是证明细节完成后才会考虑的。
一般来说,许多有趣的结果在正式陈述时,都是以交替使用两个或三个(甚至更多)量词开始的。问题变成了确定哪个变量在某种意义上是第一个“有趣”的量化变量。
这里还有一个例子来说明这一点,来自有限维范数空间理论。我会给好奇的人讲一些数学细节,但如果你不关心这些,可以跳过接下来的三段,应该能大致明白我对这个例子的意思。
设 和 是二维范数空间,设 是从 到 的线性映射。我们说这是一个——同构如果存在使得对每个 。通过重新标放,我们总可以取为 1,这样我们对每个 都有 。
如果 ,则这告诉我们 是一个等距变换。一般来说,巴拿赫-马祖尔距离在 和 之间定义为最小,使得存在从 到 的 -同构。很容易看出,巴拿赫-马祖尔距离的对数是 维赋范空间等距类集合上的度量。
一个不那么简单但也不算太难的事实是,所得度量空间是紧的:实际上,它被称为巴拿赫-马祖尔紧致体。
人们自然会好奇巴拿赫-马祖尔压实体的直径是多少,这里事情变得有趣起来。Fritz John 的一个结果表明,每个 维空间与 的距离最多为 。
(证明的思想如下:在 -维最大体积椭球的单位球内选中;即与等距的赋范空间的单位球;可以证明恒等映射是 和 之间的 -同构。)根据弗里茨·约翰定理和(乘法)三角形不等式,对于任意二维赋范空间 。
也就是说,巴拿赫-马祖尔紧致质的直径最多为 。但会不会远低于这个数字?
从观察空间和 来看,答案并不明显的迹象可以看出。这两个空间之间的恒等映射是一个 -同构,但如果将标准基向量映射到单位立方体的顶点,而不是映射到自己,并且选择顶点尽可能正交,可以得到更好的结果。
特别地,如果存在一个哈达玛矩阵,那么对应的线性映射是一个 -同构。可以推测这个观察,推断出对于任意 ,和 之间的巴拿赫-马祖尔距离为 。
也很容易证明 ,因此 -空间几乎不会改善易下界,在存在哈达玛矩阵的维度中也不会改善。
1981年,格拉斯金通过确定巴拿赫-马祖尔压实体直径的正确渐近函数,著名地解决了该问题。非正式地说,他证明了直径在弗里茨·约翰定理直接得出的上界常数范围内。
如果我们把量化做得显式,那么我们得到的陈述是
,
其中我写为所有 -维范数空间的集合。(如果你想论证它不是集合,那么我再说明底层向量空间是。)换句话说,存在一个正常数,使得对每个正整数存在 -维赋范空间,且 与 之间的巴拿赫-马祖尔距离至少为 。
我无法不简要描述格拉斯金提出的那个美丽且极具影响力的解决方案。他取 和 为赋范空间,其单位球是随机对称凸集,定义如下:取标准基向量和少数其他随机单位向量,以及所有这些向量的负数,取凸包。
格鲁斯金随后证明,如果从该分布中选取两个范数空间,那么它们的巴拿赫-马祖尔距离很可能至少为 。
但回到主要观点,即上述命题的逻辑形式与维诺格拉多夫定理的逻辑形式非常相似,后者是
其中我写的是素数集合。然而,维诺格拉多夫的结果无疑是一个定理,而格鲁斯金的结果无疑是一个反例,或者至少是一个例子。
这两个说法之间有什么重要区别?在维诺格拉多夫的三素数定理中,数字在待证明各种量化变量的命题中起着更为关键的作用。在维诺格拉多夫定理中,该命题为 ,而对于格鲁斯金定理,待证的命题为
且,
我们可以等价地写成
以及。
以维诺格拉多夫定理为例,整个挑战是让这三个素数相加为 ,而对格鲁斯金来说,获得 和 的维数相等毫无挑战性:挑战是相对于它们的共同维数,使 和 彼此相距非常远。
这里还有一个复杂因素需要注意,那就是通过被称为斯科勒米化的过程,一个形式的普遍量化陈述可以转化为存在量化的陈述。(要使这成为等价,需要选择公理,但这无疑是一个充分条件。)这不仅仅是逻辑上的把戏,它往往准确反映了我们对某些问题的思考方式。
例如,将格拉斯金的例子看作构造(或至少证明)任意维度中合适范数空间对的配方,或者换句话说,通过在每个维度赋予赋值来构造一个合适的函数,比起将它看作每个正整数具有某种复杂性质的陈述,更为自然。
另一个复杂问题是,一些普遍量化的陈述自然地从存在量化的陈述中推导出来,甚至可能等价于它们。例如,二维环面不同胚于二维球面的定理是一个普遍量化的命题(从环面到球面的每一个映射都不是同胚),但自然的证明方法是证明存在存在不变量区分这两个空间。
举一个全称命题等价于存在命题的例子,考虑一个形式为向量不属于某个紧致集的凸包的陈述。没有元素的凸组合等价于存在线性泛函和,使得对每个 。
在这两种情况下,将结果视为通过存在性陈述被证明的定理似乎很自然,也许是因为最终吸引我们的是定理。但用“我们感兴趣的事”作为判断反例的标准显得有些模糊,如果我们想有说服力地解释为什么人工智能应该擅长寻找反例,这个标准很难用。
反对存在性陈述特别适合人工智能的观点的更普遍论点是,几乎所有数学研究都需要建立存在性陈述,无论标题结果的性质如何。例如,如果我想通过归纳法证明一个命题,我很可能会寻找一个更适合作为归纳假设的强化论。
或者如果我想证明每个类型为属性的对象也具有属性,那么我可能会寻找一个由 和 可以证明的性质。这些更多是元数学存在问题,但界限有时会模糊,更重要的是,在试图证明一个命题时,我们脑海中的主要问题往往不是“为什么是真的?”,而是“证明会是什么样子?”举个例子,我觉得我相当理解为什么哥德巴赫的猜想是真的——一个高度合理的素数概率模型蕴含了它,并且与计算数据高度一致——但如果我认真尝试证明它,许多数学家已经拥有一个世纪左右的理解,帮助有限。
相反,我的主要任务是寻找足够强大的证明技巧,使这些启发式思想变得严谨。
例子和反例有什么区别?
逻辑上,每个形式的命题都是全称量化命题的反例。然而,我们并不将所有存在主义陈述都描述为反例。例如,如果我说,“所有 的 -空间都是可分的,因为 是 ,但不是可分的”,我不会将该断言的第二部分描述为所有巴拿赫空间都是可分的反例。
相反,我会把它当作最基本的不可分割空间例子。重要的是,没有特别的理由认为所有巴拿赫空间都是可分的,找到一个不可分空间的例子并不难。
我认为第一点更为重要:如果某个对象的存在推翻了我们有充分理由相信的陈述,我们更倾向于称该对象为反例。数学家在多次尝试证明某一命题但未果后,往往会觉得它没有特别的理由为真,即使似乎很难找到反例。
在这种情况下,如果最终找到反例,可能会失去一些“反例”的感觉。我的印象是,非社会主义群体的构建也属于这一类。文献中曾提出过多种构建此类群体的建议,但我认为没有多少(甚至没有?)专家坚信所有群体都是社会主义的。
因此,说“OpenAI提出了第一个非非社会群体的例子”比说“OpenAI找到了共性猜想的反例”更自然(尽管他们论文中的那一部分标题是“共性猜想的反例”)。
同样,在我看来,多色拉姆齐数的新下界更像是一个例子,而非反例。我觉得很多人认为界限应该是指数级的,所以对他们来说这是个反例,但其他人,包括我自己,则对此持更中立的态度。
事实上,我以前(很久以前)用等价的表述处理过这个问题,该表述问的是,如果你想让顶点的并集成为完备图,需要多少个无三角形的图。
如果你取二分图,那么很容易看出你需要它们,但如果观察到一个完备五分图可以写成两个无三角形子图的并集,那么可以将完全图写成无三角形图的并集,从而进一步改进这个界限。
因此,人们很容易尝试做得更好,使用无三角形图,这些图密度较低,但用无界色数来弥补这一点——如果想使用亚对数图,这是必要条件,这等价于对数的超指数下界。
总之,当我处理这个问题时,我的努力都集中在最终被证明正确的方向上,所以对我来说,OpenAI找到了一个我(勉强)预期的例子,而不是反例。
这让我们处于什么境地?
我想找到一个连贯的解释,说明以下事实的结合。
- 大型语言模型证明的最显著数学结果往往是我们会归类为例或反例的,其中反例广义上是反证陈述,用来反驳我们预期为真的命题。
- 许多命题可以被表述为存在性命题,而我们通常认为它们是全称命题,反之亦然,因此我们认为的例子取决于命题的数学背景以及其逻辑形式。
- LLMs在证明普遍命题方面也相当不错:只是它们证明的最强命题,我们通常认为的定理,大多没有达到我们认为的反例最强命题水平。
基于这些事实,似乎LLM擅长的领域是其他方面,这恰好导致它们擅长我们通常归类为寻找非平凡例子的存在问题。
让我们来看两点我们可以确信大型语言模型擅长的事情。其中之一是懂很多数学:如果一个问题能通过相对标准的论证解决,那么大型语言模型很可能能够找到并使用该论证。
另一个是大型语言模型作为计算机本身具备的能力:它能以极高的速度工作(至少相较于人类),因此能够承受大量失败尝试,直到找到解决方案。
甚至不考虑大型语言模型实际解决了哪些问题,人们可能会猜测这两者导致它们的风格与人类数学家有所不同。大致来说,当证明过程更具概率性时,LLMs会占优势:它们擅长解决那些最佳方法是尝试大量想法的问题,这些想法不一定特别新颖,直到你运气好。
而人类则(目前)更擅长寻找更多“令人惊讶”和“概念性”的论证,合适的方法是不断深入挖掘问题,直到解决方案显现。(很难准确说这是什么意思,但我希望任何有经验的研究者都能理解我的意思。)
这引出了两个问题:上述猜测是否与我们观察到的现实相符?是否有理由认为我暂时称为“LLM风格”的数学研究会自然导致LLM发现多个反例(或仅仅是例子),以反驳长期存在的猜想,尽管这绝不是它们能做的全部?
我不敢自称对这两个问题有科学答案,但专家们对ChatGPT发现的几个惊人解决方案的反应,确实支持了大型语言模型的工作方式是“尝试很多,直到运气好”的观点。
人们常常会说:“起初我很惊讶问题被解决了,但仔细观察后发现,这种方法其实并不新颖,只要有合适的线索,一个专业的人类也能轻易找到。”
至于第二个问题——LLM风格是否适合寻找(反)例——我认为情况不那么明确,因为寻找反例的方法有很多种,其中一些比我描述的风格更合适。
以下是一些通用方法。(我并不认为这份清单是详尽的。)
- 找现成的例子.这里有一系列相当标准的例子,只需一个接一个地尝试,看看是否有一个不满足该命题。例如,Ryan O'Donnell 在他关于布尔函数分析的精彩著作结尾,提出了一些建议,其中之一是:“如果你有一个关于布尔函数的猜想,可以用独裁者、多数、宇称、部落(也许还有递归多数 3)来测试。如果这些功能是真的,那大概率也是真的。”
- 从基础示例和标准构造方法中构建一个示例。例如,对于代数问题,可以先用一些标准例子,然后取乘积、商或极限。
- 大量使用元变量。“元变量”一词源自计算机科学,特别是自动定理证明,指的是数学中对应写作“其中 是后期选择”(此时 是元变量)。在论文中,我们通常只在相对简单的情况下这样做,比如需要选择一个足够小的数字以便后续论证成立。但当我们寻找满足某个性质的对象(这很可能是更简单性质的合取)的例子时,通常不完全指定,然后再检查是否满足。相反,做几乎相反的事可能更有成效:我们从几乎什么都不说开始,然后直接开始证明它满足。在此过程中,我们发现需要满足一个性质 。如果幸运的话,我们可以以一种非常一般的方式描述满足 的对象类别。例如,我们可能找到一个参数化类:我们识别某个函数,并证明对每个特定类型的函数都满足。问题随后被简化为找到 $Q(f(y))$ 成立,这是原始问题的更具体版本。在最终找到一个例子之前,这个过程可能会有多次迭代,或者是该过程与其他过程的混合。
- 试着证明相反的观点。如果想找到 ,开始尝试证明命题 会出乎意料地有帮助。这之所以有用,是因为使用我们标准的证明方法,可能最终找到一个关键引理,使得它足够:即我们可能找到一个中间性质,以非平凡的方式蕴含,从而将问题归约为 。反过来,可能找到一个反例比寻找一个满足的反例(即满足的例子)更容易。当然,不能保证反例一定是 的例子,但有时我们很幸运,确实如此。更常见的是,我们可以使用前述方法的思想,注意它至少是某个实例的必要条件,因此不应是 的例子,因此可以尝试描述一类通用的失败对象,从而简化问题。
- 连续近似。有时,当我们寻找使得的例子时,我们写下一个中等合理的猜测,并非因为我们认为它有可能成功(如果成功,我们会采用第一种策略),而是因为我们希望如果不满足,那么我们能够诊断出问题所在,并指定一个没有该缺陷的新猜测。同样,这种策略可以反复迭代,也可以与其他策略组合使用。
- 就是做样。有时我们需要满足无限多个性质,而每个性质单独来看都相当容易满足。在这种情况下,我们通常会一点点地“归纳”,确保过程的最后阶段无论构建过程如何继续,都能满足。
- 随便举个例子。通常很难给出一个明确的例子来满足 ,但存在一个自然概率分布,可以证明如果从该分布中随机选择,那么以高概率(或至少非零概率)满足 。
- 举一个通用的例子。在更无限的情境下,可能很难给出满足 的明确例子,但可能证明该失败的集合是零测度,或者是稀薄集,或者以其他方式很小。
没有特别理由认为LLM在上述每种方法上都同样出色。所以我们观察到的,也许并不是大型语言模型有特别的能力去寻找实例,而是它们在某种特定方式中特别擅长寻找实例(和证明)。
结合上述技术,人们可能会认为它们非常适合用概率方法勾选现成的例子,找到即做证明(因为这是一种相当标准且训练数据中有大量实例的方法),使用概率方法(除非像常见的情况一样,需要重大新想法来证明概率成立), 以及选择通用的例子。
上述另外三种方法——使用元变量、尝试证明相反方向以及使用连续近似——需要更多能力判断所采取的方法是否可能有效。在这里,人类有时可能拥有优势,但问题需要满足的条件非常严格。
需要一个例子,是位于非常大搜索树叶节点上的例子——这个树太大,无法用中等数学能力和蛮力组合搜索——但如果数学家对进展有敏锐的嗅觉,可以大幅修剪搜索树,从而找到它。
为什么大型语言模型没有那种“鼻子”呢?我不排除“鼻子”是大型语言模型训练方式中自然而然出现的特性,一两年内它们也会达到和我们一样的程度。
但目前,在我与ChatGPT的互动中,我确实有一种明显的感觉,他们还没有达到那个水平。当我讨论一个5.6 Pro的未解决问题时,常常会遇到一些听起来很有前景的方法,但仔细一想,结果却觉得前景不那么理想。
他们通常还会在回答结束时说:“我还没能回答你提出的问题,但我已经把它简化成了下面一个更狭窄、更精确的问题。”这听起来很有希望,但实际上已经发生了五次,却没有明显进展。
他们如何提升这一点并不完全明显,因为他们的训练数据中不会充满解决问题时可追求的有益或不那么成功的方向示例:他们通常看到的只是被整理过的证明,掩盖了发现者的思维过程。
当然,人类数学家也很难从其他数学家的经验中学到太多研究方法,但我们却总能学会。但情况对我们来说有些不同,因为我们学到的很多东西都是通过正在做而不是模拟.
另一个不明显“鼻子”属性在大规模语言模型被放大时自然出现的原因在于,如果大型语言模型大量利用其广泛知识,并且能够比人类进行更多的暴力搜索,那么它们将缺乏人类无情修剪搜索树的动力。
有可能,他们迄今为止的成功是用了对人类来说极其低效的方法,但由于它们速度和知识的优越,这些方法将带来的组合爆炸尚未显现。
尝试用实验方法验证这一点会非常有趣,但也很困难,因为如果一个大型语言模型的观点看起来只能是对某个问题的“深度思考”的结果,我们永远无法确定它是否真的完成了这种深度思考,而不是在文献中找到一个模型论证。 换句话说,就是利用一位人类数学家的深厚思想。用比最新模型更弱、在一定程度上被数学文献遮蔽的模型来测试,可能会更容易(但仍然不容易):可以给它们一组精心设计的问题,看看LLM解决的问题是否具有特定特征。
看起来我似乎拼命抱着人类还能为数学发现做出有意义贡献的希望,但虽然我确实希望如此,我并不是在断言“大型语言模型永远做不到X”。
我认为很可能会,鉴于过去三年的进展速度,这很可能很快会发生。但我确实认为大型语言模型可能存在一个障碍,而且至少看起来可能不会像之前的一些障碍那样简单地通过。
在这方面,观察不同的奖励结构是否能使大型语言模型能够解决不同类型的问题也会很有趣。例如,如果在训练过程中,一个大型语言模型(或某种机器学习系统)不仅因为最终得到解决方案而获得奖励,还会因为探索过多死胡同或通过从文献中“作弊”而受到惩罚,那么它或许会被激励以更人性化的方式进行研究过程,从而在尚未出现的问题类别中取得更好的结果产生重大影响。
如果障碍被清除,无论是通过纯粹的扩展还是更深思熟虑的方法,那么很难知道具体时间,因为正如前面提到的,一个看似非常原创且令人惊讶的想法可能潜伏在大型语言模型的训练数据中。但如果有大型语言模型能提出一个证明,让我和2016年封写集问题的解决方案一样令人惊讶:之前已知的最佳界限完全被掩盖,方法与我之前想尝试的任何方法完全不同,我会有信心它已经被清除了。 之后,人们开始了解这项奇妙新技术的潜力,活动热烈起来。
结论
写这篇文章时我还不太确定自己会走向何方,现在读到结尾,我觉得我的主要结论并不特别新颖或令人惊讶,但我希望得出这些结论的路径对你有些兴趣。
我提出的主要观点如下。
- “找到一个例子”实际上并不等同于证明一个以存在量词开头的命题。
- 如果当前模型特别擅长寻找实例,那很可能不是因为它们对存在性陈述有特别的亲和力,而是因为适合寻找某些类型实例的证明-发现方法发挥了LLM显而易见的优势:广泛的知识和探索人类认为成功概率较低的搜索树路径的能力。
- 看起来大型语言模型会持续快速提升。然而,如果与预期相反(至少是我自己)发现存在某种残留问题(或其他数学活动)在一段时间内仍占优势,那么这些问题很可能正是人类修剪证明-发现搜索树神秘能力对其特别有利的问题: 也就是说,搜索树深度较大且分支较多的问题,如果没有严格的修剪,即使是计算机也无法进行搜索。
- 如果大型语言模型开始用那些像许多最优秀的人类数学一样新颖且令人惊讶的方法来证明定理,那将是一个好迹象。它们也应该是难以偶然发现的方法。很难准确说什么才算是这样的证明,但我认为我们看到它时会认出来。