学术是为了野心 —— Alex Zhang,MIT

常规票的最后召集纽约人工智能工程师!作为《潜在空间》订阅者的独家,前30位可以买了七折优惠码如果有帮助的话——只限新票,不退款!

两周后见!


虽然我们播客通常报道工业界,但偶尔也会庆祝一位明显崭露头角的超级明星博士。在2024我们报道了姚顺宇他后来在OpenAI开发了Operator,现在是腾讯首席人工智能科学家.在2025我们报道了杰克·莫里斯他后来共同创办了恩格拉姆在6亿美元并且现在是持续学习.

今年我们自豪地介绍张亚历麻省理工学院。

来自GPU内核和KernelBench到递归语言模型,管理不善的天才,以及庞大的多特工蜂群,张亚历正在探索通过将越来越强大的模型包裹在原始系统中,我们会留下多少能力。

RLMs在今年年初接管了时间线:

基于RLM的线束是首个~解决ARC-AGI-3的线束OpenAI的Astra:

并且直到今天,它仍然影响着新的研究,更极端相较于RLM的含义:

我们深入探讨了GPU模式和AI编写的内核、研究品味以及为什么学者应该赌一把,而行业实验室不会赌注,GEV和标准自回归语言模型的替代方案,以及作为组合泛化工具的框架的理念。

Alex解释了RLM、上下文卸载、程序化子代理调用、Prime Agent、持久子代理,以及为什么未来的“语言模型”实际上可能是一个隐藏在简单界面下的无形代理群。

我们还讨论了OpenAI的大规模代理实验、Kimi群体、Sakana AI的开放式研究、推测性程序化工具调用、能力过剩、Neuralese,以及Alex认为下一个重大研究机会可能在哪里。


我们讨论:

  • 为什么AI生成的GPU内核仍然留有大量空间给人类专家
  • 一位专家的见解如何可能取代大量暴力破解令牌搜索
  • 为什么博士生应该选择研究投注这些看起来很琐碎、奇怪或毫无意义
  • 什么SWE-bench、RLM、ReAct和Quiet-STaR关于研究品味的揭示
  • GEV及其原因语言模型不一定意味着自回归文本对文本解码器
  • 为什么Claude Code、Codex 和 Pi结构上比看起来更相似
  • 怎么会这样安全带设计可以提升跨任务和领域的组合推广
  • RLM:上下文卸载、代码执行、递归子代理和共享内存
  • Prime Agent,持续背带,以及持续代理间通信
  • 为什么你未来查询的模型可能暗中是整个群体或支架
  • OpenAI 的1万代理实验,130亿输出代币,以及~4000万美元等效物解决问题
  • 为什么特工群体可能存在浪费搜索——以及为什么融合依然困难
  • Kimi 与 OpenAI 的抗争以及多智能体系统的不同方法
  • 开放性,Sakana AI在大量生成作品中发现隐藏的宝石
  • 为什么当前的前沿模型可能已经拥有很大的能力溢出
  • 推测程序化工具调用以及与生成工具的重叠执行
  • 无论是英语、代码,还是全新的“神经性”限制模型推理的方式
  • 科学中的人工智能快速变化的基准测试,以及Alex如何选择押注哪些研究问题

张亚历

  • 网站:alexzhang13.github.io
  • X:@a1zhang

时间戳

00:00:00简介

00:00:49GPU 模式、KernelBench 和 AI 编写的内核

00:07:38人类专业知识与暴力 AI 搜索

00:13:20调研品味和大注

00:19:28GEV与重新思考语言模型

00:29:03电子游戏特工与安全带问题

00:31:01为什么Claude Code、Codex和Pi如此相似

00:36:42线束作为合成泛化器

00:44:24RLM解析

00:52:01主代理与持久子代理

00:57:41野外的RLMs

01:00:30OpenAI群体与语言模型的未来

01:07:26开放性与萨卡纳人工智能

01:15:52Kimi 与 OpenAI 代理蜂群

01:20:06能力过剩与推测工具调用

01:28:19神经性、未来研究与科学人工智能

文字记录

介绍:张亚历、RLMs与GPU模式

斯威克斯 [00:00:00]:好了,我们现在和张亚历克斯一起在演播室,我猜他最著名的是RLMs,但你还有其他一些关系。欢迎来到节目。

张亚历克斯 [00:00:12]:是的。谢谢你们邀请我。

斯威克斯 [00:00:13]:是的。我猜GPU模式也要用?

张亚历克斯 [00:00:15]:是的,GPU 模式也是。

斯威克斯 [00:00:16]:你是被马克·萨鲁菲姆引导进来的。不是每个人都能得到那样的欢迎。

张亚历克斯 [00:00:19]:是的。是的。是的。我和所有在GPU模式下的人都很亲近,所以是的

斯威克斯 [00:00:23]:是的

张亚历克斯 [00:00:23]:我们经常以各种方式合作,甚至不仅仅是GPU模式本身。

斯威克斯 [00:00:29]:是的。我们能解释一下,让不太熟的人不知道这个吗?这只是个Discord。它以前主要关注CUDA模式,后来有点泛化了。

是马克发起的。

张亚历克斯 [00:00:41]:没错。

斯威克斯 [00:00:42]:基本上就是这样。对我来说,这就像PyTorch团队的招聘流程。

斯威克斯 [00:00:45]:然后你离开了PyTorch。

张亚历克斯 [00:00:47]:没错。

张亚历克斯 [00:00:49]:是的。所以这其实是从我大学时期开始的,大概是2023年。我记得是Mark、Andreas和Jeremy Howard一起创立的。

最初的设定就是,它是一个GPU——或者说是一个专门学习如何编写GPU内核的Discord,他们会有讲座。基本上就是这样。我之所以对它感兴趣,是因为我在写GPU内核。

这其实完全是偶然的。那时我在Snapchat实习,然后

从 CUDA 模式到 GPU 模式

斯威克斯 [00:01:22]:雷克西斯。

张亚历克斯 [00:01:23]:是的,我对Rexis非常无聊。他们有个项目,对写作感兴趣。那是一篇叫《无限注意力》的论文。就像谷歌的论文。

斯威克斯 [00:01:35]:是的,我们在《纸俱乐部》里报道过。

张亚历克斯 [00:01:36]:是的,是的。所以我很想知道Snapchat上是否能为它写专门的内核。结果没有。其实没什么结果,但我加入了GPU Mode。

当时叫CUDA Mode,我记得是法律原因,他们改了名字。但我遇到了Mark,见了Matei,还遇到了很多社区里非常活跃的人。然后Mark提出了一个叫Popcorn的想法,现在你看到的排行榜就是这个。

但总体想法是,我想我们都有一种直觉,觉得GPU编程和做过竞技编程的人很相似。这是一种,不是。我不是说它们是可迁移的技能。

Popcorn、KernelBench 与 GPU 内核自动化

斯威克斯 [00:02:17]:你有限制。你会编程一些高尔夫。

张亚历克斯 [00:02:19]:没错。

斯威克斯 [00:02:19]:是的。

张亚历克斯 [00:02:19]:是的。而且,实际上,人们做的优化领域其实非常有限。而且实际上,人们真正感兴趣的内核其实并不多。所以我们有个想法,如果你有足够的数据,就像Codeforces那样,问题会有数百万个。

如果你能用GPU代码做到这一点,你就能扩展和自动化GPU内核开发,这对研究人员来说是一件大事。因为我认为这是一个很大的瓶颈。比如说,比如Mamba,他们发布带有内核的论文,否则你就无法真正有意义地使用它。

而且并不是每个人团队里都有Tri Dao。所以我们对此非常感兴趣。KernelBench 也从那里衍生出来,比如我们能不能让大型语言模型自动化 GPU 内核代码?

我觉得那就像是个......那段时间非常有趣。就像大学和博士之间,是的,我用 GPU 模式做事情时非常愉快。现在我有时候只是帮忙讲课。

我参与度没那么高了,我觉得总体来说,我们的竞赛也没以前那么多了。不过,是的,我仍然和那里的每个人保持很多联系。

斯威克斯 [00:03:27]:有友好的竞争关系吗?因为我觉得之前的社区有类似MLSys、MLPerf这样的

张亚历克斯 [00:03:32]:是的

斯威克斯 [00:03:32]:差不多是这样。有友好的竞争关系吗?这只是新一代MLPerf,还是说发生了什么?

张亚历克斯 [00:03:38]:GPU 模式的好处是它也是一个社区,很多讲座对初学者来说都很简单,可以跟上并提问。而且,比赛有点不是次要的,但你可以参与学习。

我觉得很多MLSys、MLPerf的基准测试,大多数情况下,只有严肃的实验室和公司才会参与。至少是认真参与的。这是我对它的理解。我可能错了。

但我觉得除了GPU模式之外,现在有一件非常令人兴奋的事情是,有更多网站和参与竞赛的主持工作。我觉得有这样一个。

张亚历克斯 [00:04:21]:我记得有个网站叫LeetGPU之类的,里面有专门针对GPU问题的LEET代码。

斯威克斯 [00:04:26]:哇。

张亚历克斯 [00:04:26]:还有其他我也做过。我们见过。有很多人是在GPU模式下诞生并交流的,这非常令人兴奋,因为我觉得GPU编程曾经非常小众,就像我感兴趣的时候一样。

我之所以对它感兴趣,是因为Tri Dao在普林斯顿做了一次演讲,因为他当时正在申请教职。他现在是那里的教员,但我在2023年左右听他在FlashAttention上的演讲,我当时想,“哇,这真是太酷了。”

张亚历克斯 [00:04:56]:我当时想,“这就是。这才是大家都应该做的事情。”我想,比如vLLM之类的东西也出现了,大家都说,“哦,我们应该写内核。”但现在,大家都在写内核。

就像,每个人都写。这,这。我觉得从某种意义上说,这个领域几乎已经趋于饱和了。

AI编写的内核与验证差距

Vibhu [00:05:11]:有什么有趣的观点给想深入了解的人吗?我认为最大的新闻之一是GPT-5.6编写了更高效的内核,所以Terra和Luna可能会便宜80%。

张亚历克斯 [00:05:24]:是的。

Vibhu [00:05:25]:然后我们也看到其他比赛,有人在创造纪录,他们说,“我们在做汽车研究循环”,而这些人根本没有背景

张亚历克斯 [00:05:34]:是的

Vibhu [00:05:34]:在任何内核写作中,对吧?

张亚历克斯 [00:05:36]:是的。即使在GPU模式排行榜上,如果你看最近的很多问题,几乎所有的解决方案都是AI生成的。不过,你会注意到排行榜上的情况。

有个叫Gauners的人,他是GPU模式的常客。我们早就知道他是个超级厉害的GPU内核编写者。我们在排行榜上发现的一件事是,几乎——他也用AI来帮助他解决这些方案,但大多数情况下,他只是帮忙提示和推动这些解决方案朝某些方向发展。

我们发现,他的内核基本上是前十中唯一一个在真正的端到端系统中真正稳定的。端到端系统。这确实让人质疑,其实并不是。比如,GPU内核存在验证问题。

我们其实早就知道这个问题了。自从KernelBench发布以来,这个问题就存在了。比如,有很多奖励黑客行为正在进行。但你——是的,你也会注意到,代码行数要小得多,但是

Vibhu [00:06:33]:是的,我正想问,这会被注意到吗,还是只是这样

张亚历克斯 [00:06:36]:是的,不是,是的,是

维布 [00:06:36]:好的

张亚历克斯 [00:06:36]:这绝对非常重要,我觉得很有趣的是,在写GPU内核方面还有很多Alpha阶段。

Vibhu [00:06:44]:好吧,所以验证之间有个空白

张亚历克斯 [00:06:45]:确实有。我觉得,就是这样。这也适用于很多人工智能系统。我觉得,即使是最新的数学证明,也不一定意味着数学家已经过时。

这些公司仍然雇佣数学家,做数据标记工作,甚至只是引导模型解决问题。在这些方面,知识仍然存在很大的“alpha”阶段,所以。

斯威克斯 [00:07:12]:这只是知识,还是更多的规划,以及一种更适合的自发规划方式?

张亚历克斯 [00:07:22]:我觉得是,是多种因素的混合。也许这就是你说的,就像直觉一样

斯威克斯 [00:07:27]:差不多是这样

张亚历克斯 [00:07:28]:如何解决问题。

斯威克斯 [00:07:29]:比如说,我总是在画我的代码图。

张亚历克斯 [00:07:31]:是的。

斯威克斯 [00:07:31]:右?

张亚历克斯 [00:07:31]:是的。

斯威克斯 [00:07:31]:然后,如果图表里有我不理解的部分,我会一直研究直到理解为止。否则,我不允许。

张亚历克斯 [00:07:37]:是的。

斯威克斯 [00:07:38]:是的。

张亚历克斯 [00:07:38]:所以我认为,这其实是这些人和工作者之间的混合。比如那些懂得如何看待这些问题、如何解决它们的人,也知道如何利用人工智能来解决这些问题。

因为你扮演了一个非常强大的验证者。比如,如果你知道该做什么,你自己也一样。我觉得我们通过这些代理群之类的现象发现,当你投入足够的计算资源去解决一个问题时,你就能充分探索出该问题的解决方案。

但很多时候,比如说,你可能在某个问题上消耗了1000亿甚至1万亿个代币,但如果你请来一个对问题了解的人,他们就能发现一些可以消除那1万亿代币花费的模型。

目前还不太清楚具体的趋势是什么。但我认为,现在还有很多问题需要解决,我们不能总是投入尽可能多的计算资源。这些事情中仍然有一个效率方面非常重要。

光速极限、内存与巨核

斯威克斯 [00:08:41]:有没有理论上正确的答案,可以基于物理计算,然后接近物理极限?

张亚历克斯 [00:08:49]:是的。对于GPU核来说,你可以计算。实际上,有时候计算起来并不容易,取决于问题的复杂程度。比如矩阵乘法,计算出最快核的估计值非常容易。

而且,这还假设你所有的数据都从CPU开始,或者从DRAM、GPU开始,等等。这会稍微改变这些数字,但

斯威克斯 [00:09:18]:转会和这些事情,是的。

张亚历克斯 [00:09:20]:是的。但我得说,很多情况下,理论上是否真的能达到这个数字,不知道你能理解吗?假设数据完美重叠和传输,可能存在瓶颈无法绕过。

但很多时候,核数根本不接近。我们写的那些数字远远不够接近,根本没有意义。

斯威克斯 [00:09:43]:是的。速度重要吗?你也关心记忆吗,显然,记忆力

张亚历克斯 [00:09:48]:嗯

斯威克斯 [00:09:48]:进速?你在乎功耗吗?我们今年最顶尖的播客之一是Geoff Dean,他说,“其实,我只是追踪了微焦耳,或者说纳焦耳、皮焦耳。”

张亚历克斯 [00:09:59]:是的,今天经常是皮焦耳。

斯威克斯 [00:10:01]:皮可焦耳。

张亚历克斯 [00:10:01]:是的。

斯威克斯 [00:10:01]:你在乎这个吗?

张亚历克斯 [00:10:03]:所以我不做。

张历克斯 [00:10:04]:是的。我想也许我不是,我不是那么

斯威克斯 [00:10:06]:但这里的一切都是速度,对吧?比如

张亚历克斯 [00:10:07]:这里的一切都是速度

斯威克斯 [00:10:08]:没人在数皮焦耳。

张亚历克斯 [00:10:09]:但我——这里有个警告,我认为,在单个核的背景下速度是有的,在更大的问题中也有速度,比如N10模型。因为,有一点需要考虑,这也是为什么讨论光速指的是什么很重要,因为在这些核中,我们总是从所有东西开始,比如HBM等等,对吧?

但你可以想象,在端到端的模型中,你可能想在两个层之间做的是,牺牲第一个操作的速度,以保持缓存中,以便第二个操作。这些东西,单独用这些核是无法完全实现的。

人们称之为聚变,或者说

斯威克斯 [00:11:01]:巨核

张亚历克斯 [00:11:02]:内核融合问题。是的,或者说,巨核相关的东西。而且通常只在内存受限的情况下才适用。但这也是一个问题,比如,随着模型的改进,我们是不是应该直接生成巨核?

这真的是我们想要的吗?

Vibhu [00:11:20]:你怎么看?

张亚历克斯 [00:11:21]:我觉得这真的很难,因为你需要数据来完成这件事。而且我还没见过有例子能在没有任何示例的情况下,自动启动解决一类非常难的问题。

我觉得另一个原因可能是,在单个内核层面,A,它们不那么复杂,但B,你有一定信心单个内核里没有那么多结构。但在巨内核中,我更倾向于认为编译器会更好。

比如某个更高级的编译器操作是合理的,因为总体来说,我认为超级内核的各个部分非常可组合。有些领域你可能需要做一些奇怪的融合,但总体来说,我认为这些情况大概是编译器能处理的。

据我了解,有一家公司也在做这方面的演讲,他们也做过关于GPU模式的演讲。

斯威克斯 [00:12:28]:是的,我想把所有关于GPU模式的讨论都归为一类,因为显然还有其他部分

张亚历克斯 [00:12:32]:右。

斯威克斯 [00:12:32]:我们需要继续前进。

Vibhu [00:12:33]:我觉得这里有值得推广的地方。你们确实主持了很多很棒的讲座。它们都在YouTube上。大家可以关注。还有你

张亚历克斯 [00:12:39]:是的

Vibhu [00:12:39]:你主导了不少内容。你依然很投入。

张亚历克斯 [00:12:41]:我以前会。有时候我现在还会。我觉得他们大多是马克。马克通常是那个做这些的。马泰有时也会做,但,是的,我强烈推荐他们。

他们是非常好的资源。我觉得人们分享得这么多,挺疯狂的,所以是的。

斯威克斯 [00:12:59]:因为你在那里,你非常,你就是那个合适的观众?

张亚历克斯 [00:13:03]:是的,完全正确。

斯威克斯 [00:13:03]:好像这不会进入主流。

张亚历克斯 [00:13:04]:我们还放了很多介绍性的内容,我觉得对大家很有帮助。

基准、普林斯顿与研究品味

斯威克斯 [00:13:10]:KernelBench 有点影响力。我只是想看看,那是去年的事了。

张亚历克斯 [00:13:13]:没错。

斯威克斯 [00:13:14]:你还有什么正在进行的工作想大声提醒大家关注?因为显然你参与其中

张亚历克斯 [00:13:20]:是的

斯威克斯 [00:13:20]:场地。

张亚历克斯 [00:13:20]:是的。我可以先讲讲背景,比如我实际上参与了很多基准测试,或者说我曾经参与过,可能是在我读博士之前。

这一切始于我在普林斯顿。我在那里和软件工程师实验室团队一起工作。

斯威克斯 [00:13:33]:约翰,卡洛斯

张亚历克斯 [00:13:33]:约翰,卡洛斯

斯威克斯 [00:13:34]:奥菲尔

张亚历克斯 [00:13:34]:还有奥菲尔。他们都很棒。比如

斯威克斯 [00:13:36]:卡尔蒂克

张亚历克斯 [00:13:36]:我喜欢他们。是的。

斯威克斯 [00:13:37]:基本上就是这样,我觉得大家不理解有多少基准来自同一个群体

张亚历克斯 [00:13:42]:是的

斯威克斯 [00:13:42]:在普林斯顿。

张亚历克斯 [00:13:44]:这真是疯狂。

斯威克斯 [00:13:45]:都勋宇?

张亚历克斯 [00:13:45]:是的。是的。

斯威克斯 [00:13:46]:我们之前把他关在一个舱里。现在他就像在掌控腾讯。

张亚历克斯 [00:13:48]:是的,现在他就像超级明星一样。我认识他的时候,他是在指导我朋友Michael Tang,现在在Anthropic,但他们经常一起工作。

我们就像Karthik实验室里的两个本科生。我——后来还有一些人加入了。但确实,Xun Yu很棒。我直到后来才知道他是个超级明星,大概是在我离开之后,但

斯威克斯 [00:14:12]:是的。好吧,博士生很少。比如你的博士生就快到了。我们每年都会邀请一个几乎完成博士学位、表现很精准的人。

斯威克斯 [00:14:25]:他们不多。寻宇显然就是其中之一。杰克·莫里斯也是其中之一。我们在节目开始前谈过研究品味。

斯威克斯 [00:14:33]:右?有些研究生的职业非常幸运,大多数时候就是,嗯,这会一直存在,相关,大家都应该知道。

张亚历克斯 [00:14:42]:是的。

斯威克斯 [00:14:42]:还有一些,什么都没有。

张亚历克斯 [00:14:44]:我觉得这对行业实验室里的人也是如此。我觉得研究生的曝光度更高。所以你会看到,有些人

斯威克斯 [00:14:56]:是的,你可以发表

张亚历克斯 [00:14:57]:他们真的是靠运气和非常聪明的结合。我觉得研究品味也是通过机会发展出来的,至少就我而言是这样。我很幸运能走上我走的路,比如在普林斯顿工作,后来又遇到了像麻省理工学院的Omar那样的人。

他是个非常棒的导师。不过我想说的是,研究生或者学术界最成功的研究,往往是人们关心那些可能像业界大多数人都不关注的问题。我认为问题在于,很多研究生做的事情对行业实验室有利。

比如说,他们会做一些现在非常流行的基准测试。我觉得2023年的基准测试和现在的基准完全不同。有很多人专门研究线束、元线束以及针对XYZ任务的特定线束。

仔细想想,有人会做这个项目的原因是,也许围绕我们今天的模型有一个明确的目标,比如,这就是我想看到的。但我会举一个例子,比如递归语言模型论文,因为我觉得这是一个非常简单的想法。

我觉得当它发布时,很多人看到这样的东西时会想,“这到底有什么意义?”

斯威克斯 [00:16:27]:或者太酷了。

张亚历克斯 [00:16:28]:是的。为什么,什么?这只是副代理人什么的,对吧?

张亚历克斯 [00:16:32]:我觉得当你得到这样的反应时,几乎是个好迹象,因为很明显人们并没有真正思考这件事的目的。我再举一个类似SWE-bench的例子。

当SWE-bench发布时,Ofir很喜欢讲这个故事。当它发布时,几乎没人关心。大家都说,“这是个不可能完成的任务。我们为什么要把它当作一个标杆?”直到Devin出柜,大家才说,“哇,这确实是我们想要爬山攀登的东西。”我觉得这很有道理。

你会看到很多想法。我觉得。我最喜欢的例子大概是Eric Seligman的作品,比如STaR和Quiet-STaR。我觉得当你读论文时,至少我刚读的时候,我会想,“这难道不是个显而易见的想法吗?”或者说,也许不是。

我不知道。我当时想,“哦,这看起来很简单。”或者像思路链,结果也是一样的。或者像Xun Yu的反应。就像,好吧,是的,当然。但当你真正思考时,就是为什么。

论文的价值是什么?我觉得它讲述了一个故事,比如你希望这个领域是什么样子。这在学术界很难做到,因为如果你看看这些论文,比如Quiet-STaR、ReAct、RLMs、SWE-bench,这些论文都不是。

这不像GPT-6 Astro发布的版本?并不是每个人都说,“天哪,我现在要用这个,这是世界上最棒的东西。”学术界现在根本负担不起这样做。

我认为有很多理由说明这种情况应该改变,但我觉得......如果你没有。作为博士生,我觉得你处于一个非常独特的位置,基本上你可以做任何你想做的事情。

如果你不利用这些机会,去做一些没人关心或者大家觉得很琐碎的事情,比如“我考虑过这个,但没用”,我觉得最终研究永远不会那么有趣,因为如果你想在学术界,你得赌大钱。

否则,我觉得去工业实验室吧。他们资源丰富,人才丰富。为什么要局限自己在资源不多、人也不多的领域?我觉得就是这样。这真的就是大赌注。

你只能赌大注,很多都会失败?就是这样。这很自然。但我觉得

张亚历克斯 [00:18:55]:也就是说,作为博士生,这也是你相较于其他实验室任何一个人最大的优势,因为你不用面对繁琐的官僚主义和其他各种问题。

斯威克斯 [00:19:07]:说得有道理。

张亚历克斯 [00:19:07]:是的。

斯威克斯 [00:19:08]:我问很多人这个问题,通常他们都会敷衍地带过。所以我觉得。我很欣赏你能给出一个深思熟虑的回应,比如说,不,这其实是你的不公平优势,因为其他一切都对你有偏见。

Jev与打破自回归解码范式

张亚历克斯 [00:19:20]:是的,没错。所以,说实话。我会拿Jev举个例子,因为这不是学术

斯威克斯 [00:19:26]:哇,好吧。

张亚历克斯 [00:19:27]:这不是一个学术项目。

斯威克斯 [00:19:28]:是的。

张亚历克斯 [00:19:28]:我想提一下,因为这种情况在RLMs上也发生过,很多其他作品也都会发生。事情会被过度炒作,对吧?在某种程度上,有些东西被过度炒作了,然后人们会问,“为什么这会被过度炒作?”就像,“这很琐碎。这很愚蠢。”我在Jev身上也看到了同样的情况,因为我觉得发布时的感觉是这样。

有一种关于学术界的说法,或者说他们不是学术团体,但人们必须做品牌塑造,也必须推广他们的研究。所以,我理解,但我觉得有很多关于Jev只是我们多年来一直知道的东西的讨论。

我觉得这有点忽略了重点,为什么这样一个系统会这么有趣?而是为什么它不只是我们之前在入门机器学习课上用过的某个愚蠢的NLP分类器?

我觉得Jev真正有趣的是,它提出了一个问题:语言模型是否正确?比如,在它们目前的形式下,我们能考虑一个除了文本对文本之外的其他设计空间吗?

因为他们基本上是在说,“我会利用这个语言模型骨干。我知道它捕捉了很多关于语言的信息,但我会改变模型的输出空间,给你一个权衡,也就是我会对它进行非常快速的推理。”比如,如果你对这个问题有些先验,比如说我只需要做一个二元分类。

我会让我的语言模型去做这件事,然后支付大约400倍的成本吗?不会。这——这有点傻,对吧?我认为很长一段时间,因为实验室是唯一控制的地方,你永远不会用除了GPT-4、GPT-6或Fable之外的东西,因为它们是最强的模型。

但正因为如此,人们已经习惯了语言模型只是自回归解码器的观念。我们已经接受了这个观点。我觉得当RLM出现时,情况也是一样的。比如,有一条评论,我经常收到的批评是,“这不是语言模型。”或者说,“当我看到这个时,我以为这是一个新的架构,但实际上不是。”我对此的回应是,“语言模型只是对语言进行建模。它不一定非得是变换器解码器,”?

Jev非常有趣,因为我们现在有了新的

张亚历克斯 [00:21:49]:需要调整的问题,比如输出空间是什么,这如何影响推理延迟?我认为我们实际上可以开始探讨语言模型的各个部分。

我们也在环变换器上看到类似的情况。这和很多关注点类似,大家都觉得,“这是个傻的想法。”比如,“为什么?谁在乎这个?”但这确实是一个简单的想法,实际上是。

这引发了一系列全新的问题,尤其是如果你是博士生,这些问题你想要回答。因为我觉得我们根本不知道。比如说,对于Jev来说,我们不知道能把它推到多远。

对于环路变压器,我们也不知道能做到多远。如果你只循环模型的一部分呢?如果你只把路由到模型的不同部分,比如你有路由器连接到模型的不同部分?

比如,你能在模型内部模拟线束里的操作吗?你能在线束选择和模型架构选择之间架起什么桥梁?这些都是我认为通过这样的作品引发的问题,这真的很令人兴奋。

尤其是Jev,当我看到它时,我心想,“这对RLMs来说其实非常有用。”我觉得,这很合理。这很合理,因为RLM、群体或类似系统中最大的瓶颈是它们运行缓慢。

当你一直做多语言模型调用时,你没有正确分配计算,比如说,也许有些简单的事情你只想用一个简单的模型来做,但你做不到,因为你的语言模型太庞大了?

所以我非常兴奋。我认为我们会开始看到新类型的模型出现,超越了普通的前沿模型,这就像......你可以用这些新的权衡做很多事情。

斯威克斯 [00:23:34]:我还要特别推荐Thinky的互动模型。

张亚历克斯 [00:23:36]:是的。是的。又是一个很好的例子。

斯威克斯 [00:23:38]:是的。基本上就是尝试从一个序列到另一个序列打破范式,只用解码器,其他任何东西都做。

张历克斯 [00:23:46]:是的。

Vibhu [00:23:46]:我认为,如果你想竞争,你就无法和做自回归的Frontier实验室竞争

张亚历克斯 [00:23:54]:不。

Vibhu [00:23:54]:解码器开启。比如,他们甚至认为不会有那么多计算扩展资源。好吧,可能有少数几个能做到,但至少你在这方面做不了多少。

Alex Zhang [00:24:06]:我对Thinky不太了解,也不想说什么,但如果他们的策略只是复制OpenAI或Anthropic,那就是一个糟糕的策略。

Alex Zhang [00:24:15]:因为,嗯,因为,就像,他们根本没有。就像,你只能从…嗯,你必须从优势是什么来考虑这个问题。如果你打算使用同样的方案。

我确定他们不会,但就好像如果你要使用同样的方案,你基本上就是在竞争你能控制的东西,也就是数据和计算量,而很显然,他们在这方面无法与Frontier Labs竞争。

所以,是的,如果你是一个新兴实验室,这就说得通。实际上,我不知道你会不会把他们算作一个新兴实验室,但我猜,就像……

Vibhu [00:24:40]:是的。那就是他们为什么会在里面的原因。

Alex Zhang [00:24:42]:我想他们有点奇怪,是的。

Vibhu [00:24:43]:他们在他们的名单上。他们已经发货了Inkling。就像,他们不能一样。

张亚历克斯 [00:24:46]:除了OpenAI或Anthropic,比如Meta和GDM,你就是得做点别的吗?就是这样。这是个令人难过的现实,但我觉得。

我其实觉得这是件好事。我很高兴规模化是可行的,这些公司会继续做,因为这能打开潜在的新玩家,比如他们发现真正有趣的东西。因为我有点怀疑Frontier Labs是否真的在发生这种情况,因为你为什么要这么做?

为什么要冒险把大量计算资源分配给新的赌注,而旧的赌注已经有效?所以

Vibhu [00:25:24]:我觉得这也是很多新实验室衍生出来的原因,对吧?

张亚历克斯 [00:25:27]:是的。

Vibhu [00:25:27]:你有个边注,但你得不到计算,你就像

张亚历克斯 [00:25:30]:是的

Vibhu [00:25:30]:“好,我去,我去做。”

张亚历克斯 [00:25:31]:没错。

Vibhu [00:25:31]:你举的潜在优势例子是像Jev这样的,它便宜了X倍,可能是语言模型。

校准、快速分类与新模型权衡

张亚历克斯 [00:25:41]:是的。

维布 [00:25:41]:但这次情况不同。

张亚历克斯 [00:25:42]:是的。

斯威克斯 [00:25:43]:是的。

斯威克斯 [00:25:44]:所以没有猜测Jev到底是什么?

张亚历克斯 [00:25:46]:我想我对它可能是什么有些猜测。我看到有人说,“哦,这像是扩散的东西。”我猜是这样

斯威克斯 [00:25:56]:哪个是平行解码,对吧?

张亚历克斯 [00:25:58]:是的,是并行解码。说实话,我觉得无论它到底是什么,因为我认为你可以做到。我见过一些开源的复制。让我最兴奋的是,他们所做的事情让我不太确定他们的优化目标是什么,以及他们是如何训练它的。

我觉得,这也是我们一直在思考的RLMs的一个问题,嗯,RLM其实是一个非常简单的概念。如果我发表这篇论文,现在任何人都可以使用它了。

但真正区分RLM价值的是你是否能正确训练它,以及你是否能围绕系统塑造一些架构,让它变得非常出色。这也是我正在积极努力的事情。

但我觉得对他们来说,他们找到了训练系统的方法,这完全不简单。其实我也不太清楚他们是怎么做到的。我在网上看到一些比较,有些人声称他们用的是Qwen,或者是在Qwen基础上做后期训练,但你用的每一个开源Qwen都会更差,因为他们训练的方法显然非常有效。

这非常令人兴奋。

斯威克斯 [00:27:04]:校准有一个元素,这是一个罕见的话题,我觉得人们甚至不知道或理解它。我们用与Hugging Face的Clementine Foley的对话来讨论过这个,她以前负责Hugging Face的评估,基本上就是模型会倾向于给出最有可能的下一个标记。

但当你问他们“你有多自信?”时,他们会对你撒谎。因为他们只会给你最可能的下一个答案,而不是说,不,我们来校准吧。我其实有五成,或者二成确定,然后我们试着校准一下。

我会说,如果说有什么的话,我觉得其实合成数据其实挺容易的,因为你可以先看到真相,然后合成一堆答案,让Jev对其进行分类,然后再与实地数据进行比较。

张亚历克斯 [00:27:52]:哦,我明白了。

斯威克斯 [00:27:52]:这就是我对此的逆向推理。

张亚历克斯 [00:27:54]:是的。

斯威克斯 [00:27:54]:其实我有过。我觉得校准可能是比较低的。人们只是把它当作一个非常快速的分类工具,但实际上他们甚至没有使用概率或校准估计值。

张亚历克斯 [00:28:04]:是的。

Vibhu [00:28:04]:我认为这仍然被误解了,反复强调。当你问模型“你有多自信?”时,它会说出43%。关键的差异是这是一个有根据的分类,对吧?

张亚历克斯 [00:28:16]:是的。是的,我非常期待看到大家用这个模型做什么。它能解决所有问题吗?当然不会。但我认为它解决了我们传统上难以解决的一类问题,那就是低延迟问题。

所以我很喜欢游戏的例子。这其实是......I

斯威克斯 [00:28:34]:是的,就是毁灭战士的例子

张亚历克斯 [00:28:35]:是的

斯威克斯 [00:28:35]:非常好。

张亚历克斯 [00:28:35]:我有一个关于玩电子游戏的语言模型的基准测试。我一直很感兴趣的是,智能系统是否能玩新游戏和类似的东西。

所以我觉得他们有一种独特的方式来实现这一点,用一个非常非常快速的模型捕捉语言和理解,这真的很酷。

玩电子游戏的语言模型

Vibhu [00:28:59]:哦,既然你说到这个,你有什么想指出的关于电子游戏的吗?

张亚历克斯 [00:29:02]:哦,是的。

Vibhu [00:29:03]:就是这样。你对任何项目都做过基准测试,对吧?

张亚历克斯 [00:29:05]:所以,是的。我猜这些数字已经非常过时了

Vibhu [00:29:08]:是的。

张亚历克斯 [00:29:08]:因为很多模型差异很大。我确实见过有人运行。有些人在这些游戏上运行更新的模型,这真的很酷。我想这次基准测试的总体前提是,我们只是想看看视觉语言模型是否足够好,能够直接插入带有延迟约束的游戏中。

因为实际上,我是在《Claude Plays Pokémon》发布后不久发布的。

张亚历克斯 [00:29:33]:这大概是两年前的事了,现在看来已经很久了。但我觉得这套任务组最酷的地方在于它们在游戏类型上非常多样化。

而且,我觉得大多数游戏都是大家熟悉或者见过的。我看到了,是的,Jeff在玩《毁灭战士》。我觉得我不这么认为。我觉得他们只是玩一些非常简单的关卡之类的。

但说实话,大多数模型还是做不到。或者说,我其实不认为任何模型能真正解决这些游戏。比如,有些游戏是可以的。我记得我见过Astra能解决《星之卡比》的游戏。

而且,为了这个基准测试,我们有意设计了一个非常简约的线束。我会谈到背带,因为我觉得关于背带的价值,还有一个完整的讨论空间。

比如,背带对模型的用途到底是什么?但总体来说,我认为是。是的,我希望很快或很快看到所有这些游戏被新型号击败。

Vibhu [00:30:35]:是的,挺有意思的。比如老的云地宝可梦,它们会读取内存中的状态,看看哪些地块可以走之类的。很久以前我们和他们做过播客。

张志 [00:30:45]:明白了。

Vibhu [00:30:46]:是的。只是好玩。

斯威克斯 [00:30:46]:是的,而且很相似。比如,杰夫没有远见

张亚历克斯 [00:30:48]:是的

斯威克斯 [00:30:48]:所以你必须逐步融入,

线束作为合成泛化器

张亚历克斯 [00:30:50]:是的

斯威克斯 [00:30:50]:这些,比如游戏状态之类的东西。我们直接进入束缚的部分

张亚历克斯 [00:30:54]:太棒了

斯威克斯 [00:30:54]:因为你提到了。语言模型工具是组合泛化工具。

张亚历克斯 [00:30:59]:是的。

Vibhu [00:31:00]:你读那封信时很挣扎。

张亚历克斯 [00:31:01]:解释一下。是的。好的。所以我对人们对束缚的看法可能有点不满意,因为人们会比较,“哦,我喜欢Claude Code,我喜欢Codex,我喜欢Pi。”比如,“不,我喜欢Oh My Pi,我喜欢Prime Agent。”说实话,我觉得它们其实都差不多。大多数设计决策或者设计选择都差不多。也许Prime Agent有点不同,因为它本质上是个RLM。但总体来说,我觉得我们可以更有创意地设计安全带。如果我们从这个框架的角度思考,具体对模型有什么作用?基本上,当你试图解决一个问题,想用语言模型来解决一个非常困难的任务时,我们发现下一标记预测在完成很多任务时非常尴尬。举个例子,拿SWE-bench来说。当你在代码库中导航时,你能用一个语言模型调用就能搞清楚这些吗?比如,你只需说“解代码”或者“解决我在这个代码库上的查询”。不行。所以我们依赖一个工具来帮助你完成这些事情。我觉得有趣的是,工具是一个非常有主见的程序,决定如何让语言模型在问题上形态适配。我之所以提到这个,是因为当我们思考束在做什么时,我们真的应该考虑束体中有哪些选择让语言模型解决这个任务?我真的能有一个语言模型来做这件事吗?因为束束,如果你仔细想想,现在环路变换器已经存在,我觉得很有趣的是,你也可以用束束来模拟环形变换器,对吧?你只是循环对模型进行循环。现在你可以说,“哦,我没有解码”,所以情况有点不同。但总体来说,不知为何,我们一直坚持同一个模型架构选择。我。有很多理由支持,但显然,我们现在是在围绕束束推广来训练模型。所以现在有一种非常尴尬的方式来训练工具束,比如我们训练一个语言模型在束体内工作,但现在我们做的是一个非常漫长的、可能是多代理的部署。而且有很多非常尴尬、非常不靠谱的方式来做这件事。所以这篇博客讲的是一个方式,你可以这样理解这里发生的事情,如果束束基本上帮助模型解决某个特定任务,不同的束束设计选择是否真的能做出更有意义的事情,而不仅仅是“这里有一些工具调用,可以帮你”。这里有一种方法可以让你的代码库进行 grep。所以实际上就是这样。这个博客的想法也源自RLM的想法。只是我们没有那样包装它。我认为这其实是真的。关于RLM还有许多其他想法,比如我们会提出,但它们从一开始就存在。这些都是设计决策。我认为是关于现在的。我喜欢RLM的一点是,我感兴趣的是有许多不同的抽象迭代和版本,最终RLM是最合理的。但有很多原因不公开说明为什么会这样。你会看到的。在这个例子中,我们看到RLM的一个特点是,如果你足够卸载上下文并编写。要求模型在那个上下文上写代码,你会得到一个非常奇怪但有用的特性,那就是当模型在训练中识别如何解决任务时,实际上许多任务的解法非常相似,比如你甚至不做的任务。比如,你甚至不太清楚这两个解决方案是否相似。在这个例子中,我们有一个检索任务,一个是聚合任务,它们的查询方式完全不同。领域完全不同。当你训练一个常规语言模型来处理这两个任务时,路径看起来非常不同。所以你依赖的东西,比如说,假设你用的是Pi或Claude Code之类的工具,虽然这篇博客里没有,但我们确实有这些结果。你会发现这些工具在这两个问题之间区分得太多,尽管解决方案是一样的。所以我们在训练RLM时发现的一个现象是,当它看到这些问题时,结果是一样的。它之所以把这些问题看作相同的问题,是因为子代理看到的问题不同,但子代理解决的是更简单的子任务,所以你有信心它足够智能去完成。但对于基础整体策略,它们最终看起来是一样的。所以当你训练左任务时,比如说,它能立即解决正确的任务。如果你往下看我们已有的图,你会观察到一件事是。 当你天真地训练你的RLM去完成这些任务时,它们自然会学会推广,比如说,针对更长的任务,因为策略基本相同。你只是修改一个长度变量。这实际上也适用于不同的任务,它们甚至不——它们在长度上并没有区别。它们完全是不同的任务,数学任务和写作任务。但解决方案,也就是那种元高级解法是一样的。所以当你在其中一个任务上训练RLM,它会将这种行为推广到第二个。这里没有什么魔法。我想这可能是我想强调的一点。比如

Vibhu [00:36:38]:你会如何用语言表达他们学到的内容?我记得你在这里说你在短任务上训练,他们会推广到8到30倍长的内容。

张亚历克斯 [00:36:47]:是的。

Vibhu [00:36:48]:他们是在学习如何解决这类问题,或者说他们真正学到的核心是什么?

张亚历克斯 [00:36:52]:是的。他们正在学习如何以一定长度解决这类问题。事实证明,当你把他们学到的策略应用到更长的长度上时,这种方法可以直接应用到更长的阶段。

比如,他们是

Vibhu [00:37:05]:是的。

张亚历克斯 [00:37:05]:实际上是同一个程序。这非常令人兴奋,因为这意味着当你有一个数据集或环境来训练模型时,希望A,你可以在更少的环境中训练,并通过现有的天真训练来推广到比现有模型更多的能力。

但B,你仍然希望利用你拥有的所有数据。所以当你训练这些任务时,希望它能推广到更广泛的问题类别。而这之所以更令人兴奋,至少在RLM或任何递归调用系统的语境下,是因为这个论点在归纳上成立。

比如,我给你举个例子,因为我说过竞技编程和GPU优化使用非常相似的技能。模型可以。线束可能需要以某种方式轻推它,但它可以学习,比如,“好,我要解决这个GPU编程任务的方式,和我在竞赛编程中学到的非常相似。所以我会列出一组解决方案。我会生成子代理来列出有前景的解决方案,然后我会写一个循环来检查这些解决方案,可能对它们进行进化,然后针对验证者进行进化。”这两个任务之间,看起来是一样的。

但子代理所做的事情可能独特且不同。但即使是子代理解决的内容,实际上也可能形式相同,对吧?因为它是一个递归的论证。所以我写这篇博客文章想表达的是,我们应该重新思考束束的作用,因为束束实际上能极大提升模型的泛化能力和数据量。

这并非RLM独有。我认为还有一大类束缚器尚未被发现,它们实际上能产生类似的特性。进一步扩展这个论点,我认为你还可以从中推断,比如,如果我看RLM,RLM中真正需要的组成部分有哪些?

我是否可以直接训练模型来实现这一点?我能否训练模型在其前向传递中隐式地作为RLM?这确实是个很奇怪的思考问题,因为你可能会说,“哦,代码是不可微分的,等等。”但我们会开始发现许多这种行为的近似。

我认为,我们会看到不仅仅是“我要设计一种新的编码束”,它采用一种特殊的压缩形式之类的。我认为我们可以发挥更多创造力。比如,这些语言模型有很多我们之前没做到的。

我对此非常兴奋,因为我认为我们可以从非常有主见且更适合扩展的束束设计中获得实质性的收益。比如说,RLM,是一种非常原始的归纳偏见。

设计本身没什么特别之处,只是它和我们现在做的很不一样。但结合我们可用的数据和环境,这种设计可能会更好地扩展。

Vibhu [00:40:20]:我想,反过来大家可能会问的是,现在的线缆非常通用,主要用于编程,而编程在很多领域都适用。云代码被用于设计和演示

张亚历克斯 [00:40:33]:没错。

Vibhu [00:40:33]:一切。缪斯火花,格罗克机器人。

Vibhu [00:40:36]:这些都是非常简单、没有主观色彩的束缚器,擅长编码,而且还在扩展。我想我们如何改进它们的例子是什么?

张亚历克斯 [00:40:48]:是的。让我提另一篇最近发表的论文。它类似于马车税论文。我记得是Arena写的。我很喜欢这篇论文,因为它提出了我之前的经历,基本上就是

Vibhu [00:41:07]:所以这证实了之前的观点。

张亚历克斯 [00:41:08]:是的。大多数背带选择其实无关紧要,因为

Vibhu [00:41:12]:是的。

张亚历克斯 [00:41:13]:这些线束都是一样的。但我会说,比如Grokbot,据我理解,它实际上和这些线束的设计方式相当不同,我很喜欢这一点。

至少从这里可以看出,我很确定。Anthropic或OpenAI完全在用他们的线束进行训练。他们可能没有在竞争对手的线束上训练。我猜应该不会,因为我不知道他们为什么要这么做。

但是

Vibhu [00:41:38]:但这在开放模型中很常见,对吧?比如,Qwen非常擅长使用开放代码。

张亚历克斯 [00:41:43]:是的。

维布 [00:41:43]:他们需要用背带训练。老杰玛家族在这方面出了名的糟糕。

张亚历克斯 [00:41:47]:是的。

Vibhu [00:41:48]:模型很好,但你需要在背带上训练。

张亚历克斯 [00:41:50]:不过我认为,随着模型变得更智能,或者说,随着它们变得更好,这个区别就不再那么重要了,比如说,如果你把Astra放进开放代码里,它不会变得疯狂,因为我觉得它已经足够好了。

所以我这么说是因为这些不同线束之间的优势大多是成本。我想说的是,Sugru,如果你把这些模型接入RLMs,它们其实也不是那么好。它们还行。

我认为主要是因为我们训练的线束类型是这样一种线束,比如π环路。我喜欢把它称为轨迹作为提示,意思是你保留整个推广轨迹作为你主模型所使用的上下文。

即使你用子代理,它仍然是某种形式。我认为我们会这么做。如果我们想探索新的束缚,就需要有专门的团队,专门进行有意义的实验,比如扩展新束体,比如在不同束缚设计上进行后期的扩展。

我认为我们可以通过做这类事情获得非常有意义的知识或收获,无论是RLM还是其他东西。这很令人兴奋,因为比如说,如果你经常训练,Fable 长期以来一直是 RLM 最好的模型,因为它们有动态工作流程,而且很明显,这项功能经过了一定的训练。

即使模型在 RLM 线束下还有些笨拙,但它的表现仍然比其他型号好得多。Astra 现在在这些方面也足够好了。但是

斯威克斯 [00:43:33]:等等,这是不是我们看到Fable是RLM最好的,还是还有别的选择

张亚历克斯 [00:43:38]:哦,不,这些都是内部结果吧。

张亚历克斯 [00:43:40]:是的,我没有,我没有

斯威克斯 [00:43:41]:好的

张亚历克斯 [00:43:42]:目前是公开的。但总体来说,我认为你很容易看出我们还没有针对RLM的工作流程进行优化。我认为如果我们找到能够正确实现这些的模型,它们也会更加高效。

你可以思考一下,为什么会这样,对吧?

Vibhu [00:44:03]:我觉得现在你得给那个RLM的十秒钟时间。

什么是RLM?

张亚历克斯 [00:44:07]:哦,是的。

Vibhu [00:44:07]:因为这里有很多听众

斯威克斯 [00:44:09]:是的。我们假设有很多知识。

张亚历克斯 [00:44:10]:是的。

斯威克斯 [00:44:11]:另外,我觉得你。但你已经设定了一些背景

Vibhu [00:44:13]:是的

斯威克斯 [00:44:13]:所以你可以。就像我们刚才说的那些话

维布 [00:44:15]:是的

斯威克斯 [00:44:15]:我们能给出一个清晰明了的RLM定义吗?

张亚历克斯 [00:44:18]:是的。好的。我想回到博客,那

Vibhu [00:44:21]:是的

张亚历克斯 [00:44:21]:作曲概括博客。就是这个。好的。

斯威克斯 [00:44:24]:好的。

张亚历克斯 [00:44:24]:这真的是最棒的。我真希望我在原始论文里有这个。RLM 基本上就是一种束缚设计,束缚中唯一的工具是代码,也就是调用程序化子代理调用的程序化子代理,它可以选择把自己称为工具,并且还有其他工具。

但这些都是代码中的函数,它处理的上下文总是存储在这个代码环境中的某个内存中。所以这可以是一个文件系统。比如,这可以是,比如。

我给你举个例子,Prime Agent。Prime Agent 的发展轨迹,比如上下文,甚至是。当你压缩并完成所有这些操作时,它会存储在磁盘上。

所以模型总是可以引用它的原始上下文,即使它是压缩的,而且它的所有工具都运行在比如说,Python REPL 或 Bash REPL 里。所以就是这样。

这就像是非常原始的抽象。我想说,大多数硬件的区别在于,首先,上下文卸载并不是那样的。顺便说一下,如果你看看Prime Agent,Prime Agent确实做上下文卸载,但不是完全做到。

所以,它仍然保持标准的COD代码,Codex循环,比如轨迹作为提示,你会压缩,但它增加了额外的上下文卸载,而且它只是这样。Prime Agent的独特之处在于唯一的工具是IPython。

这就是RLMs中最通用的抽象。是的。

Vibhu [00:45:59]:具体来说,RLMs想要解决的核心问题是什么?

长上下文、组合及本地分发任务

张亚历克斯 [00:46:02]:是的。

Vibhu [00:46:02]:我记得刚上映时,有一段时间是背景因素。

Vibhu [00:46:06]:我不问这个问题。

张亚历克斯 [00:46:06]:是的。最初的问题是,harness在处理长上下文时非常困难。它们通常只用来处理像代码这样的特定任务。比如,它们可以处理你的代码库,因为它是基于代码库训练的。

但现在更多地围绕着这个博客所说的,也就是组合性,以及我认为harness。我们希望拥有语言模型系统,能够更好地控制它们在每一步的操作。

而工具调用非常有限,因为你必须每回合调用它们。比如,你必须调用工具A,然后是工具B,再调用工具C,没有一个可以调用的中心上下文。

而RLM专门围绕组合设计,并且有一个总能调用的中心上下文。这个上下文是围绕现有的语言模型设计的。另一个非常相似的设计例子是代理群体,比如“拥抱面”事件。

这些代理群体有一个留言板,他们学会通过它进行交流。从某种意义上说,这个留言板是他们行动的共享上下文。RLM基本上说,通过这种方式进行沟通的最佳方式是用代码。

你写代码来实现这个,因为这些模型写代码非常出色。我们想利用这一点。

斯威克斯 [00:47:37]:然后对于这个构图,甚至包括为任务制作你自己的安全带。

张亚历克斯 [00:47:44]:没错。

斯威克斯 [00:47:45]:右?

张亚历克斯 [00:47:46]:我想如果你往上看这个图,我们会开始看到这一点。好的。我们谈到了“本地分发任务”的概念,这就像是一个建立在分发任务之上的理念。

当我们思考语言模型时,分发内任务就是提示词是模型以前见过或者见过某种版本的内容。大多数线束的工作原理就像右边那个,它们会不断附加轨迹作为提示。

所以最终,除非你是Anthropic或OpenAI并且训练在用户轨迹上,否则大多数这些内容最终都会被分配到外面。但局部分布基本上是组合论证,如果RLM将其计算分解成一种元机束,或者一个涉及子代理的程序,这些子代理观察局部问题,整个任务过程中的每个语言模型调用都是分发的,即使整个任务本身都不在分发中。

我认为这是一个非常理想的特性,原因显而易见。比如,如果每个任务对每个单独的语言模型调用都处于分发状态,你很可能会得到正确的答案。

所以。

斯威克斯 [00:49:00]:RLM的逻辑极限是RLLMs,你不仅写出线束,还要训练一个自定义模型

训练RLM与更智能的线束

张亚历克斯 [00:49:11]:没错。

斯威克斯 [00:49:11]:你收集数据,所有东西。

张亚历克斯 [00:49:14]:是的。

斯威克斯 [00:49:14]:就像你体内的全自动人工智能研究员一样。

张亚历克斯 [00:49:16]:是的。我们会看看RLM的培训会走向何方。作为一名学者,我得说,我现在在麻省理工学院并没有从事这项工作,至少不是大规模的,因为我负担不起。

但确实有一些公司在做这项工作。我认为Prime and Select非常明显地在做这项工作,这非常酷。我非常期待看到这一过程。也许我们会观察到,我不知道,但也许我们会看到培训后关于智能光束训练的扩展定律会更好。

也许我们甚至会看到更智能的光束问世,它们在这些原则下工作效果更好。

斯威克斯 [00:49:50]:什么是更智能的背带?那没什么特别的意思。你刚才说它们都一样。

张亚历克斯 [00:49:54]:不是。更说,像Claude Code、Codex、Pi等等,其实都差不多,就是拆解背带的逻辑后,其实几乎是一样的。

斯威克斯 [00:50:06]:是的,循环中有两个通话,或者

张亚历克斯 [00:50:07]:是的

斯威克斯 [00:50:08]:随便吧。

张亚历克斯 [00:50:08]:但在RLM和其他工具束抽象中,情况会非常不同。这正是我认为你真正区分开来的地方。这就像语言模型架构的选择一样,很多架构选择在你扩展后看起来差不多。

这些差异最终会比较细微。对于实验室来说,差异不小,但也许某个模型比另一个稍微收敛一点。但一般来说,如果你是这样。比如说,预训练的缩放定律之所以成立,是因为我们目前的架构选择相对稳定。

但如果你完全改变架构,预训练的缩放定律可能就不成立。或者,类似这样的情况。像幂律这样的情况会非常不同。背带也是一样。我觉得我们现在拥有的所有背带大致外观都差不多,但有一些例外,我觉得正在推出。

斯威克斯 [00:51:06]:我本来想说,其实我更感兴趣的是,比如谈论那些敢于冒险的博士生,那就是人们已经被接受了。也有人在追求另一方,也就是预训练的缩放定律如果改变数据就不成立。

现在它只是未经构建的、原始的、非结构化的互联网语料库。如果你有更好的数据表示来训练会怎样?那么,是的,你的缩放定律也会改变。

张亚历克斯 [00:51:28]:是的。

斯威克斯 [00:51:28]:所以有架构,有数据,还有其他你可以考虑的内容。嗯,我想回到这个话题。一切都说得通。很有趣的是,你如何从非常概念性的层面上下递归,逐渐变成“这就是我们现在的状态”。

主代理人与观点式束带设计

斯威克斯 [00:51:43]:不过,是的,显然,它可以放大或缩小规模。我想,我很好奇,你是怎么开始和Prime合作的?Prime会承担更多工作吗?

这是他们对Hermes特工的回应吗?

张亚历克斯 [00:51:56]:嗯。

斯威克斯 [00:51:56]:你提到Grokbot有点不同。我只是想点名这些人,听听你对每个人的看法。

张历克斯 [00:52:01]:是的。顺便说一句,Prime发布了一篇博客文章,内容和我无关,内容是他们认为RLM是未来的。我有个朋友在那里工作,GPU Mode,Matei。

我们联系上了,我觉得我和那里很多研究人员的看法很一致,也理解他们对线束设计的看法。我觉得他们非常佩服他们理解RLM论文的目的,这不仅仅是说我们解决了长上下文任务,而是真正想要更有主见的线束设计。

斯威克斯 [00:52:39]:是的。总会有你选择突出论文的结果

张亚历克斯 [00:52:42]:是的

斯威克斯 [00:52:43]:与真正的目的相比。

张亚历克斯 [00:52:44]:是的。我很想谈谈学术界的激励机制,以及为什么它有缺陷以及各种问题,我们稍后会回到这个话题。是的。

总之,我很喜欢Prime的团队。所以我们其实一直很喜欢。在我们决定合作后,我们决定考虑RLM的培训,同时构建这种RLM框架,看看能把它带到哪里。

这就是Prime Agent诞生的原因,我觉得Prime Agent的反响还不错。我对Prime Agent担心的是,至少在我们开发时,没有一个模型能很好地做RLM相关的事情。

所以这大概是Fable之前,Astra之前。

斯威克斯 [00:53:27]:我想,退一步说,你能解释一下Prime Agent是什么,它和它有什么不同吗

张亚历克斯 [00:53:32]:是的

斯威克斯 [00:53:33]:传统的克劳德密码,人们会期待的背带?

张亚历克斯 [00:53:36]:是的。所以,首席特工,我想我之前提过这件事

斯威克斯 [00:53:40]:是的,那张图。是的

张亚历克斯 [00:53:41]:基本上是。它是一个。一个放在Pi上面的束带,就像Pi Mono一样,作为背景介绍,Pi Mono就像是,就像

斯威克斯 [00:53:50]:核心代理

张亚历克斯 [00:53:51]:极简主义者

斯威克斯 [00:53:51]:是的。

张亚历克斯 [00:53:52]:是的,比如束缚。我用π作为所有参考,因为我觉得其他束带基本上就是π。

张亚历克斯 [00:53:57]:但它是 Pi,只不过我们明确限制 IPython 是唯一可用的工具。其他所有工具都会被加载为 Python 模块,或者类似于它可以运行的 Bash 脚本。

因此,它在 Pi 的基础上使用核心 RLM 抽象,然后它还有一个持续性工具,这个工具是 Seth,他是另一位博士生。这是他用来让语言模型工具玩游戏的东西。

他曾经与 Joel 合作很多,Joel 就是那个玩宝可梦的 Gemini 的人。顺便说一下,持续性工具也非常简单,我挺喜欢它。它基本上是一个设计原则,比如你允许工具自身修改哪些部分?

有一些部分,你会允许它修改自己的技能、可用的子代理以及模型的系统提示。持续性工具基本上作为 IPython 内核中的一个工具可用。

这就是 Prime Agent 的工作原理和设计思路。Prime Agent 中的其他所有东西都是这样的。

Swyx [00:55:05]:标准

Alex Zhang [00:55:06]:标准

Swyx [00:55:06]:标准

Alex Zhang [00:55:06]:对吧?是啊。我觉得我真正喜欢它的地方,而且我们有点幸运的是,很多新前沿模型在内部实际上工作得非常好。

实际上,即使是很多开源模型也表现得很好,至少一些较新的模型是这样。还有一件我应该在Prime Agent中强调的事情是,我们有一个非常特定的代理间通信系统或框架,这是因为RLMs往往会生成许多子代理,我们希望子代理能够与根代理或彼此进行通信。

因此,在设计上会有一些决定,比如每个子代理允许与谁通信,以及它是如何通信的。同样,一切都在代码中,所以它会编写代码来实现这种通信,我觉得这非常酷。

然后,我想持久子代理是另外一个被加入的功能,也就是说子代理可以超越原始代理的标准运行时间存在。你可以进入那个子代理,更加对它进行提示,你能更清楚地看到发生了什么,并且有更多的灵活性。

Swyx [00:56:10]:这是我现在使用 Codex 最大的痛点。他们,他们的子代理非常短暂,而且他们还积极阻止你用它来进行长期运行的任务。

Alex Zhang [00:56:17]:是的。是的。我认为这很有道理。是的。我

Swyx [00:56:21]:所以诀窍就是外部化到文件系统,对吧?

Alex Zhang [00:56:24]:是的。嗯。就是那样

Swyx [00:56:25]:就像,那就是诀窍。

Alex Zhang [00:56:25]:那就是大窍门。

Alex Zhang [00:56:27]:是的。

Swyx [00:56:27]:嗯,而且,也就像,把所有事情都强制通过代码运行。相信模型

Alex Zhang [00:56:30]:是的

Swyx [00:56:30]:它可以写代码,而且它会自己写自己的测试框架。那么,Prime会承担像训练后的定制模型这样的任务吗?这是你们之间一次性的合作,仅此而已吗?

就是说,什么情况?

Alex Zhang [00:56:41]:是的。他们正在培训一个模特,实习生——我觉得他们其实对此很公开

斯威克斯 [00:56:46]:是的

张亚历克斯 [00:56:46]:三月份的时候。

斯威克斯 [00:56:47]:显然这是他们的事。

张亚历克斯 [00:56:49]:是的。

斯威克斯 [00:56:49]:是的,所以。

张亚历克斯 [00:56:50]:是的。他们展示了可以在他们托管的培训栈上进行训练。但不,关于模型训练,我没有参与其中。主要原因是我在博士项目中还有其他想做的事情。

我觉得,还有很多其他重要的赌注可以尝试,

斯威克斯 [00:57:03]:哦

张亚历克斯 [00:57:03]:除了RLM之外,还有一些

斯威克斯 [00:57:06]:哦

张亚历克斯 [00:57:06]:有些我还不知道能分享多少。但总体来说,我觉得,我其实觉得作为博士生的一种奢华,就是有很多大赌注可以赌。

大多数可能一无所获,但现在是研究领域非常激动人心的时期,尤其是因为我觉得这个领域的大多数进展都挺无聊的。我不是说结果无聊,但做这些事情的过程往往相当无聊。

所以我们会有个问题,比如,我们接下来想做什么?但是

斯威克斯 [00:57:39]:是的

张亚历克斯 [00:57:39]:我们以后再谈。

第三方RLM工作:Harvey、Headlong、DSPy和ARC-AGI-3

斯威克斯 [00:57:41]:是的。

张亚历克斯 [00:57:41]:是的。

斯威克斯 [00:57:41]:好,我想先结束你的研究,然后我们可以,

张亚历克斯 [00:57:44]:酷。嗯

斯威克斯 [00:57:44]:开始发布吧。自从你发布了《RLM》,大家都很兴奋。有没有什么第三方的次要作品想特别推荐,比如你们应该看看?

张亚历克斯 [00:57:53]:哦,是的。所以,Harvey,一家法律人工智能公司,发布了一篇博客文章,虽然完全没有关联,但他们对RLM进行了后期训练,涉及他们的法律工作,通常涉及大量筛选文件,查找各种具体信息,这些信息可能不容易用纯检索系统检索。

他们展示了非常好的结果。这非常令人兴奋。我很震惊他们会参与这项工作。他们没告诉我,所以当这个项目发布时,我心想,“哇,太棒了。”我觉得有一个非常酷的项目,他们正在做的事情。

顺便说一句,我觉得这也是和Base 10的合作。

斯威克斯 [00:58:33]:是的,这就是第十基地。

张亚历克斯 [00:58:34]:Headlong,也就是法律,法律学院的那种。那是他们那种持续不断的背带。这真的很酷

斯威克斯 [00:58:42]:哦,他们改名了?以前叫别的名字。

张亚历克斯 [00:58:45]:就像Auto

斯威克斯 [00:58:46]:终点站。

张亚历克斯 [00:58:46]:是的,我知道。他们通过了。是的。

斯威克斯 [00:58:49]:好吧。

张亚历克斯 [00:58:49]:这就是Andy Konwinski的大项目。非常酷。我很喜欢Andy。我不想因为他们用的是RLM抽象而贬低他们所做的,但他们做的事情比RLM更酷,比如他们有一个所谓的“持续思考”系统。

所以即使你不查询,它也有办法思考它在上下文中遇到的问题。

斯威克斯 [00:59:16]:哦,原来就是那种一直在线的感觉。

张亚历克斯 [00:59:18]:它就像是一直在线的,但价格并不高。他们控制代币成本,确保不会把所有信用点都烧光。这真的太酷了。我正在思考。

有很多。其实,如果你去RLM、GitHub页面,下面有很多我链接的东西。有很多很酷的东西,大家都在做。Axe也是个很酷的项目,我觉得就是这个人做的。

它就像一个连接DSPy和RLM的工具。DSPy也有RLM。哦,最后要说的是,关于ARC-AGI-3,我相信他们在官方的Kaggle竞赛上有很多线索,而不是像公开灵长类动物那样,或者说是人们评估过的那种。

他们都声称使用或者引用了TUFA,比如在他们的线索中,某种形式或灵感化的RLN抽象形式,这真的很酷。我认为,这正是你能看到从合成、使用代码以及将神经符号系统与AI结合中获得很多好处的地方。

所以

斯威克斯 [01:00:27]:是的。

张亚历克斯 [01:00:27]:是的。非常酷。

斯威克斯 [01:00:28]:我们喜欢好的神经象征性引用。

代理蜂群、未解数学以及用户应当看到的内容

张亚历克斯 [01:00:30]:是的。

斯威克斯 [01:00:30]:你提到ARC-AGI-3时,OpenAI也说:“我们已经达到了99.9%的成功率。”

张亚历克斯 [01:00:36]:没错。

斯威克斯 [01:00:37]:他们还说,“我们解决了Navier–Stokes。我们只是给它扔了一个模型。”

斯威克斯 [01:00:40]:关于它是否只是模型存在一些争议。

斯威克斯 [01:00:44]:他们用的是RLM吗?怎么做?

张亚历克斯 [01:00:46]:我猜可能不会,除非你说,比如。我会谨慎一点,因为人们会争论什么是RLM,什么不是RLM。很明显他们用的是某种拥有共享上下文的代理群,比如共享文件系统。

这非常符合RLM的精神,但我认为他们做了很多更聪明的事情,可能和RLM本身无关。我有点同意他们做的事情其实不需要束缚器。我会这么说,我认为一个模型,比如GPT-6 Astra,技术上足够智能,基于正确的信息,能够为这些非常困难的问题提出证明。

现在,如何获得这些信息是一个巨大的问号。就他们而言,可能归结为对许多这些亚年龄的代理人进行非常漫长的搜寻,或者说,群体中的许多代理人,也许还有研究人员的意见——我其实不太确定这部分,但他们会根据他们的直觉去探索什么,比如说应该探索什么之类的。

最终,这产生了一些信息,某个代理人能够利用这些信息完成证明。所以从这个角度来说,我觉得,这个束缚真的那么重要吗?不重要。

我认为这表明,束的具体细节其实并不重要,我认为束缚任务论文也指向了这一点,除了用户对束束的感受之外,实际上重要的是,如何以有意义的方式组合这些代理,以达成最终答案?

也许这正是群组等问题的真正意义所在。所以至少从我的角度来看,如果我们开始思考用户的使用场景,我们希望束束和类似的东西得到什么?

比如,

张亚历克斯 [01:02:51]:我们想从这些中提取好的部分,比如Claude代码、Codex,比如人们喜欢看到的流。但在底层,运行的东西可能是一个非常奇怪、复杂的代理群,最终会给出答案。

不过用户显然不想看到这些,对吧?那是无法理解的信息。所以我——这是另一种持RLM精神的东西,比如递归语言模型。听起来像是一种语言模型,但它并不是语言模型架构。

但原因是,我认为未来某天我们会开始看到,我写过一篇博客,我们所说的语言模型,比如我们查询的东西,可能实际上像一个群体、脚手架,或者某种非常可扩展的奇特束设计,但用户看不到它。

最终,用户看到的只是某个前端版本的束体。是的,我认为至少相对可以肯定的是,这就是我们会看到的。

斯威克斯 [01:03:48]:是的。

张亚历克斯 [01:03:49]:这可能又回到基准变压器的局限性。显然,如果你只是拿一个基变换器,然后说“求解纳维–斯托克斯”之类的,是做不到的。

是的,我们都知道这不会是那样的结果。但我认为这可能是更有趣的部分。也许关于“线束是否重要”的说法更多是围绕这个,比如任意指向模型或代理到一个不断增长的信息上下文,可能就足以解决非常困难的问题。

这我能接受。

斯威克斯 [01:04:20]:虽然内容很多,但我想说,OpenAI花费的金额是半公开的。88小时内耗费了1万名代理。

张亚历克斯 [01:04:29]:哦,是的。

斯威克斯 [01:04:29]:1300亿个产出代币,估计相当于约4000万美元的公开定价。

张亚历克斯 [01:04:34]:说实话,比我想象的还少。

斯威克斯 [01:04:37]:是的,没那么多。

张亚历克斯 [01:04:38]:是的。是的。

Vibhu [01:04:38]:最终产出是1300亿,但正如你所说,有很多背景信息在传递。

Vibhu [01:04:44]:仅是总代理消息数量就超过了两倍。

张亚历克斯 [01:04:47]:是的。

斯威克斯 [01:04:48]:是的。

张亚历克斯 [01:04:48]:是的。是的。

斯威克斯 [01:04:49]:我觉得,我很荣幸能提到光标,特别是关于群体的设定。

群体架构、协调与令牌效率

斯威克斯 [01:04:53]:这个月稍早一些,意思是二月,是很古老的。

张亚历克斯 [01:04:57]:哇。

斯威克斯 [01:04:57]:但如果你往下滚动到他们最终达到的多智能体架构,基本上是一个普通软件团队的组织结构图。我有一点在思考,因为我基本上......有类似的东西,收集所有功能,你必须用子代理来完成。

实际上,这和GPU编程非常相似。

张亚历克斯 [01:05:16]:是的。是的。是的。

斯威克斯 [01:05:17]:所以,这就是瓶颈。这就是瓶颈。

斯威克斯 [01:05:21]:如果有一个主要负责协调所有分组人员,那他们就得重新集合,然后重新协调。

斯威克斯 [01:05:29]:那太慢了。那,那很糟糕。真正的群体应该是每个人都有自己的个体。

张亚历克斯 [01:05:35]:是的。是的。

斯威克斯 [01:05:36]:右?

张亚历克斯 [01:05:36]:嗯,我同意这个观点,不过我觉得这里有个问题。让我打个比方,比如,什么时候会用压缩,什么时候用RLM?

有很多情况下,RLM可以解决比压缩更难的任务,但大多数情况下你更愿意用压缩,因为它更便宜、更快。我认为在代理群体的语境下,也有类似的情况,比如说,我......相当确定,比如95%的集群完全没用,或者它探索的内容完全是——你只是在烧代币。

相比之下,可能没那么明显。我不确定。也许这里也是这样。

斯威克斯 [01:06:17]:每个人都有工作。这是你的董事会。

张亚历克斯 [01:06:19]:是的。

Vibhu [01:06:19]:我觉得在某种程度上,问题就是这样被框定的,对吧?

张亚历克斯 [01:06:23]:是的。

Vibhu [01:06:23]:比如说,如果你有一个搜索问题,需要用一堆子智能来做搜索,那会有很多无用的信息,对吧?你得到的是一个检索答案,你会被推断,但这是有意识理解的,对吧?

张亚历克斯 [01:06:36]:是的。但有个问题是,针对哪些问题应该解决什么?比如,理论上OpenAI可以用什么设计——把这个API打包起来,他们会称之为swarms,然后给你,他们会说,“把它指向任何问题,我们给你解决方案。”但也许

斯威克斯 [01:06:53]:是的,叫专业版,对吧?

张亚历克斯 [01:06:54]:是的。也许你得花大约4000万美元才能得到结果。

张亚历克斯 [01:06:57]:这就像,嗯——但这很令人兴奋。我得说,我们甚至能选择把4000万美元投入一个问题并解决它,这真的非常令人兴奋。

Vibhu [01:07:07]:是的。

张亚历克斯 [01:07:08]:但在这个领域,关于哪些是必要的,仍有大量的研究要做。比如,我们想做什么?我们想要什么样的设计?我们可能不希望一切都变成一个群体,但,我们该在哪里划清界限?

比如,代理人能设计这个,还是自己决定?等等。所以。

开放性与无固定目标的研究

斯威克斯 [01:07:26]:是的。然后,简单问一下,看看你是否有看法。你有没有深入研究过开放式问题作为一个普遍的问题类别?

张亚历克斯 [01:07:35]:哦

斯威克斯 [01:07:35]:意思是不要提示,直接去做。

张亚历克斯 [01:07:38]:有一点。所以我在Sakana度过了一个夏天,就在博士毕业前,这也是他们在那里经常做的事。我觉得现在连递归超级情报部门也有很多这样的人。

斯威克斯 [01:07:53]:是的,我们刚请来了理查德·索彻。

张亚历克斯 [01:07:55]:哦,是的。是的。所以,比如理查德的公司,然后还有。其实,等等,那可能是同一家公司。我不记得了。蒂姆·劳滕施拉格也是

斯威克斯 [01:08:03]:是的。

张亚历克斯 [01:08:03]:好的。是的,就是那家公司。

斯威克斯 [01:08:04]:他是主要的联合创始人。他曾是谷歌开放式项目负责人。

张亚历克斯 [01:08:07]:是的。

斯威克斯 [01:08:07]:是的。

张亚历克斯 [01:08:08]:所以我觉得开放性问题,我觉得它们有点类似于未解的数学问题。也许这样说有点奇怪,但我觉得很多方法在人们处理这些问题上其实差不多。

进化搜索就像是发射一群代理,希望他们能找到有趣的问题——这正是AlphaEvolve和其他一些研究在一两年前做的。但我觉得可能不是,我不确定这是不是你说的,但我觉得开放式搜索问题不太清楚的是,我们是不是把它们都当作一个未解决、非常困难的问题,还是目标明确?

如果不是这样,我还没完全弄清楚它的价值。也许你有其他看法。我对此没太多看法,但至少从我在Sakana的经历来看,我感觉我们最终还是想用OpenAI对Navier–Stokes的方式来做。

我们想要。我们——我们仍然有很多推动,想要达到一个有趣的方向。

斯威克斯 [01:09:29]:我的看法是,可能是基础科学和应用科学的分界。基础科学,你是为了研究而研究。

斯威克斯 [01:09:36]:你只是想更好地理解事情。我不知道会不会有任何应用,但,然后应用,你有目标。

斯威克斯 [01:09:45]:你是想以某种方式减少损失吗?所以,我真正的想法是,关于人们的大赌注,如果没有提示呢?就是。

张亚历克斯 [01:09:57]:我明白了。

Vibhu [01:09:58]:你只需选择域名,然后让它自由

斯威克斯 [01:09:59]:就像,你就像一群东西突然出现,然后你就说,“嘿,大家好啊?你们在做什么?”

张亚历克斯 [01:10:03]:是的。

斯威克斯 [01:10:03]:然后,你自己决定

张亚历克斯 [01:10:05]:我明白了

斯威克斯 [01:10:05]:这确实是个有趣的问题。

张亚历克斯 [01:10:06]:最大的问题是,也许有一条明确的路径,但至少在我那儿的时候,人们对开放式的态度最大的问题是,最终你怎么选择?

你怎么挑出有趣的东西?因为当没有的时候。比如说,也许代理人会想出一个目标,但在很多情况下,比如他们......他们有一个叫Fugu的东西,我记得,它就像是一个模型式的路由器,至少灵感来源于这个想法,比如,我们选一个问题,也许能挑出最好的解决方案。

在这个案例里,就是选择一个最适合这个问题的模型。

斯威克斯 [01:10:41]:你是第一个将模型路由与开放性联系起来的人。

张亚历克斯 [01:10:43]:不,是的。但我提这个是因为我觉得,开放式的话,问题是,当我们有一大堆杂乱无章的语料时,我们该如何筛选

斯威克斯 [01:10:57]:是的

张亚历克斯 [01:10:57]:然后发现那些隐藏的宝石?还有,解决开放式问题的办法,就是让模型无限运行,然后不断寻找。就是做数据生成——做超高吞吐量的数据生成,然后让代理们去寻找有意义的东西。

我不太确定。也许这样就够了?那会很酷。

斯威克斯 [01:11:21]:对我来说,这对机器学习来说非常有趣,因为它基本上是对所有机器学习的反制,因为机器学习有目标,没有目标。

张亚历克斯 [01:11:28]:是的。是的。

斯威克斯 [01:11:29]:但是,或者说,一个模糊的目标,你会想,“那这个目标呢?”你会想,“好吧,也许吧。”然后你会继续研究,发现

张亚历克斯 [01:11:36]:是的

斯威克斯 [01:11:36]:这是个有趣的目标。因为,我觉得,就像你说的,找到目标函数,Jeff找到了一个有趣的目标函数,没人在探索。

张亚历克斯 [01:11:43]:是的。是的。

斯威克斯 [01:11:44]:我觉得这和你对研究生的看法很相似。你留在学校是因为你是。你想追求开放式。如果你想,赚最大利润,加入那个逃离永久底层阶级的环境,那你就去实验室。

斯威克斯 [01:11:59]:右?

张亚历克斯 [01:11:59]:是的。是的。挺有意思的。我觉得我不常听到这样的讨论。我,我在东海岸,所以这是一种非常不同的话题。

但每次我来这里,这总是讨论的话题。

斯威克斯 [01:12:12]:不做这件事你付不起房租。

张亚历克斯 [01:12:13]:是的。

斯威克斯 [01:12:15]:是的,你们被挤出了价格。

维布 [01:12:16]:是的。

斯威克斯 [01:12:17]:好的。所以,是的,这些都有。我不知道你是否想——如果相关,就足够谈谈那些管理不善的天才,你刚才提到的。

Vibhu [01:12:25]:不,只是在你的博客上。但我会继续调查,坂奈。

斯威克斯 [01:12:28]:哦,坂奈?哦,好吧。

Vibhu [01:12:28]:是的。他们在博客文章中也谈过,我也和他们聊过这个。Ultra的一个酷炫成果是,他们基本上放开了自动化数据科学研究

Sakana AI与奇怪的研究赌注

Vibhu [01:12:40]:几乎没有人为干预。就是在制作

斯威克斯 [01:12:44]:是的,这就是汽车研究,它更开放一些,开放程度不同,我同意这一点。

Vibhu [01:12:51]:是的,这和带有客观的汽车研究是分开的,这只是

斯威克斯 [01:12:54]:是的

Vibhu [01:12:54]:做点事情。不过,没关系。他们正在为感兴趣的人做这个项目。

斯威克斯 [01:12:58]:既然你提到这个,其实你怎么看Sakana?除了日本那个,他们还做些什么?

张亚历克斯 [01:13:04]:是的。

张亚历克斯 [01:13:05]:我其实很喜欢那里的人。我觉得他们有一支非常聪明的团队。这很合理。它起源于GDM早期的一个团队,那个团队也做着开放式的进化研究。

我喜欢我在那里经历的地方,至少是他们确实有那个意外,我现在忘了具体时间,但我觉得,比如

斯威克斯 [01:13:31]:你说的是人工智能科学家?

张亚历克斯 [01:13:32]:不,是GPU内核。

斯威克斯 [01:13:34]:哦,好的,是的。

张亚历克斯 [01:13:35]:就是那个。是的。

斯威克斯 [01:13:36]:人们无法原谅他们。是的。

张亚历克斯 [01:13:37]:是的。我想,比如说,人工智能科学家有一些批评,我并不参与,所以我对此没有什么看法。但我觉得总体来说,我喜欢他们的一点是,他们更像是研究型实验室。

所以,他们不像OpenAI或Anthropic那样运作。绝对不是。他们确实没有。很明显,至少我在那里的时候,他们没有一个大家都在用的大型竞争对手模型。

但我觉得他们在某种程度上更像是博士实验室,这很酷。我觉得David Ha真的很聪明。我觉得他对这方面有很好的感知。另外,我觉得日本的人工智能市场也有点不同,他们关注的对象可能和我们这里习惯的略有不同。

不过,是的,我喜欢他们采取的做法。我觉得他们的很多研究有点奇怪,当人们看到的时候?我喜欢这一点。我觉得

斯威克斯 [01:14:34]:我们应该有更多怪异的东西,是的。

张亚历克斯 [01:14:35]:没错。

斯威克斯 [01:14:36]:你说的是不同的市场。就是,是企业级吗?

张亚历克斯 [01:14:39]:比如,那里的运作方式有点不同,比如交易的进行方式之类的。

Vibhu [01:14:44]:他们确实有。我猜这页最初是日文的,但他们确实有模型

张亚历克斯 [01:14:49]:哦

Vibhu [01:14:49]:专为日本市场设计。

斯威克斯 [01:14:51]:所以你不知道。

张亚历克斯 [01:14:51]:我不知道。

Vibhu [01:14:52]:我也不知道。

张亚历克斯 [01:14:53]:我之前不知道这个。

Vibhu [01:14:53]:我也有认识这个团队的私人朋友。

张亚历克斯 [01:14:56]:是的。

Vibhu [01:14:56]:所以确实存在。甚至从你说话的方式来看,回应也朝着那个方向调校。这并不是基准的前沿。这是对他们来说一个文化适用的模式,然后他们会进行聊天之类的。

张亚历克斯 [01:15:11]:是的。

Vibhu [01:15:12]:但呼应你的观点,教育应该是什么样子?有人想参与,他们是一个非常博士级的实验室,“做你自己的事。为什么不呢?我们有钱。去研究吧。”

斯威克斯 [01:15:22]:哦,他们说是Kimi的微调。真不错。

Vibhu [01:15:24]:哦,给你。基米。

斯威克斯 [01:15:25]:为他们高兴。

斯威克斯 [01:15:26]:是的,说到Kimi,对吧,就像另一个研究生一样,突然吐出来,说,是的,我就是有那种Kimi delta的关注,想要——我想努力改善。

Vibhu [01:15:36]:是的。是的。

斯威克斯 [01:15:36]:而且,居然还能成功拍出《登月》。我还是不明白。

张亚历克斯 [01:15:41]:是的。嗯,他,至少据我了解,他非常疯狂。我觉得总体来说,很多中国实验室做过很酷的工作。

Kimi群、动态工作流程与融合

斯威克斯 [01:15:51]:是的。

张亚历克斯 [01:15:51]:是的。

Vibhu [01:15:52]:大家对Kimi特工蜂群有什么看法?

张亚历克斯 [01:15:55]:是的。我想说的是,OpenAI对他们的代理群体所做的事情,显然是正确的做法。你得这样想。比如说,没有什么,尤其是没有非常智能的线束设计,我觉得到目前为止没人真正做到过,没有什么能轻松免费得到。

比如,代理集群设计不是你能理所当然的。也不是说GPT-6 Astra特别聪明,然后它就让代理集群运行良好。他们显然经过了训练。Hugging Face事件就是他们训练了一个系统,让它像集群一样。

我认为,他们显然做得非常好,以至于你可以投入4000万美元解决一个未解决的问题。我觉得关于Kimi特工群体的设定,至少从我读到的感觉是,这很有趣,但我其实不知道这是否能解决什么新问题。

斯威克斯 [01:16:59]:是的,他们就是。他们说,“它给你做电子表格。”

张亚历克斯 [01:17:01]:他们当时就说,是的,这里有一个群,做一些事情,挺酷的。但是。我对动态工作流程也有同样的看法。我其实觉得动态工作流程的发布有点失败。

我不知道你们怎么看,但我觉得它......据我了解,它并不常用,或者说,像是

斯威克斯 [01:17:21]:只是价格非常高。

张亚历克斯 [01:17:22]:太贵了,而且太像

斯威克斯 [01:17:22]:这是极致的代码。基本上就是,占用我的床。

张亚历克斯 [01:17:26]:我试过,但它的表现并不像那种。我不是那种超级粉丝,但我觉得他们做的真的很厉害。他们居然让这个群体真的能行动起来

斯威克斯 [01:17:41]:我明白了

张亚历克斯 [01:17:42]:朝着目标前进。没错。

斯威克斯 [01:17:44]:我明白了。

张亚历克斯 [01:17:44]:这非常困难。

斯威克斯 [01:17:45]:我明白了。所以,多智能体群体的效率是这里的目标函数。

张历克斯 [01:17:51]:是的。

斯威克斯 [01:17:51]:右?

张历克斯 [01:17:51]:是的。

斯威克斯 [01:17:52]:这有多少是杂质?真的是很多杂质。

张亚历克斯 [01:17:55]:是的,我觉得是。

斯威克斯 [01:17:55]:OpenAI更少草率。

张亚历克斯 [01:17:56]:我们理所当然地理解群体汇聚到答案的意义。

斯威克斯 [01:18:00]:是的。

张亚历克斯 [01:18:00]:就像。这不是我们理所当然的事情。

斯威克斯 [01:18:02]:是的。是的。我们做过一个播客,和诺姆·布朗还有他的

张亚历克斯 [01:18:06]:哦,是的,我记得。是的

斯威克斯 [01:18:06]:他的风格。他的整个理念是,好吧,我们合作过很多有竞争力的经纪人。我们正在合作的经纪人。

张亚历克斯 [01:18:13]:是的。

斯威克斯 [01:18:13]:现在这叫做蜂群。

双子座、GDM与大规模线束工程

张亚历克斯 [01:18:15]:是的。

Vibhu [01:18:15]:我会简单戳一下。你对双子座有什么看法吗?我觉得它们也是金牌。曾经有一段时间,他们让经纪人讲道理,持续了很长时间。

张亚历克斯 [01:18:26]:是的,

Vibhu [01:18:28]:会不会太老了,不值得去想?

张亚历克斯 [01:18:29]:没有。我觉得有点被夸大了。比如,双子座。再说一次,我得先说明我没在这些地方工作过,所以请你打个折扣,好吗?

Vibhu [01:18:39]:你对特工线束有强烈的看法

张亚历克斯 [01:18:42]:是的

Vibhu [01:18:42]:而这

张亚历克斯 [01:18:43]:但让我先说一句。这份工作真的很令人印象深刻。我觉得他们在这里展示的是,他们在模型还不够好的时候,花了一段时间

Vibhu [01:18:53]:是的

张亚历克斯 [01:18:53]:他们对线束的作用非常聪明。我记得至少这次,是的,像AlphaGeometry,我想那是在这之前一年,但那真的很酷。

他们把它发挥到了极致,设计了,我也说不上来。我本来想说我不太喜欢竞技数学,但我觉得GDM有点可惜。我和所有关于GDM聊过的人都有类似的看法,就是它太官僚了。

无论他们什么都有能力和资源做几乎任何事,但,我不知道,直到他们弄清楚这部分。比如说,我并不反对反重力,但我不认识用反重力的人。

所以我试过一次,结果......我看不出有什么理由换成它。我想不知为何,他们一直在为此挣扎,所以,是的。

斯威克斯 [01:19:40]:是的。很多人在Meta上坚持了很久,直到他们开始

张亚历克斯 [01:19:44]:是的,他们恢复了

斯威克斯 [01:19:44]:要出来了。我觉得谷歌现在正处于那个阶段。

张亚历克斯 [01:19:47]:是的。

斯威克斯 [01:19:48]:而且,就是你得活下去

张亚历克斯 [01:19:51]:是的。

斯威克斯 [01:19:52]:我想重新专注于

张亚历克斯 [01:19:53]:是的

斯威克斯 [01:19:53]:只是,说说你的想法,就一般性。我们可以谈谈投机性PTC

推测PTC与并行工具执行

斯威克斯 [01:19:58]:天才管理不善,或者干脆把这些都扔掉,随便聊别的。

张亚历克斯 [01:20:03]:好吧,我们来聊聊“管理不善的天才”。

斯威克斯 [01:20:06]:是的。

张亚历克斯 [01:20:06]:我唯一想说的是,关于推测性PTC,这个想法非常简单。这几乎是显而易见的,应该做这个,而且也没什么好说的了。

我觉得你应该直接用它来编程。比如任何带有程序化代理调用的东西,比如RLM或柯达,是的,这简直是显而易见的选择。

Vibhu [01:20:25]:对于没读过的人来说,什么是

张亚历克斯 [01:20:27]:是的

Vibhu [01:20:27]:大家的一句台词是什么?

张亚历克斯 [01:20:29]:很简单,当模型在写代码,或者写完代码后,很多工具通常是顺序的,或者你得等它们,所以你应该提前启动它们。

比如,如果你能快速编译这些代码,你大概能弄明白,虽然是变量什么的,但你也能弄明白。

斯威克斯 [01:20:52]:是的,静态分析。

张亚历克斯 [01:20:53]:是的。所以

Vibhu [01:20:54]:猜测。

张亚历克斯 [01:20:55]:是的。有人指出,实际上有些学者,尤其是PL,比如编程语言的人,有一些非常酷的方式来做这件事。所以,也许有一天我会,去做这个。

斯威克斯 [01:21:09]:我想大多数时候你得换语言,因为如果你用的是JavaScript或Python,你做不到这些。

张亚历克斯 [01:21:13]:是的。是的。

斯威克斯 [01:21:14]:所以,比如说,哈斯克尔,是的。那个,什么,哪个,哪个是正常的,不是哈斯克尔?

张历克斯 [01:21:21]:口齿不清。

斯威克斯 [01:21:22]:Lisp,OCaml。

张亚历克斯 [01:21:24]:OCaml,哦,是的。

斯威克斯 [01:21:25]:是的,任何函数式语言

张亚历克斯 [01:21:25]:是的

斯威克斯 [01:21:25]:你其实可以把这个流程化。

张亚历克斯 [01:21:27]:是的。

斯威克斯 [01:21:27]:所以如果你想用TypeScript,就选Effect-TS。

张亚历克斯 [01:21:29]:是的。

斯威克斯 [01:21:30]:好,我们可以切换到,

Vibhu [01:21:32]:我喜欢这个图示。

张亚历克斯 [01:21:33]:是的。

斯威克斯 [01:21:34]:这就像你们的全部论点,对吧?

能力过剩:可靠的长期工作

斯威克斯 [01:21:36]:对我来说,这有点像是重新陈述,但也许我漏掉了什么

张亚历克斯 [01:21:41]:是的

斯威克斯 [01:21:41]:比如,去做更强的线索,或者如果你更努力,模型其实能做得更好,所以这是技术问题。

张亚历克斯 [01:21:48]:是的。基本上是这样。我觉得有一件事我想看到。我很欣赏大家对“锯齿状智能”的关注,因为它描绘了一个大局,比如说,只要我们真的下定决心,我们就能做到。

但我有点希望。也许学术界的人应该做这件事。真的坐下来想想,如果我选了Astra,即使是现在的前沿模型,也无法在一个月的时间内持续且好好地完成一项工作。

我觉得这是个愚蠢的问题。我真心觉得我们可以解决这个问题。你不需要成为前沿实验室,做那些花哨的IPO项目。我觉得这些模特太聪明了,即使这有点傻,我觉得这确实是个技能问题,你能不能让模特和一个18岁的高中生一样好

张亚历克斯 [01:22:50]:做点工作。我觉得我们做不到这点很荒谬。确实如此。部分原因是,语言模型的格式其实不太适合这样,但我觉得你可以围绕它设计一个框架来实现它。

我觉得,这本身就是在忽略RLM的内容,忽略了所有那些我们应该用什么抽象?我只是觉得有人可以设计一个能够实现这个功能的框架。比如,我,那个。

也许是

斯威克斯 [01:23:13]:你说做这件事,做什么?

张亚历克斯 [01:23:15]:做一些长期但简单的任务,并且要可靠地完成。

斯威克斯 [01:23:20]:好的。

Vibhu [01:23:20]:举个例子?所以这和那种,比如说选你最喜欢的公司,像 Harvey 举例,使用大语言模型来做法律工作,还是有什么不同?

Alex Zhang [01:23:30]:我想这有点像那样,只是如果瓶颈不是某种法律知识之类的东西。比如,我不知道。比如说,

Vibhu [01:23:38]:我猜,比如说,就像这些例子,人们可以拿模型去搭建流程或者其他什么,然后让一个代理反复做它们想做的事情,对吧?

Alex Zhang [01:23:47]:是的。比如说,如果我想要一个通用系统,我可以跟它交流。我可以像跟实习生说话一样跟它说话,基本上只是让它去做一些事情,探索一些小的事情。

举个例子,这可能是一个非常傻的自动研究,也许就是一个例子,不一定是找到非常新颖的解决方案,但至少能够优化任何问题中所有简单的部分。

它们通常会过度偏重于机器学习训练之类的事情。但对,我也不太确定,也许这不是特别清楚,但很多人的一般工作流程中,你可能只需要随便写一点代码,就能搭建一些特定的工具来帮你做,比如自动化这件事。

一些例子是自动查找研究论文之类的东西。但通常人们会设计一个专门的代理来帮他们做这种事情。或者他们会搭建一个工具,然后直接运行它,或者像他们的Slack机器人之类的工具。

但我几乎觉得有一种标准形式,就像一个你直接可以插入的工具。你不需要——它不需要专门设计用于找论文或者别的什么,你只是告诉它,帮我找这个,然后把它插入到那个环境里。

我的意思是,我认为有很多简单的事情是可以自动化的。而

Vibhu [01:25:13]:这像是关于能力过剩的假设还是一个观点?就算我们暂停,现有模型的状态仍然可以产生很大的影响吗?

Alex Zhang [01:25:22]:在某种意义上,是的。比如,我想我展示的可能是这种情况最简单的形式。但这里的意思有点像,我们在很多事情上都有参差不齐的智力。

比如,模型在编程和数学方面的能力相对过强。这就是说,我们可以把这些能力转化到许多其他事情上。比如说,如果你拿一个IMO金牌得主之类的人去应用到很多不同的问题解决领域,他们通常能解决问题。

我实际上不知道这是否也适用于模型。例如,在GPU代码优化方面,一个非常有趣的问题是——如果你把模型中的所有GPU编程数据都去掉,但模型本身保持像现在的Astra一样优秀,只是去掉这些数据,它还能够优化GPU内核吗?

它能否在上下文中大致学习它需要学习的内容,然后有某种流程或者提出一些解决优化任务的方案?我觉得这之间存在一种不匹配,比如,如果你拿一个像Astra一样聪明或者知识丰富的人,这个人能做的和Astra能做的之间存在差异,可能需要某种工具来辅助。

我认为我们实际上可以更接近地模拟这种人类能力。

持续学习与通用问题解决

Swyx [01:26:42]:对我来说,这听起来非常接近持续学习的问题。我认为你正在

Alex Zhang [01:26:46]:那是最好的例子。是的。

Alex Zhang [01:26:48]:是的。

Swyx [01:26:48]:那你干嘛不直接说呢?

Alex Zhang [01:26:49]:是的。我想我

Vibhu [01:26:50]:我就像,我就像在想,我能不能就像脱口而出一些像“学习”这样的词?

Alex Zhang [01:26:54]:我对此很小心。但没错,我

Vibhu [01:26:57]:你有一只非常的眼睛。

Alex Zhang [01:26:58]:也许,也许,就像有点,我不知道,就像

斯威克斯 [01:27:03]:没有。所以我觉得你其实是个,是的,我不知道,其实我不太了解你的本科。你一般是数学派吗,还是

张亚历克斯 [01:27:09]:有一点,是的。是的。

Vibhu [01:27:09]:你学过数学吗?

张亚历克斯 [01:27:11]:是的,至少我就是这么想的。

斯威克斯 [01:27:12]:就像范类论那种抽象,你用类别思考,然后必须把它转化为具体的范畴。但实际上你会更关心范畴。

斯威克斯 [01:27:24]:这就是沟通上的错误,因为大家都在听具体内容,但实际上也在努力传达整体情况。

张亚历克斯 [01:27:31]:是的。

斯威克斯 [01:27:32]:这很难。我也不太清楚。你可以用一个简写,比如,“好,我现在在二级,然后我要升到三级,再回到二级。”我们应该用类似“认识”这样的简写来形容这类事情。

张亚历克斯 [01:27:45]:是的。

斯威克斯 [01:27:45]:因为这很难。就像你一样,你在词后把很多东西压缩进去,就像顺序解码一样。

斯威克斯 [01:27:51]:我们应该转换成Neuralese吗?有没有比英语、Python或JavaScript更好的输出形式?我不知道。

神经语言、编程语言与扩散思维

张亚历克斯 [01:28:06]:是的。

斯威克斯 [01:28:06]:这有点像是个垃圾帖子,但人们猜测,比如模型想要输出的母语是什么?

斯威克斯 [01:28:14]:有人说二元。那是马克·安德烈森的风格。我不知道。是的。

斯威克斯 [01:28:19]:PTX?

张亚历克斯 [01:28:20]:假设是英语和Python的混合。我之所以这么说,是因为模型的能力在某种程度上反映了我们训练它们的基础。

所以我们仍然想要类似的。是的,我不太认同二元论证。我想我,我理解,但这就像

斯威克斯 [01:28:40]:是的。你想以某种方式塑造这个世界。我认为,

张亚历克斯 [01:28:43]:是的。

斯威克斯 [01:28:43]:我想提一点,那就是我总是在这种对话中做的Sapir–Whorf,也就是说,如果你选择英语,你就会锁定在英语存在的时间里,比如说五百年,其实并不算太久。

实际上,就像你说的一样,你说的语言会限制你的思维方式。

斯威克斯 [01:28:59]:比如说,如果你学另一种语言,有人在中文里,我们没有时态。我不知道你有没有。其实我之前不知道。而且我会说中文。

张亚历克斯 [01:29:09]:哦。我知道,但我的中文不太好。

斯威克斯 [01:29:12]:好的。

张亚历克斯 [01:29:13]:是的。

斯威克斯 [01:29:13]:是的。或者说,比如说,用日语,或者,我知道,我忘了是什么语言。比如在韩语里,你和所有人说话,是的,你都得承认社会地位。

张亚历克斯 [01:29:23]:是的。

斯威克斯 [01:29:24]:但这和性别是不同的维度,对吧?它就像,它影响你做的一切。当我上Ling 101时,显然非洲有一种语言,有一种植物性别。

是的,对吧?就像你一样。或者爱斯基摩人根本不知道“雪”之类的词。总之,你采用的语言会影响你的思维。如果你选择用英语输出你的思维链,你就是偏向英语能解决的问题。

我不知道英语的先验是什么。

张亚历克斯 [01:29:51]:这很有趣。我之前没这么想过。

Vibhu [01:29:55]:在某种程度上,这很有趣,对吧?所以你说语言问题是对的。很多思维模式也会波动语言。

Vibhu [01:30:03]:最明显的例子是中国模型说英语时,可能仍然用中文推理。但在同一层面,大多数模型在多语言方面都非常有能力。

Vibhu [01:30:13]:我们可以看到这种适应,你可以加入语言。添加一整门语言其实没什么大不了的,但

斯威克斯 [01:30:18]:是的。

Vibhu [01:30:18]:他们会互相推理

斯威克斯 [01:30:21]:是的。所以我们都是自回归的。但也像

Vibhu [01:30:23]:右。

斯威克斯 [01:30:23]:比如说德语,比如主宾、一致,你得把动词放在结尾,这非常非常烦人,非常出名。是的,没错。你直到最后才知道自己在做什么,比如“哦,那一团名词,然后是动词。”最经典的例子是《降临》,里面的七足人认为时间对他们来说是平坦的。

所以他们会一次性输出整句话。这最接近自回归和扩散的区别。

斯威克斯 [01:30:55]:我们用自回归来来说话。如果你能用扩散法来说,事情会随着时间自然解决呢?

张亚历克斯 [01:31:01]:我明白了。我明白了。

斯威克斯 [01:31:02]:但整个想法会一下子出现。

张亚历克斯 [01:31:05]:我明白了。

斯威克斯 [01:31:07]:所以这是一种截然不同的语言,但它确实是一种语言。

张亚历克斯 [01:31:10]:我明白了。哦,那真有趣。真有趣。

斯威克斯 [01:31:12]:比如说,机器可以说话,我们可能永远不会说,但机器确实不在乎。

张亚历克斯 [01:31:19]:也许这是个大题外话

斯威克斯 [01:31:20]:是的

张亚历克斯 [01:31:20]:但难道不存在本质上是自回归的推理链吗?

斯威克斯 [01:31:30]:是的,时间。

张亚历克斯 [01:31:30]:有时候,比如。是的。或者说,是的。

斯威克斯 [01:31:32]:是的。先发生了什么,然后又发生了别的。

张历克斯 [01:31:34]:甚至,比如说,任何代码里的东西,通常至少必须是因果的。

斯威克斯 [01:31:40]:嗯,不是。所以是A。那你必须去做。那你就没有探索足够多,

张亚历克斯 [01:31:44]:确实如此。是的

斯威克斯 [01:31:45]:编程语言理论,所有东西都是纯函数式的,完全关系式的,你会抽象化那些将关系转化为代码的求解器。所以我,是的,我觉得这可能有点超出我的理解范围。

RLM之后会有什么?

张亚历克斯 [01:32:01]:不,不过挺有意思的。是的。

斯威克斯 [01:32:01]:但我喜欢编程语言还是人类语言,我确实经常思考这如何影响推理和我们能做的事情的边界。我不需要多说。我不知道你还有没有其他想法。

我最后的问题是,你有那么多研究和方向想做。你经历过GPU模式阶段。你经历过RLM阶段。

斯威克斯 [01:32:25]:大概你还有其他计划,所以才没加倍坚持。顺便说一句,我注意到你们一开始是从GPU端开始,然后转向零梯度,这就是申友所说的。

这感觉不比玩GPU还不那么正规吗?

张亚历克斯 [01:32:44]:是的,我想是那种意思。所以你提到了,我喜欢用数学的方式思考事情。

斯威克斯 [01:32:51]:类别,是的。

张亚历克斯 [01:32:52]:有时候做安全带和药剂工作真的很不舒服,因为太难了。

斯威克斯 [01:32:57]:因为你以为所有背带都一样。

张亚历克斯 [01:32:58]:是的。所以感觉非常模糊。

斯威克斯 [01:33:00]:所以,你就像是,两个新点子都装在安全带上。明白了。

张亚历克斯 [01:33:01]:是的。而且,从经验上讲,至少在我们现有的计算能力下,很难验证很多发现。但我认为我之所以转向了这些问题,是因为我认为这其实是大部分创新尚未发生的地方。

对我来说,GPU层面是探索其他想法的手段。比如,你想提升写内核的能力,或者自动化内核编写,以实现更广泛的目标,比如我想探索那些不受系统挑战限制的想法。

从这个意义上说,我想那里写的很多内容都是基于利用器的内容,但我也对模型层面的东西感兴趣。但我就先说到这里。

斯威克斯 [01:33:48]:好的。

张亚历克斯 [01:33:48]:是的。

斯威克斯 [01:33:48]:这是个好提示。任何事,任何事。如果有人想联系你,你想寻求什么帮助?你希望合作者做什么?有没有什么行动号召?

合作调研并选择大额投注

张亚历克斯 [01:33:58]:是的。所以,我想我没有特别觉得需要和别人合作的项目,除非是,比如说。除非是在某个公司,比如计算机部门之前,或者,像是,和其他人聊聊这件事。

但我可以说我不是。我从不反对和别人一起做点子。我经常会被本科生甚至其他学生联系。

斯威克斯 [01:34:22]:播客主持人。

张亚历克斯 [01:34:23]:播客主持人。通常我会收到一封邮件,大意是“我真的很喜欢RLM”。比如,“我想一起工作。”我觉得我

斯威克斯 [01:34:33]:是的,这联系方式不好,对吧?

张亚历克斯 [01:34:35]:是的,是的。

斯威克斯 [01:34:35]:最糟糕的是,“我能向你请教吗?”

张亚历克斯 [01:34:36]:是的。

斯威克斯 [01:34:37]:然后,“看什么?”就像,“看看我的论文,伙计。”就像。

张亚历克斯 [01:34:39]:他们会说,“我看过你的论文”,比如“递归语言模型”,或者“Prime Agent”,类似自我改进的RLM工具什么的。

这有点像我喜欢的。我真的很喜欢有主见的人,即使我们意见不同。我觉得如果你有强烈的观点,并且能够思考为什么你认为这些观点是对的或错的,因为通常很难真正判断。

但你对某些问题有坚定的信念。我总是乐于聊天,甚至有可能一起合作。我对想做什么或谁没有限制。所以,是的。

斯威克斯 [01:35:12]:没有限制?

张亚历克斯 [01:35:13]:是的。在代理时代,我觉得你能做的工作更多,比如带宽方面。所以我。是的。我觉得总体来说,我不难让人印象深刻,但我觉得这需要一点努力

斯威克斯 [01:35:30]:是的

张亚历克斯 [01:35:30]:算是吧。是的,知道吗

斯威克斯 [01:35:32]:是的

张亚历克斯 [01:35:32]:知道你想要什么。

斯威克斯 [01:35:32]:非常清楚。当你看到一个新东西出来,执行得好,简单又好,然后,明白

张亚历克斯 [01:35:40]:是的

斯威克斯 [01:35:40]:立刻吸引你的注意,对吧?

张亚历克斯 [01:35:41]:我会很兴奋。是的。

斯威克斯 [01:35:42]:其实,要获得和所有边疆实验室的人一样的关注并不难

张亚历克斯 [01:35:45]:是的

斯威克斯 [01:35:45]:因为他们在找你。你只需要主动出击,对吧?

张亚历克斯 [01:35:48]:没错,没错。

斯威克斯 [01:35:49]:但没错,这是真的。我得说,我觉得现在人类的关注非常稀缺,而且我确实很难应对自己手头的项目数量。

斯威克斯 [01:35:57]:而且,我不知道该怎么管理。我觉得经纪人一点帮助都没有。

斯威克斯 [01:36:00]:比如,我会直接提示它。我会提示一个东西,然后从不去看它。

斯威克斯 [01:36:03]:右?这很常见。

张亚历克斯 [01:36:05]:是的。

斯威克斯 [01:36:05]:是的,这很糟糕。

张亚历克斯 [01:36:06]:我想,也许是......一个小的区别,比如。其实,也许你在做研究。我不确定。但至少对我来说,我大概有10到15个不同的想法想做,但问题是,大多数都很糟糕。

斯威克斯 [01:36:20]:是的。

张亚历克斯 [01:36:20]:这也许对那些主动联系我的人来说也适用。也许这个想法其实不好,但我觉得挺有趣的。所以,我们可以花些时间去研究,如果我们觉得真的有点什么,那我们就......我们应该花接下来的几周时间,真正去追求它。

这就是我的风格。顺便说一句,这就是我喜欢博士的原因,因为有时候我只是想着问题,比如跑步或者打网球什么的。我不是在工作,我想。

但那是最有趣的时候,当我真的对某件事感到坚定时,我就会放下一切,直接去做。

张亚历克斯 [01:36:52]:就是,把所有时间都花在思考和解决这个问题上。然后,一旦你到了可以直接做实验的阶段,那就有点轻松地又能顺利应对了。

科学作为下一个前沿

斯威克斯 [01:37:03]:是的,抱歉。这是

张亚历克斯 [01:37:04]:是的。没问题

斯威克斯 [01:37:04]:比如倒数第四个问题,我觉得很多人也把科学当作下一个前沿,比如物理科学、生物、数学。你怎么区分,比如说,你选择的项目适合工业界,然后也许选择项目就是科学?

张亚历克斯 [01:37:27]:其实我在读博士前也做过类似生物相关的人工智能相关工作。这个领域从那时起变化很大

斯威克斯 [01:37:33]:是的

张亚历克斯 [01:37:34]:我得这么说。

斯威克斯 [01:37:34]:因为这,就像,以前是理论上的,当然,你什么意思?我只有一条路,然后

张亚历克斯 [01:37:39]:是的

斯威克斯 [01:37:39]:我选择了这个。但现在很多人正在跨界。

张亚历克斯 [01:37:41]:是的。

斯威克斯 [01:37:41]:所以我们开了一个科学播客专门讲这些

张亚历克斯 [01:37:44]:哇哦

斯威克斯 [01:37:45]:因为很多工程师会说,“其实这里面有可解决的问题。”

张亚历克斯 [01:37:50]:是的。我先声明,我对很多这些话题的理解可能都比较有限。但我觉得,如果有人联系我,或者我看到一个问题,我会觉得,“嘿,我们现在用的一些设计原则,或者我们现在思考的一些,实际上对这个问题很有意义”,我也会对这些感到兴奋。

但我觉得这更难。我不知道。我觉得是这样。我觉得科学,尤其是像实证科学或应用科学那样,有很长的历史,叫什么来着?比如反馈循环之类的。

斯威克斯 [01:38:23]:是的,这归结为机器人学的问题。

张亚历克斯 [01:38:25]:是的。对我来说,还有一个方面,比如现在什么值得花时间去赌?因为,也许我花了很多时间在这个问题上,然后六个月后,会有不同的解决方案,比如说,可能有新型号出现,“哦,这方面好多了。”所以我确实得小心。

我得有意识地思考你觉得事情可能会走向哪里。

斯威克斯 [01:38:47]:是的,完全正确。

张亚历克斯 [01:38:47]:所以,是的。

斯威克斯 [01:38:48]:发布周期。

张亚历克斯 [01:38:49]:是的。所以

Vibhu [01:38:51]:这样我就可以告诉ARC-AGI-3,它已经饱和了。我们成功了。

张历克斯 [01:38:54]:是的,ARC-AGI-3不到一年就被饱和了,所以这有点?就是,就是这样。我不知道。如果你是实验室在挑选这个问题,你现在可能会有点难过,因为实际上

斯威克斯 [01:39:04]:是的。嗯,完全正确。这就是为什么知识、游戏、这些东西都被充斥了。

张亚历克斯 [01:39:08]:是的。

斯威克斯 [01:39:08]:现在,科学实际上是前沿。所以

张亚历克斯 [01:39:09]:是的。

Vibhu [01:39:10]:知识工作已经饱和。

斯威克斯 [01:39:12]:是的。GDP估值大概是80多、90多。

斯威克斯 [01:39:16]:比如说,有90%到100%的成功率显然会被

张亚历克斯 [01:39:20]:这真的很难判断

斯威克斯 [01:39:21]:十年。但是,嗯,下一个容易实现的目标是

张亚历克斯 [01:39:25]:这很合理

斯威克斯 [01:39:25]:其他的。

张亚历克斯 [01:39:26]:是的。也许我会多考虑一下。其实,我没怎么想过

斯威克斯 [01:39:30]:其实我只是想猜猜你下一步的方向。

张志 [01:39:32]:没有。我得说,因为我觉得尤其是在麻省理工学院,那里有很多非常有才华的自然科学科学家。我觉得,这有点像亵渎,说“我要弄明白你的问题”。

就像

斯威克斯 [01:39:45]:不,事情就是这么做的。

Vibhu [01:39:46]:很棒。

张亚历克斯 [01:39:46]:哦,不,我知道。是的。

斯威克斯 [01:39:47]:所以我采访了做IMO那件事的Yitai。他就像

张亚历克斯 [01:39:50]:哦,是的。哦,是的。

斯威克斯 [01:39:50]:“我从来没去过,我觉得我从没去过。我甚至不知道那是什么。”这是个技能模型,伙计。

Vibhu [01:39:55]:是的。

斯威克斯 [01:39:56]:这很不尊重人,但随便吧。但这就是原因,是的。

Vibhu [01:40:00]:是的。某个时候,你得尊重,好,进步正在发生。

Vibhu [01:40:05]:比如,数字是输出的,对吧?

张亚历克斯 [01:40:07]:没错。是的,没错。

斯威克斯 [01:40:08]:是的。这是一个非常重要的教训。这很有趣,因为数学家们现在正以这种方式回应NARI系统。

张亚历克斯 [01:40:13]:右。是的。

斯威克斯 [01:40:14]:比如,特里·特恩斯托就像

Vibhu [01:40:15]:特恩斯托

斯威克斯 [01:40:16]:“不,就是,我们别用人工智能。”

张亚历克斯 [01:40:17]:是的。

斯威克斯 [01:40:17]:我当时想,“嗯,我不知道。”

张亚历克斯 [01:40:19]:嗯,是的。我觉得这整件事有点奇怪,因为我觉得如果他们很多人在这一切发生前没有和OpenAI合作,他们的案子会更有说服力。

斯威克斯 [01:40:30]:不,那是人身攻击,他们真的想避开。那又怎样,对吧?

张亚历克斯 [01:40:34]:那又怎样?是的。

斯威克斯 [01:40:35]:我也不知道。那又怎样?他们有。他们有合作。我和不合作的人合作

张亚历克斯 [01:40:39]:我想这是真的

斯威克斯 [01:40:39]:我不同意,也不同意

结尾:研究、学术界与未来展望

张亚历克斯 [01:40:40]:确实如此

斯威克斯 [01:40:40]:随便吧。

张亚历克斯 [01:40:41]:是的。确实如此。

斯威克斯 [01:40:41]:或者,比如说,我做了一件事,现在后悔了。我改变主意了。随便吧。

张亚历克斯 [01:40:45]:是的。

斯威克斯 [01:40:45]:所以我会为他们说这些话的权利辩护。但说实话,很多人确实有合理的分歧。

张亚历克斯 [01:40:50]:是的。

斯威克斯 [01:40:51]:好的,太好了。感谢你加入我们。恭喜你迄今为止的成功。真不敢相信你博士还没完成。

张亚历克斯 [01:40:58]:嗯,是第二年了?

Vibhu [01:41:00]:是的。真不敢相信我们做这个播客时没看过现实学习论文。

斯威克斯 [01:41:05]:他有一个定义。

张亚历克斯 [01:41:07]:我觉得这篇论文更侧重于实证结果。其实,这个想法其实很简单。

Vibhu [01:41:11]:是的。你也谈过很多次。

张亚历克斯 [01:41:13]:是的,目前来看。我觉得现在有更多有趣的事情可以关注。

Vibhu [01:41:17]:酷。

张亚历克斯 [01:41:17]:是的。

Vibhu [01:41:18]:我们很期待你接下来的表现。

张亚历克斯 [01:41:19]:非常感谢。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论