AI 时间线预测新方法:用编码效率提升和收入替代时间跨度
简而言之;总结:我们的时间表变化不大(稍微缩短了),但建模和证据基础明显提升,所以我们更有信心了。
摘要
我们计划随着新证据和新分析的出现,定期更新人工智能时间线预测。今天的“Q2”更新因发布紧迫而推迟AI 2040:计划A, 我们的国内监管博客文章以及实施和记录模型变更所需的时间。
原版人工智能未来模型预测自动编码器(AC)何时会被开发,而领先的人工智能公司宁愿解雇其人类软件工程师也不愿放弃AI编码,将何时出现。
METR对编码时间范围的测量.(更准确地说,时间视界锚点用于设置有效计算空调必修)。虽然这种方法可用,但存在巨大弱点,包括:(a) 不清楚哪个时间视野对应于AC(甚至不清楚是否有有限值);(b) 人们对时间视野趋势作为有效计算函数应达到超指数的程度存在强烈分歧,可能导致截然不同的预测。
因此,我们一直在寻找其他设定AC所需有效计算量的方法,现在我们有两个候选方案:编程提升(即AI为AGI公司软件工程师带来的加速程度)和收入.编码提升是我们最喜欢的方法:基本思想是估计该数量的倍增时间(提升 - 1),并推算到达到AC级提升为止。
该我们如何锚定模型使用与抬升相关的估计有点复杂,所以我们先解释一个更简单的方法三参数抬升模型这也给出了类似的结果。对于编码提升,AC 对应的数值比时间视野的不确定性要小得多,虽然我们也预期编码提升会有一定的超指数效应,但这远不如时间视野重要。
令人惊讶的是,这三种方法预测的交流抵达日期都非常相似.[1]我们认为这对我们预测的稳健性来说是一个一定的鼓舞信号,尽管我们仍然非常不确定。
你可以在以下网站探索该模型的抬升锚定版本aifuturesmodel.com以及第二张图顶部下拉菜单显示的其他交流预报选项。
每位作者都为三种AC锚定方法赋予权重,模型将其汇总成整体预测。我们也重新评估了AI 2027的预测;现实似乎正以AI 2027预测的速度发展70%到90%。
综合以上所有因素,我们最新的综合时间线预测如下:(链接)
以下是我们近期预测的变化:
https://www.datawrapper.de/_/4aHow/
我们描述了附录:
- 自2021年以来,我们的AGI预测发生了怎样的变化.
- 我们更改了模型考虑到需要培训以应用软件改进,从而降低极快起飞的可能性。
- 一些作者小幅调整我们澄清,我们的预测是以技术上可行的速度为条件。
- 我们做了一些小幅变动模型和网站代码。
一个用于预测自动编码器何时到来的三参数提升模型
预测交流电到达日期的一个简单方法是假设(编码提升-1)呈指数增长。我们认为这是预测交流电何时到来的最佳简单模型。
具体来说,该模型以3个参数为输入,列出Daniel的中位估计值:
现代编码提升,即因人工智能辅助带来的加速因素:2倍。Daniel认为1.04x类似于一个下界,基于METR研究结果显示,提升率为1.04倍到1.2倍,METR认为这些数字因选择效应而向下偏颇(如果人们认为人工智能对自己有用,参与研究的可能性较低)。
否则,他正在整合各种证据来源,包括2026年4月人类内部调查几何均值为4倍,Ryan Greenblatt私下估计AI研发劳动力增长为1.7倍(这是对整体AI研发劳动力的估计,所以纯编码的估计会更高)。
当前数量翻倍时间(提升-1):5个月。根据Anthropic员工调查,编码增长在7个月内从1.25倍增长到4倍。[2]这将是一个大约2个月的提升翻倍时间,但如果修正Mythos高于长期Anthropic ECI趋势,则是~3.5个月的翻倍时间。
[3]
现在,他们的员工可能有偏见,高估了编码的提升。但除非偏向随着时间显著增加,否则在不到一年内Uplift-1的翻倍时间仍然超过三倍——共计3.6个月的翻倍时间!
丹尼尔的中位数更长,是5个月,因为他部分听从了他尊敬的其他研究者(Eli和Ryan)的看法,而他们的主观感受是倍增时间更长。
对应AC的抬升:20倍。完整的AI未来模型显示中位数为32倍,但我们预计实际提升幅度略低,因为模型未考虑AI在完成编码任务时效率低于人类。
比较丹尼尔的中位数估计与伊莱和布伦丹的:
https://www.datawrapper.de/_/ts1bS/
该简单模型外推上升趋势(假设翻倍时间保持不变,即趋势呈指数增长)[4]并观察其达到对应交流的抬升。
这个方法怎么说?参见ac-arrival.vercel.app一个氛围编码的应用,你可以玩玩简单的推断。
参见下图对于更复杂的版本,使用当前的提升和提升倍倍时间作为锚点,用于设置完整AI未来模型的行为。完整模型中考虑的因素包括:
- (uplift-1)倍增时间随时间缩短,因为自动化编码任务的比例被建模为一条渐近曲线大于1的逻辑曲线。(如果渐近线正好是1,那就意味着总会有一些重要的编码任务人类比人工智能做得更好,我们认为这不现实;最终人工智能会能够完成所有这些任务。)然而,即使在完整模型中,当远离交流时,趋势也近似呈指数。
- 人工智能研发自动化、人类劳动趋势和计算趋势导致的有效计算增长率变化。
完整模型中,AC的提升并不是作为参数,而是根据模型行为推断出来的。
为AI未来模型添加提升和收入锚点
接下来我们将讨论如何利用提升和收入估算来估算AC所需的有效计算,方法是基于AI未来模型。
我们的总体预报是分别使用每种方法,然后通过加权混合法汇总结果。你可以在以下网站探索该模型的抬升锚定版本aifuturesmodel.com以及第二个图表顶部下拉菜单的收入(及时间范围)选项。
我们给出以下权重:
https://www.datawrapper.de/_/1ycZM/
我们给予提升最高权重,因为(a)对应的AC值比收入或时间视野更清晰,(b)提升-1的轨迹在对数(有效计算)中似乎更接近指数,而非时间视野。
相对于提升,时间范围的主要优势是它更可衡量,而相对于收入的主要优势是它更直接地衡量编码能力。
抬升
我们的模型已经发布了关于编码提升的预测,所以我们并没有像另外两种方法那样拟合全新的函数和AC要求。
AI未来模型(AIFM)中有一个模块,汇总了人类劳动力和人工智能代理,在每个能力层级产生估算的“总编码劳动力”(因此也算出了估计的编码提升)。
该模块通常通过三个自由度进行校准:
- 一个被当前的抬升压制住
- 另一个参数则决定了编码任务难度分布的“形状”(例如,是否存在一个长尾能力水平,使得人工智能尽管能以更低能力完成大多数任务,但还无法完成所有任务?还是说自动化更多是“同时”发生的?)
- 最后一个自由度是能力水平(在有效计算或ECI)在AC的定义真正成立时,也就是说,当AI能够完成全部任务时,你宁愿只雇佣AI,而不是只雇佣人类。
在时间范围和收入模式中,我们会利用其中一个趋势来确定第三自由度的能力水平。在提升模式下,我们不直接指定对应于AC的能力水平,而是通过指定当前编码提升的速率来限制剩余的自由度(具体来说,提升的倍增时间为1)。
在自动化模块校准完成后,我们可以读取对应交流定义的能力水平,从而读取交流日期。
收入
我们通过人工智能能力(操作化为有效计算或)来拟合函数ECI)到领先的AI公司年收入(具体来说,是领先的AI模型开发者的收入,不包括英伟达)。
特别地,我们拟合了从ECI到年化收入的指数函数(在我们的模型中等价于从对数(有效计算)到年化收入的指数函数)。我们对该函数进行推断,并对刚刚达到AC里程碑的AI公司收入水平进行猜测。
我们估算以下中位参数:
https://www.datawrapper.de/_/N9NuP/
将年化收入建模为ECI的指数函数比将其作为时间函数更为复杂;它使我们能够纳入数据中心增长放缓或AI研发自动化反馈循环等效应。从实证来看,收入每增加15个ECI点数就增长了10倍。
然而,该方法未考虑除能力外的其他收入增长驱动因素(如总计算量中分配给推理和推理利润率的百分比)。它也没有考虑到即使保持这些因素不变,收入可能也不是ECI的指数函数。
我们试图通过参数值的选择直观地考虑这些因素——尽管Anthropic的年化收入多年来每年增长10倍,但我们认为很快会放缓,改用5-7倍/年作为当前中位增长率。
2027年AI 预测评分更新
比较2027年人工智能进步速度与现实
我们更新了对人工智能进展速度与2027年人工智能进展速度的评估。根据你包含的指标和使用何种聚合方法,现实似乎以大约2027年AI 2027的70%-90%的速度发展。
这就是量化评估。定性评估将在下一节讨论。
https://www.datawrapper.de/_/H4G09/
如果进展能保持AI 2027的75%速度,自动编码器将在2027年年中达到。[5]
相对提升速度远低于其他指标的部分原因是,自发布以来,我们下调了对AI 2027年初AI软件研发提升的估计。这反映了我们对现实落后于计划的真实估计,但这也使得进步框架的“速度”不如其他框架自然。
至于公共显著性指标,这是我们最大的预测误差,我们怀疑是否应该选择更好的操作化。即使那次调查显示出进展,人工智能如今似乎比一年前更加突出。
我们之后做了一些小的方法调整我们之前的评估:
- 我们从评估中移除了旧预测,特别是2025年中期的基准预测和2025年末的计算预测。我们也没有评估DeepCent计算预算(即最大中国公司的计算预算),因为目前数据太少。
- 我们分别估算了公共和内部AI软件研发提升;此前我们估算了一个数字,需根据两个AI 2027估算进行评分。
关于估算的详细信息可见这个电子表格.
评分其他预测
AI 2027 2026 年初的部分非常切中要点(题为“编码自动化”),但 2026 年中期的部分似乎更为遗憾:
我们不是中国专家,但如果中共整合了各类中国人工智能项目,并高度优先采购计算,我们现在大概已经听说了。总体来看,“中国觉醒”似乎还没有发生。
话虽如此,我们预计中国已经出现了某种程度的AGI觉醒,正如全球范围内一样。
其他说明:
- “比最好的OpenBrain模型落后大约六个月”基本上是对的;本分析根据ECI元基准,显示大约4个月的差距,这个差距很接近,可以说ECI低估了实际差距。(如果有四个月的空白期,就能预测今天中国AI能力与Mythos Preview相当,但这似乎是错误的。)
- 我们目前对中国的计算量还不十分准确,但12%的计算力仍然是一个合理的估计。
- 我们说OpenBrain已经提升了安全性SL3:“防范网络犯罪集团和内部威胁。这包括世界知名的犯罪黑客团伙、资源充足的恐怖组织以及不满的员工。”目前尚不清楚如何统计当前的人工智能代理数量,但Anthropic和OpenAI还没有完全防范它们这让我们觉得它们不配被称为SL3。话虽如此,如果我们只关注模型权重安全性而非更广泛的安全性,情况或许会更好。
更新预报
丹尼尔
让我印象深刻的是,三种 AC 外推方法基本上都得出了相同的答案,而且各自独立:(链接)
我没在脑子里算,只是猜测参数,然后我们计算结果。我认为这也是让我对这些预测更有信心的原因。
我想纳入的另一个证据来源是AI 2027的评分/跟踪。简而言之,方法论是:
- 详细、具体地规划你认为未来的发展轨迹。
- 等一会儿。
- 检查一下事情是否大致上在正轨上,还是完全偏离了方向。如果他们大致在正轨上,量化估算现实中进展的速度和你的情景相比。
- 调整你对未来走向的猜测,使其更快或更慢。
看起来整体上还是在跟着AI 2027的方向发展,只是进展稍微慢了一些。慢了多少?大约75%的速度,如前所述上图.这预测《冷气》将在2027年中期发生。
如果我们认为速度更像是60%,那么这可以预测2028年初。这同样是与其他三种方法的有趣收敛。
在形成我综合观点时,还有其他主要因素需要考虑吗?其实有还有很多其他话要说但总体来说,我对目前为止最重要的观点总结感到相当满意。
我不知道还有其他足够有力的论点或考虑因素,能让我明显放弃上述观点。所以我就按照模型对AC的说法,只是稍微有信心一些,因为三种锚定方法的结果都差不多,而且用75% AI 2027速度法会提前一个月。
(链接)
这是我自四月以来的预测变化: (链接)
我对AC、TED-AI和ASI到货日期的预测是:(链接)
伊莱
我申请的顶级调整是:
- 未知的模型局限和错误。根据我们之前(AI 2027)时间线模型,我的直觉是因为未知因素而推迟整体预测,我很庆幸自己这么做了。我对超级编码员里程碑(Superhuman Coder 里程碑,类似但稍强于自动编码里程碑)的中位数是2030年,而模型的2028年12月输出数据则相对较好,现在我认为前者更准确。基于此,我再次想延长我的整体预测,但这次比上次少一些,因为我们的新模型比之前的更经过充分测试和考虑,因此更不可能出现简单的错误或未知的概念性问题。
- 数据瓶颈。我们的模型现在隐含地假设任何数据进展都与算法进展成正比。但实际上数据可能更像瓶颈,也可能更少。我猜建模数据会稍微延长时间线,至少在合成数据难以完全依赖的情况下是这样。
我综合考虑的调整:(链接)
还有和April的对比:(链接)
与模型的起飞预测相比,我加快采矿速度,主要是为了考虑硬件研发自动化、硬件生产和整体经济自动化:(链接)
我对AC、TED-AI和ASI到货日期的预测是:(链接)
布伦丹
这是我第一套参数和综合视角。
模型未考虑的几个因素,用于《降临》的时间表:
- 我们并不是把研究品味作为时间线指标来追踪;P-Zero研究的初步结果显示,作品5在其可验证任务的研究品味上与“专家人类”相当。(这也提前更新了《Ac》的进展,因为如果人类水平的研究品味比我们之前猜测的更接近,那就说明人类级别的编码能力也在如此。)
- “认识论与对齐”很可能成为《认知》的瓶颈。一方面,这应该已经被纳入提升趋势,因为这些问题迄今为止导致了提升减少。但如果这些只是“技术能力狭窄”的粗略补充,且无法快速提升,那么一旦我们陷入“对齐瓶颈”,提升趋势或许会放缓。
- 输入时间序列有些粗糙。他们并未精确解释瑞安所说的传闻中的“预训练悬挂”,这可能导致2026年超出趋势的进展。而且自去年12月以来都没有更新,我对AI资本支出的预期比去年12月更乐观。
- 其他未知未知数,这些因素应该会稍后调整中位数。
总体来说,模型在2030年1月的AC有70%,到2035年1月接近90%的信心过于自信,所以我把这些降到60%和80%。
这是我综合考虑的调整:(链接)
从AC起飞到TED-AI:
- 和往常一样,我们没有考虑硬件研发自动化(或起飞时计算生产的前所未有的加速)。如果考虑到这些,5+年计量的可能性会很低。
- 为了调整这一点,我添加了一个“最大起飞长度”,均匀采样于(无穷远、十年、五年、两年),并将每个模拟的TED-AI日期限制在AC日期加上这个量。
- 我还想考虑一些未知的串行瓶颈,这些瓶颈是理想化数学模型可能不包含的(毕竟,现实中AI研发的步骤和交互阶段远比我们模型多得多)。[6]我认为这主要影响非常短的起飞,所以每次试飞的起飞时间以25%概率被限制在6个月。
为了结合模型的这些调整和我对AC时间线的调整,我还根据我对AC的综合分布调整了所有推出的权重。这导致TED-AI到达的分布如下:(链接)
附录
自2021年以来,我们的AGI预测发生了怎样的变化
下面,我们包含了扩展我们对 的分析的图表。自《AI 2027》发布以来,我们的观点如何发生变化.当我们在下图中提到AGI时,我们指的是顶尖专家主导AI:一种在几乎所有认知任务中至少与顶尖人类专家相当的AI。
聚焦自2024年以来的变化:
显式模拟领先AI模型的训练运行
这最初是基于我们对A计划的研究;参见计划A起飞预报
我们认为这能提升起飞速度估计。但同时,它也让我们能够预测各种政策的影响边境的步伐这些都涉及减少可用于人工智能开发的计算能力。
采用这一变化会导致起飞速度稍慢;请参见下方图表,了解根据Daniel和Eli的参数估计值,它如何影响模型预测。
研究味觉参数调整
基于P-Zero Research即将发布的味觉研究评估,该评估更新了我们对品味研究进展的加快,Eli调整了他的:
- 自动研究味觉斜率中位数从2.1提升到2.3。
- 中位数到顶级味觉倍数中位数从3.7上升到4。
布伦丹的中位数估计值2.69和4.35也受到了这项研究的影响。丹尼尔没有更新他的估计,因为研究品味斜率估计为3已经高于布伦丹和伊莱的,而他的中位数到顶级味觉乘数估计为4也非常相似。
关于我们预测的内容澄清一下
我们之前并不清楚我们是在预测人工智能里程碑何时真正出现在世界上,还是假设事情进展尽可能快;例如,假设没有政府干预来减缓人工智能的发展。
在我们的补充材料中,我们暗示正在调整非技术性放缓。但实际上,我们并没有太多思考这个问题,有些人甚至明确假设相反。
我们讨论过这个问题,决定从现在起,我们的预测将以技术上可行的速度为前提。我们认为这比试图考虑不同程度放缓的可能性更有助于预测。
我们已编辑补充材料以反映这一点。
各种细微的代码变更
我们之前一直在用一种近似,即当前的进展速度与一个反事实的“仅限人类”轨迹相匹配,这样更容易模拟。但这一假设越来越错误,因为人工智能(在我们看来)开始不可忽视地加快进程。
特别是,这一假设会导致我们低估了支撑当前观察到的有效计算增长率,而这正是支撑当前观察到的进展率。然后我们会将实际的(自动化)模型轨迹代入到校准后的关系中,导致错误的加速预测,低估了达到自动编码器所需的时间。
我们对首页进行了一些调整,增加了一些额外的指标。我们默认显示时代能力指数,而不是“有效计算”。
(为什么要这样优先考虑ECI,而不是时间范围或其他指标?从技术上讲,有效计算需要一个底层的能力指标来定义,因为你需要用训练计算来衡量软件效率,而训练计算量是达到“同等能力水平”(这需要一个指标)。此外,将“训练计算”视为决定能力的单一标量的想法似乎越来越复杂)。
我们将 ECI 建模为 log(有效计算)的唯一仿射变换,满足以下性质:
- 当前有效计算映射到当前ECI(现为161)
- 当前有效计算的增长率对应当前ECI增长率(目前为每年15点)
- 这等同于说,每次训练计算的OOM都会增加固定数量的ECI点,而在给定训练计算中可达的ECI则通过软件研发过程以(目前)每年恒定的点数增长。
- ^在选择参数估计时,我们可能潜意识里有偏见,以确认现有观点,但我们尽量不去看结果。例外是Eli在设定抬升参数前查看了简化抬升模型的结果。
- ^第4.5首十四行诗(9月25日):中位数1.25倍(被选为Claude Code前30名使用);神话(4月7日26日,2月24日内部部署):4倍地平
- ^由于我们仅用这些数字来校准提升减去1与整体能力之间的关系,我们通过将Mythos Preview的发布日期读成其长期AECI趋势,而非实际发布日期,从而得出3.5个月的等待时间。
- ^稳定的指数增长是许多人工智能指标的合理默认假设,大致符合我们过去的估计。我们更复杂的模型表明,进展在一段时间内将呈指数级,直到趋势在接近AC时变成超指数级。
- ^(2027-2025.25)*(1/.75)+2025.25
- ^举个例子:直到最近,我们还没有考虑起飞时用新算法重新训练模型所需的时间。可能还有类似的事情我们没想到。