Epoch

Epoch AI 是一家研究机构,研究塑造 AI 发展的关键趋势和问题,如算力增长、数据集规模等。

AI 降价速度正在超越历史上所有变革性技术

Epoch AI 这篇长文用 2021 年 GPT-3 发布以来的数据测算 AI 推理成本:同样能力水平下,价格平均每季度下降约 47%,即每年 13 倍;其中数学类任务最快(每季 50-52%),游戏谜题类稍慢(39-43%)。 作者强调,刚达到 SOTA 时降价最快(每季 66%),两年后放缓至每季 32%。文中以 OpenAI o3 到 GPT-5.6 Luna 在 GPQA Diamond 上同等表现、价格从 30 美分降到 0.0004 美分为例,指出 18 个月内“思考”价格下降约 725 倍。 方法论上采用 CAISI 的 transcript 法追踪不同推理预算下的成本-性能曲线,构建 Pareto 前沿,并用对数回归/随机前沿分析建模;作者坦诚数据不完整、基准可能被“刷分”、真实用户并不总切换最便宜模型等局限。 数据和代码已开源在 GitHub,适合关注 AI 经济学、推理成本趋势和技术商业化的读者。
评论点赞收藏7 天前

存在缺陷的 AI 基准测试:Epoch AI 基准注册表筛选结果

Epoch AI 基准注册表中筛选出“存在缺陷”的基准共 85 项,覆盖 Agent、软件工程、长上下文、多模态、数学、语言理解等 14 个领域。 每项列出管理方(Epoch 自管、基准创建方、模型开发商)、领域分类及当前最高分,例如 Erdős 级研究数学题最高分仅 3%、某隐蔽规则棋类谜题最高 84%、Earthborne Rangers 重复通关学习基准最高 76%、长程端到端代码重写基准最高 73%。 内容本身是数据索引页而非深度分析,但对关注 AI 评测可靠性、benchmark 饱和与缺陷判定的技术读者有实用参考价值,适合作为筛选入口而非独立深度阅读。
评论点赞收藏11 天前

全球AI数据中心交互式地图

Epoch发布全球AI数据中心交互式地图,覆盖86个设施,按H100等效算力、IT功率(MW)、建设成本和运营方筛选,时间轴从2023年Q1延伸至2030年Q1。
评论点赞收藏21 天前

FrontierMath Erdős:用 Erdős 开放数学问题测试 AI 能力

Epoch AI 发布 FrontierMath Erdős 基准,用 68 道 Erdős 开放数学问题测试 AI 能力,GPT-6 Astra 是唯一解出题目的模型,正式评测中解出 2 题(3%),额外尝试共解出 5 题,总计算成本超 22 万美元。 基准用 Lean 形式化验证答案,每道题预算 300 美元,其他四个模型(GPT-5.6 Sol、GPT-5.5、Claude Fable 5.1、Claude Fable 5)全部零分。
评论点赞收藏26 天前

美国GDP统计中的"英伟达黑洞"

美国GDP统计遗漏了英伟达等无晶圆厂芯片设计公司的海外增值部分,导致AI对GDP增长的贡献被低估约0.3个百分点,若英伟达增速持续,到2028年可能低估近2个百分点。 BEA已确认此问题但暂无修改计划。
评论点赞收藏35 天前

668阶Hadamard矩阵求解:Claude与人类研究者合作突破

Anthropic研究人员与Claude合作,找到了668阶Hadamard矩阵,这是该问题最小未知情形的突破。解以谜题形式发布,编码了所有不超过2000阶且此前未知的Hadamard矩阵。 Hadamard猜想——即所有合法阶数都存在对应矩阵——是否已被完全解决尚不明确,可能源于搜索策略改进或全新构造方法。
评论点赞收藏49 天前

AI能独立完成的最大软件项目有多大?

Epoch AI发布MirrorCode基准测试,要求AI在不看源码的情况下完整重实现整个程序。Claude Opus 4.7用14小时、花费251美元重写了约1.6万行Go语言的gotree生物信息学工具,但整体解出率仅56%。 一年前的领先模型得分约30%,且只能处理日历工具等简单程序。数据污染是潜在问题,但记忆筛查显示结果并非主要由背诵驱动。
评论点赞收藏58 天前

MirrorCode:AI能独立完成的软件项目有多大?

Epoch AI与METR联合发布MirrorCode基准测试,评估AI在无需源码情况下重新实现整个大型程序的能力。测试涵盖Unix工具、生物信息学等25个项目,目前最佳模型得分56%。 Claude Opus 4.7在14小时内重写了约1.6万行Go代码的生物信息工具,成本仅251美元,而人类工程师需数周。研究指出模型可能存在数据污染,但结果仍显示AI在长周期编程任务上进步迅速。
评论点赞收藏95 天前

最大 AI 数据中心纪录:每 7 个月算力翻倍

Epoch AI 数据显示,自 2024 年 8 月 SpaceX AI 的 Colossus 1 上线以来,全球算力最强的单一 AI 数据中心纪录每 7 个月翻一番。 Anthropic、微软和 Meta 的设施曾轮流占据榜首。 文章指出,这种增长反映了超大规模厂商在单点算力上的投入极限。虽然未来两年增速可能放缓,但这一趋势揭示了 AI 训练基础设施的快速扩张节奏。
评论点赞收藏110 天前

AI热潮使计算基础设施占美国GDP份额翻倍

AI基础设施繁荣推动美国计算基础设施占GDP比重翻倍,从2015-2022年平均的0.7%升至2026年一季度的1.5%。 数据中心建设、计算硬件和网络设备投资成为美国私人投资增长的主要驱动力。
评论点赞收藏113 天前

网络安全漏洞趋势交互式探索器

Epoch AI 发布了一个交互式漏洞趋势探索器,可视化 2020 年以来的 CVE 数据。 文章详细说明了基于 CVSS 的严重程度分级及 CNA 报告机制。 重点分析了 Anthropic Claude Mythos 发布后漏洞报告量的激增,指出 AI 辅助发现漏洞可能是主要原因。
评论点赞收藏116 天前

内存成本占 AI 芯片组件总成本近三分之二

Epoch AI 数据显示,2024 年一季度至 2025 年四季度,英伟达、AMD 等厂商 AI 芯片中 HBM 内存成本占比从 52% 升至 63%。与此同时,逻辑芯片和先进封装的成本占比相对下降。 这一变化主要受 HBM 供应紧张及价格飙升驱动。微软和 Meta 已上调 2026 年资本支出预算以应对组件价格上涨,显示存储成本在 AI 硬件投入中的主导地位正在增强。
评论点赞收藏129 天前

前沿实验室尚未使用大部分 AI 算力

Epoch AI 估算显示,截至 2025 年底,OpenAI、Anthropic 等顶级前沿实验室仅使用了全球约一半的 AI 算力。尽管目前大部分算力被云服务商和其他应用消耗,但随着头部厂商营收激增和激进扩张,这一比例预计将在未来几年迅速改变。 文章指出,Anthropic 和 OpenAI 的算力增长速度远超行业平均水平,且正通过巨额资本支出抢占市场。若这种趋势持续,顶级实验室将吸收剩余算力空间,导致整体 AI 基础设施投资增速放缓,进而可能制约模型能力的进一步扩展。
评论点赞收藏129 天前

机器人产能能多快扩张?

Epoch AI 分析了人形机器人等五种形态在面临巨大需求冲击时的产能扩张速度。通过参考二战飞机、无人机等历史案例,指出成熟品类翻倍周期约10-16个月。 主要瓶颈在于建厂时间(中国需6-9个月)和高精度减速器供应。若需求爆发,2030年人形机器人年产量可能达1000万至3000万台。
评论点赞收藏151 天前

交付周期拉长将导致 AI 算力扩展放缓

Epoch AI 分析认为,随着 AI 算力需求呈指数级增长,从购买 GPU 到建设数据中心甚至晶圆厂,各环节的交付周期显著拉长。 每增加 10 倍算力规模,项目启动到部署的时间大约延长一年。 这种“滞后效应”导致投资者难以快速验证回报,从而倾向于分阶段小规模投资而非一次性巨额投入。这意味着未来几年 AI 算力的扩张速度将不得不放缓,进而可能拖慢大模型能力的提升进程。
评论点赞收藏154 天前

英伟达 B200 生产成本约 6400 美元,内存占一半

Epoch AI 估算英伟达 B200 GPU 的生产成本约为 6400 美元,其中 HBM 内存和先进封装占成本的三分之二。 文章基于物料清单模型,结合台积电产能和晶圆成本数据,详细拆解了逻辑芯片、内存及良率损耗的成本构成。
评论点赞收藏159 天前

算法能力提升的速度有多快?算力依赖型突破才是关键

芝加哥大学 XLab 团队研究指出,历史上最大的算法突破大多依赖大规模算力才能显现效果,小模型测试往往无效甚至有害。 这意味着纯软件层面的智能爆炸可能受限于算力瓶颈,难以快速实现。 相比之下,层归一化等“算力无关”改进虽能带来稳定提升,但幅度远小于依赖算力的创新。研究认为,前沿实验室因拥有充足算力,在发现和验证这些关键算法上具有显著优势,硬件与算法实为互补关系。
评论点赞收藏183 天前

Epoch confirms GPT5.4 Pro solved a frontier math open problem

Epoch AI 确认 GPT-5.4 Pro 解决了 FrontierMath 中的超图拉姆齐问题。多位数学家验证了解法正确性,并计划发表。 其他前沿模型如 Opus 4.6 和 Gemini 3.1 Pro 也成功解出该题,展示了当前大模型在复杂数学推理上的突破。
评论点赞收藏190 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。