Epoch AI发布MirrorCode基准测试,要求AI在不看源码的情况下完整重实现整个程序。Claude Opus 4.7用14小时、花费251美元重写了约1.6万行Go语言的gotree生物信息学工具,但整体解出率仅56%。一年前的领先模型得分约30%,且只能处理日历工具等简单程序。数据污染是潜在问题,但记忆筛查显示结果并非主要由背诵驱动。
Epoch AI与METR联合发布MirrorCode基准测试,评估AI在无需源码情况下重新实现整个大型程序的能力。测试涵盖Unix工具、生物信息学等25个项目,目前最佳模型得分56%。 Claude Opus 4.7在14小时内重写了约1.6万行Go代码的生物信息工具,成本仅251美元,而人类工程师需数周。研究指出模型可能存在数据污染,但结果仍显示AI在长周期编程任务上进步迅速。
Epoch AI 数据显示,自 2024 年 8 月 SpaceX AI 的 Colossus 1 上线以来,全球算力最强的单一 AI 数据中心纪录每 7 个月翻一番。Anthropic、微软和 Meta 的设施曾轮流占据榜首。 文章指出,这种增长反映了超大规模厂商在单点算力上的投入极限。虽然未来两年增速可能放缓,但这一趋势揭示了 AI 训练基础设施的快速扩张节奏。
Epoch AI 估算显示,截至 2025 年底,OpenAI、Anthropic 等顶级前沿实验室仅使用了全球约一半的 AI 算力。尽管目前大部分算力被云服务商和其他应用消耗,但随着头部厂商营收激增和激进扩张,这一比例预计将在未来几年迅速改变。 文章指出,Anthropic 和 OpenAI 的算力增长速度远超行业平均水平,且正通过巨额资本支出抢占市场。若这种趋势持续,顶级实验室将吸收剩余算力空间,导致整体 AI 基础设施投资增速放缓,进而可能制约模型能力的进一步扩展。
Epoch AI 分析认为,随着 AI 算力需求呈指数级增长,从购买 GPU 到建设数据中心甚至晶圆厂,各环节的交付周期显著拉长。 每增加 10 倍算力规模,项目启动到部署的时间大约延长一年。 这种“滞后效应”导致投资者难以快速验证回报,从而倾向于分阶段小规模投资而非一次性巨额投入。这意味着未来几年 AI 算力的扩张速度将不得不放缓,进而可能拖慢大模型能力的提升进程。
Epoch AI 访谈了18位行业人士,深入解析强化学习环境这一前沿AI训练的关键瓶颈。文章揭示了从数学代码到企业工作流的扩展,以及奖励黑客攻击等核心挑战。 数据显示该市场规模巨大且增长迅速,独家合同高达七位数。对于关注大模型训练底层逻辑、数据工程及AI基础设施的技术读者而言,这是一篇提供大量一手信息和行业洞察的高质量报道。