潜空间

RSS: https://latent.space/feed
AI Engineer 通讯与顶级 AI 技术播客,报道前沿实验室如何构建 Agents、模型、基础设施与 AI4Science。

[AINews] OpenAI DevDay 2026:Dots、6.1 Sol、Ultrafast、Decisions API、Agents API、Spaces、Marketplace,以及 12 亿 ChatGPT 周活

OpenAI DevDay 2026 一口气发布多条产品线:语音产品 Dots(对标 Instinct/Muse)、协作空间 ChatGPT Spaces(对标 Notion 办公套件)、GPT 6.1 Sol(未叫 Astra,对标 Opus 5.5,新增"ultrafast"模式跑在未公开芯片上)、Decisions API(对标 Jev 播客讨论的 System One 决策模型,目前是 Luna 上的轻量 shim,有视觉但无 calibration/RLCD)、Agents API、Marketplace 等。 1.2 亿 ChatGPT 周活。文中带有作者明确立场和调侃语气("no Astra! alas""Definitely Not Anthropic Hyperscaler"),对关注 AI 平台竞争格局的读者有较高讨论价值。
评论点赞收藏16 小时前

[AINews] AMD 以 82 亿美元收购 World Labs,同时 Atlas 解决了机器人、设计等领域的稀疏重建问题

AMD 以 82 亿美元收购 World Labs(Fei-Fei Li 创立的空间智能公司)。文章引用 World Labs 官方博客透露:自 2024 年成立以来,团队构建了图像、视频和空间重建的世界级模型训练能力,并收购 SceniX 推进机器人仿真。 最新发布的 Atlas 是一种全模态模型架构,首次解决了空间智能中的关键难题——新视角相机预测(类似 LLM 的 next-token 预测,但针对空间)。 收购价因 AMD 是上市公司而可公开确认。
评论点赞收藏1 天前

[AINews] Opus 5.5 擅长讲解视频

AINews 9/24-9/25 期摘要:Claude Opus 5.5 本周发布,社区口碑正面,最大亮点是擅长生成 explainer 短视频,相关视频刷屏时间线。 模型竞赛同时更新:Claude Opus 5.5(SimpleBench 88.4% 领先,视觉评测中 Anthropic 最好,成本比 Fable 5.1 低约 60%)、GPT-6 Astra/Sol/Luna、Gemini 3.8 Flash、小米 MiMo-V2.6-Pro 均有新评测。 Opus 5.5 在 Terminal-Bench-Science 上推理表现也被提及,但正文截断。信息密度尚可,属于聚合型快报。
评论点赞收藏1 天前

OpenRouter:从种子到 Stripe — 与 OpenRouter 的 Alex Atallah 及 AMP 的 Anjney Midha 对话

OpenRouter 联合创始人兼 CEO Alex Atallah 与 Anjney Midha 复盘了 OpenRouter 如何从 Llama、Alpaca、Mistral 等开源权重模型早期生态成长,演变为服务超 1000 万开发者的中立模型路由层。 文中强调多模型是 AI 基础设施共识前的早期判断,并解释了为什么模型公司花数十亿美元训练 checkpoint 后仍难以触达开发者,OpenRouter 如何填补分发与产品化缺口。 还提到 Mistral 如何验证竞争生态价值。对关注 AI 基础设施、开源模型生态和开发者工具的分发/增长策略有信息增量。
评论点赞收藏4 天前

[AINews] 潜在空间的未来

AI 独立媒体 Latent Space 主笔 swyx 发布内部通讯 AINews v3 的改版说明。文章开头盘点"怪物级"一周:中国开放权重前沿实验室首次登顶、Anthropic/OpenAI 新 SOTA 模型与降价、Meta Connect、TypeSafe AI 完成 100 亿美元融资(其播客带动 Apple Podcasts 排名超过 TBPN、MKBHD,YouTube 破 20 万订阅)。 核心是宣布对 AINews 进行长期未做的重大改版,该通讯由 swyx 人工撰写近三年,即将在 DevDay 前数周调整形式与内容方向。属于媒体自我迭代+行业一周速览,有一定信息点但整体是内部通告性质。
评论点赞收藏5 天前

Runway 的 WorldPrompt 与实时世界的工程

Runway 推出 GWM Worlds 2 研究预览,将高保真音视频生成变为实时交互模拟,采用"自回归扩散"架构。核心亮点 WorldPrompt 是一种输入格式,可固定生成世界的部分属性(如首帧)并定义带时间戳的事件序列,甚至支持实时提示操控模拟环境。 文章采访 Runway CTO Kamil Sindi 和首席生成研究科学家 Robin Kahlow,探讨 WorldPrompt 的工程意义与技术边界。
评论点赞收藏5 天前

铸造厂与领航者:降低科学研究的成本

本文探讨 AI 如何降低科学研究的成本。作者通过 Anthropic 的宏大愿景引出一个更低调但即时的趋势:一线科学研究的转型。文章特邀 Endura Therapeutics 的创始人 Adrian Sanborn 分享观点。 Sanborn 拥有斯坦福 CS 博士学位,且亲自做过大量湿实验室工作,他能从代码和实验台两个角度描述 LLM 带来的变革。文章提出了“铸造厂 vs 领航者”(Foundries vs Navigators)的框架,用以描述 AI 在降本增效中的不同模式,为科技与生物交叉领域的从业者提供了清晰的视角。
评论点赞收藏6 天前

[AINews] Meta Connect 2026:Muse 眼镜、语音、视频和 Charm

这篇 Latent Space 的 AINews 快评聚焦 Meta Connect 2026 发布会:推出 Muse 眼镜、语音/视频能力和代号 Charm 的产品;作者提到 Stratechery 对发布会评价积极,但 Meta Superintelligence Labs(MSL)除 3 周前发布的 Muse Spark 外没有进一步更新。 文章指出 Muse 在 App Store 已超越 ChatGPT,并新增邮件等功能以弥补被 Amazon 封锁的影响;最后的"stealth"收购 Limitless 以 Charm 名义重新出现。 内容带有编辑个人语气与简短评论,但整体偏快讯式汇总,信息增量集中在 Muse 超 ChatGPT 和 Charm/Limitless 的公开化。
评论点赞收藏6 天前

🔬生物安全是一场 AI 军备竞赛 - Eric Nguyen(Radical Numerics CEO)

围绕"生物安全是否也是 AI 军备竞赛"展开的访谈。背景是 OpenAI→Hugging Face 攻击引发关于前沿模型双重用途能力的讨论,Anthropic 过滤器也重点标注网络安全与生物两类风险。 Radical Numerics 联合创始人 Eric Nguyen(斯坦福背景,早期做基因组语言模型 GLM)解释:能提升生物学能力的同一类模型,也可以让防御能力不落后,类比 Clem Delangue 主张网络攻防能力需保持开放并跟上前沿模型。 文章前半段回顾他在斯坦福推 GLM 时的冷遇——生物学家怀疑可行性、难验证输出、看不到应用——再到生物病毒从头设计的话题入口。有具体一手经验与明确立场,涉及前沿 AI × 生物安全交叉,适合 HN 风格技术读者点开与讨论。
评论点赞收藏7 天前

AINews 上新 Claude Opus 5.5,成为新的默认模型,且各大模型价格普遍下调 40-50%

Claude Opus 5.5 发布,以显著降低的运行成本和对 Claude Fable 5.1 的超越性能成为新的默认模型。 文中指出,虽然 OpenAI 通过降低 GPT-6 系列价格进行了反击,但 Claude 在推理效率、预填充和解码性能上的双位数提升使其确立了领先地位。 该模型在大多数任务上表现优于 Fable,并在部分基准测试中挑战了 Astra,同时特别强调了生成内容的写作质量和逻辑前置性的改进。
评论点赞收藏7 天前

一座奥斯卡、两颗小行星和你 sklearn 里的算法:John Platt 谈 AI 与科学

潜空间播客访谈 John Platt:他既是奥斯卡奖得主,又发明了 sklearn 中常见的机器学习算法,还有两颗以他命名的 asteroid。节目覆盖 Google 的 ERA(Empirical Research Assistance)、AI 对抗气候变化,以及科学和 AI 的长期共生。 Platt 的同事 Dave Bacon 常打趣他"总比下一个大趋势早了二十年"——卷积神经网络术语、聚变研究、量子计算他都参与过。整体是个人经历+AI-for-science 视角的长访谈,故事性强,适合对 ML 历史与科研应用感兴趣的读者。
评论点赞收藏8 天前

[AINews] 小米 MiMo-V2.6-Pro:号称 300 万美元训练成本的新顶级开源权重模型

小米发布 MiMo-V2.6 系列两款原生全模态开源模型:MiMo-V2.6-Pro(1T 参数,42B 激活)主打能力,MiMo-V2.6-Flash 主打智能/效率/成本平衡,并预告 Pro-UltraSpeed 版本可在同等质量下实现约 20 倍输出速度提升。 训练成本据称约 300 万美元。小米并非传统"中国 AI 六小虎"成员,此次跻身前沿开源模型行列令业内意外。数天前,原 DeepSeek 明星工程师罗福莉(Fuli Luo)跳槽小米一事已引发关注,此次模型发布被视为小米 AI 实力的一次集中展示。
评论点赞收藏8 天前

Jev:面向生产的 System One 模型,而非神谕——对话 TypeSafe AI CEO Diogo Almeida

潜空间与 TypeSafe AI CEO Diogo Almeida(InstructGPT 共同作者)的访谈,核心主张是前沿模型过度依赖自回归聊天调优,正在走错方向。 Jev 定位为“System One 生产模型”,发布视频已获约 4000 万播放(对比 GPT4o 2200万、Navier-Stokes 7400万、6 Astra 1.37亿),发布后迅速引发 AI 圈讨论。 文章重点在于对当前 LLM 产品形态的批判性观点和对生产级模型的替代方案,适合关注模型架构趋势和 AI 工程实践的科技读者。
评论点赞收藏8 天前

两天内 Jev 的 6 个"克隆"架构猜测

Jev 在周三发布后两天内迅速引爆时间线,其发布视频获 3600 万播放(对比 OpenAI Navier-Stokes 结果 7400 万、Anthropic Fable 5 的 5700 万)。 由于并非开源,引发大量猜测、demo 与争论,包括 Schmidhuber 的尖锐评论。文章列出 6 个最可能的"克隆"架构猜测,其中 ModernBERT 与 Diffusion 被认为最接近:Laya 被推测为 421M 参数,基于 ModernBERT-large 编码器加两层 transformer,对用户选项打分,再用 PPO 在序列嵌入上输出逐步转化轨迹(0.0 到 1.0 概率)。 作者还提到有人声称使用了 RLCD 但缺乏依据,置信度可能是熵基。整体是一篇快速追踪 + 架构逆向猜测的 AINews 短讯,信息密度较高,有讨论入口但偏综述性质。
评论点赞收藏11 天前

AINews:AI 新闻"现实核查"——Yegge 关停 Gas Town、Databricks 的 Astra 成本反升 60%

AINews 本期聚焦两个 AI 行业"现实核查":一是 Steve Yegge 高调推行"tokenmaxxing"后宣布停掉 Gas Town 项目,坦言每月花数千元订阅编码 agent 却只做出了 Gas Town 这一个东西,泼了一盆冷水;二是 Databricks 内部数据显示,AI 工程师将主力从 Sol 切到 Astra 后,整体支出反而上涨约 60%,打破"Astra 按任务成本更便宜"的常规认知。 文内还附上 9/15–9/16 的 AI 新闻汇总(12 个 subreddit、544 条 Twitter)及 Latent Space 频道的订阅说明。
评论点赞收藏13 天前

为超智能提供承销:让 AI 代理可以被起诉——AIUC 创始人 Rune Kvist

潜空间节目最新一期介绍 AIUC 完成 4000 万美元 A 轮融资。AIUC 做“可被起诉的 AI Agent”标准与保险基础设施,核心观点是:未来限制前沿 AI 落地的不是能力,而是信任与责任归属。 创始团队包括 Anthropic 早期产品负责人等。节目讨论 Cursor、Harvey、Lovable、ElevenLabs 等公司面临的问题:自主系统出错时责任由谁承担,以及 AIUC-1 标准如何把保险机制嵌入 Agent 部署流程。
评论点赞收藏14 天前

Jev:只做决策/分类/路由/打分的"System One 模型"——比小型前沿 LLM 快 100 倍以上、便宜 200 倍以上

AINews 日报本期头条:TypeSafe 推出名为 Jev 的"System One"模型,只做分类、路由、打分和决策,不做自由文本生成,比小体量前沿 LLM 快 100 倍以上、便宜 200 倍以上。 核心卖点是并行采样、无幻觉、输出校准;训练方式叫 RLCD(calibrated decisions)。同期其他新闻:Periodic Labs 发布 Neon,一个把物理实验室高通量实验与 RL 训练紧耦合的材料科学模型(超导、磁体、半导体方向),用 1300 张 H200 + 数月私有实验数据,在自家基准上超过 GPT-6 Astra;另含 Gemini 3.8 Live 等动态。 对想理解"轻量路由/决策层如何和重型推理 LLM 分工"的工程读者有直接参考价值,讨论入口也清晰。
评论点赞收藏14 天前

游戏中学到的技能能迁移到现实工作吗?

Good Start Labs 由 Alex Duffy 和 Tyler Marques 创办,于去年10月从 Every 公司拆分出来,获得 General Catalyst 等 360 万美元融资。 核心想法来自 2025 年一段 Twitch 直播中前沿大模型玩《Diplomacy》游戏的观察:Duffy 注意到 OpenAI 的 o3 靠策划未来背叛赢下所有对局,而 Claude Opus 4 拒绝说谎最终惨败,由此推断用可验证结果的游戏训练模型能教会战略思维等技能。 Duffy 在 Every 发文称在 Diplomacy 上微调模型能提升客服和工业运营基准表现。公司方向是寻找其他能教 AI 实用技能的游戏,他认为强化学习环境是教模型"可验证技能"最可靠的方式,且游戏呈现方式会影响模型学到什么、技能能否迁移到游戏之外的工作场景。 文章在展示最佳证据前被截断。
评论点赞收藏15 天前

第三方评估员标准 AEF-1 浮现:Xai、OpenAI 与 Anthropic 纷纷签署,Dario 提出"嵌入式评估员"制度

<p>我们上一次强调节奏争论是在七月,当时<strong></strong>首次出现:</p><p>看来我们又要迎来第二轮了,原作的主笔Dario写了具体来说,他对《Pacing》的判断:</p><blockquote><ol><li><em><strong>嵌入式评估员。</strong>每家前沿人工智能公司承诺为一支嵌入式第三方评估团队提供持续、类似员工的访问权限(例如:),其职责是核实安全实践和承诺的遵守情况,报告事故,并帮助评估不仅完成的人工智能模型,还包括训练流程和流程的对齐情况。这是任何节奏承诺可验证的关键步骤,在银行业已有先例,有时涉及与员工一同嵌入监管“监督员”。<strong>Anthropic现在单方面承诺采取这一步骤。</strong>我们希望这成为更广泛推动安全与对齐工作加倍努力的一部分。</em></li><li><em><strong>民主协调。</strong>民主国家的前沿人工智能公司协调制定共同安全标准,并限制人工智能不受控制的进展速度。一些对节奏有影响的协调形式在法律上具有挑战性,需要政府支持。</em></li><li><em><strong>全球协调。</strong>美国及其他民主国家尽力与威权政府协调,同时认真对待合规验证的挑战。</em></li></ol></blockquote><p>非常巧合的是,<strong>人工智能评估论坛</strong>,恰好还提出了他们对第一类评估员应做的事情的期望:</p><p>AEF成员现在很可能成为这些大型实验室招募的领先第三方审计员,进行自我监管。达里奥单方面承诺提供无与伦比的访问权限,包括”<em>我们办公室的办公桌、通行证和公司笔记本电脑</em>“和”<em>访问工作区、工具和权限,大多与内部风险评估团队相当</em>“.</p><p>虽然这些都符合国内自律行业的标准做法,但更最终的考验是达里奥提出的</p>
评论点赞收藏15 天前

为什么你应该投身"用 AI 做 AI 研究"——Recursive 创始人 Richard Socher 访谈

<p>从帮助NLP的核心理念开创,到现在构建能够自动化AI研究的AI系统,<strong>押注人工智能的下一个重大进步是递归自我提升。</strong>他是You.com,AIX 风险投资,现在,汇集了一些最优秀的作品(&amp;)全球研究人员并培养了<strong>46.5亿美元种子轮</strong>.</p><p>在本集中,理查德加入了《潜空间》,探讨他对<strong>“尤里卡机器”</strong>:一种能够提升发明过程、加速人工智能研究,并最终解决重大问题的超级智能<strong>科学、能源、材料、生物学等</strong>.</p><p>你可以买他的书《尤里卡机器》<strong></strong>!</p><p>我们深入探讨递归的<strong>早期成绩</strong>包括一个人工智能研究系统,理查德称其在优化任务中不到两天就超越了人类及其代理,同时还参与了NVIDIA GPU内核的研究,系统在未依赖CUDA专家团队的情况下发现了改进。<br><br>理查德还解释了他为何如此认为<strong>目前需要数千人和数年时间的人工智能研究,最终可能会被压缩到数周内。</strong>这些结果在他的报告中进行了总结,我们也讨论了他的<strong>智力的10个维度:</strong></p><p>我们还探讨了关于日益强大的人工智能的更难问题:奖励黑客,以及<strong>人为式宪法实际上有效</strong>、人工智能监管及“加速”前沿开发的提案,开源模型等<strong>地缘政治软实力</strong>,今天的大型语言模型范式是否足够,以及如果人工智能系统最终开始选择自己的目标会发生什么。<br><br>理查德反思那些曾被拒绝的研究,这些研究启发了亚历克·拉德福德的<strong>GPT</strong>开放性、人工智能经济学家、整个经济体的模拟,以及他思考智能上限的框架。</p><hr><h2>我们…</h2>
评论点赞收藏16 天前

Forward Deployed Engineer 的崛起——以及如何做好这份工作

<p>前方程式(FDE)是人工智能领域最热门的职位。实验室、初创公司和私募股权公司都在招聘工程师<strong>坐在客户运营中,解决他们的问题</strong>.几乎没有人能就这些工程师应该完成什么,或者招聘背后的策略到底是什么达成共识。</p><p>我是, 首席执行官,人工智能的确定性基础设施。十多年来,我在三个不同的机构三次构建了前沿部署功能的部分。<strong>以下是我看到的有效、失败的部分,以及我认为未来会走向何方。</strong></p><p>第一个是Palantir。我在那里做产品开发,构建存储和检索系统,后来作为FDE被部署到商业、国防部和国家安全、医疗以及石油天然气领域。<br><br><strong>我还领导了Project Frontline,这个轮岗将我们的软件工程师培养成前沿部署的工程师。</strong>大约有250人参加过这个项目,其中很多人现在在OpenAI、Anthropic、xAI和Anduril等公司运营前置部署团队。</p><p>第二个是Citadel,我负责业务工程。我们的客户是投资组合经理,唯一重要的问题是我们构建的数据和软件产品是否帮助他们实现了alpha。</p><p>第三个是开普勒,其中<strong>前置部署功能位于产品内部,而非销售内部</strong>,在一个可能错误的答案比没有答案更糟糕的领域。</p><h2>联邦发展局的误解</h2><p>几个月前,<strong>A16Z 推出了</strong>我被提名为研究员之一,和一些我以前共事过的人一起。这是一个很棒的项目,我很享受很多交流。<br><br>上周我参加了在旧金山的第一次奖学金晚宴。</p><p>桌子周围聚集了Snowflake、Anth…</p>
评论点赞收藏18 天前

DeepSeek v4.1-Flash:全新架构的回归

DeepSeek发布v4.1-Flash,采用全新的763B-P8B-D16B因果Encoder-Decoder架构并支持视觉能力。作者认为当前基准测试尚未能充分反映该模型在上下文利用效率上的真实突破,建议跳出版本号与排行榜思维来评估其价值。
评论点赞收藏18 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。