潜空间

RSS: https://latent.space/feed
AI Engineer 通讯与顶级 AI 技术播客,报道前沿实验室如何构建 Agents、模型、基础设施与 AI4Science。

React for Agents:Astro 作者把 Hooks 带进 Agent 框架 Flue 2

开发者代理框架仍处于早期阶段,像Vercel这样的框架夏娃 以及弗雷德·肖特的烟道 ——两者均于今年推出——奠定了早期的范式。 Schott 是网络框架 Astro 的创始人,这也促成了他的公司被 Cloudflare 收购 一月。他刚刚发布了Flue的第二版,其首个稳定版本,即其基础是类似React风格的“Agent Hooks”。 在 Flue 中,代理由 JavaScript 函数表示。这个...
评论点赞收藏17 小时前

Gemini 3.7 Flash 让 GDM 重回前沿

今日的Gemini 3.7 Flash更新 上最引人注目的图表就是这张: 你可以看到,3.5 和 3.6 Flash 的表现已经远远落后于更新的 Claude 4.8+ 和 GPT 5.5+ 系列…… 阅读更多
评论点赞收藏2 天前

SpaceX AI 发布 Grok 4.6:1.5T 参数模型,专注长程 Agent 与知识工作

SpaceX AI(原 Cursor 团队)发布 Grok 4.6,定位为全球第二强的知识工作模型,效率第一。1.5T 参数,针对长程 Agent、交互式任务和视觉工作做了专项训练,涵盖代码、内核优化、Web 开发、CAD 等场景。训练披露显示使用了更长的补充训练轮次、模型生成推理数据、高质量工程数据和改进的优化器。
评论点赞收藏3 天前

如何窃取推理轨迹

前沿模型的加密推理轨迹被破解,可被解码并移植到不同模型。扫描7000个公开轨迹发现62个API密钥、33个邮箱和33个密码泄露。攻击方法涉及重放加密推理块到较弱模型并提示转录。
评论点赞收藏4 天前

Meta开源前沿小模型,扎克伯格重申个人超级智能战略

Meta发布首款开源权重的前沿级小语言模型,扎克伯格同步发表续篇论文重申"个人超级智能"战略。Meta正从保守转向激进开源,Dreamer收购、Muse Spark和Muse Code接连推出。文章指出Meta与其他AI实验室的分野:Meta专注个人用户,其他机构聚焦企业、政府。
评论点赞收藏5 天前

[AINews] Zawinski's Law of MultiAgents

We’ve discussed the HuggingFace-OpenAI security incident before, but OpenAI’s side of the story was the talk of the town at Black Hat (summaries from former guests Elie and Simon are worthwhile): At t...
评论点赞收藏8 天前

[AINews] AMD buys Taalas

In The Custom ASIC Thesis we said Taalas was worth paying attention to, and in the Inference Inflection we said everything would go vertical. Our Baseten episode had some skeptical counterpoints again...
评论点赞收藏9 天前

[AINews] Megakernels are so dead and so back

Part of our Inference Engineering Masterclass pod yesterday involved a spicy discussion about Megakernels: megakernels are dead why are megakernels useful? you spend two months writing a kernel to sav...
评论点赞收藏11 天前

拆解 ChatGPT Work:OpenAI 的知识工作智能体

OpenAI 于2026年7月9日发布 ChatGPT Work,三周内用户突破1000万。Greg Brockman 确认 Work 与 Chat 模式将在年底前合并,成为十亿周活用户的主要使用形态。Work 基于 Codex 框架,在云端 microVM 上运行,提供持久化工作目录、浏览器自动化和定时任务能力,并尝试从被动响应走向主动建议。
评论点赞收藏11 天前

Qwen 3.8 Max(2.4T)与 27B:面向编码与协作的新开源权重模型

Qwen 宣布重新开源 Qwen 3.8 Max(2.4T 参数)和 27B 两个模型,API 定价为输入 $2/百万 token、输出 $6/百万 token。模型在自主编码(连续运行 10+ 天)、AI 研究(125 小时迭代提出新数据选择方法,超越原论文基准 +2.71 分)、WWW2025 多模态对话意图识别竞赛(24 小时内进入前 13%)以及完整芯片设计流程(RTL 到物理布局,门数从 8298 降至 678)等场景均有实测表现。
评论点赞收藏12 天前

推理工程大师课:让AI模型提速10倍的技术路径

推理工程正在成为AI领域独立的技术分支。Baseten融资130亿美元成为独角兽后,其团队发布了对推理优化的深度解析:量化更多模型参数反而能提升20%吞吐量,因为不同层的误差可以相互抵消。文章覆盖cache-aware路由、分离式prefill/decode、推测解码、KV-cache迁移、模型并行和GPU kernel优化,目标是让前沿模型提速10倍。
评论点赞收藏12 天前

GPT 5.6 价格下调 20%-80%:推理成本因递归自优化在4个月内下降13倍

OpenAI 发布 GPT-5.6 自优化成果,同等智能水平下推理成本在4个月内下降13倍。 GPT-5.6 Sol 自主分析生产流量、调优负载均衡并自动重写 Triton 与 Gluon 内核,端到端服务成本降低 20%;推测解码效率提升超 15%,KV 缓存针对不同工作负载优化批处理与分片。工具层通过延迟发现与提示缓存减少上下文膨胀与重复计算,Codex 默认输出限制 10,000 tokens。
评论点赞收藏16 天前

AI正在吞噬金融;AIE纽约大会开幕

AI在金融领域的应用正在快速落地,OpenAI和Anthropic等公司都在纽约举办活动推出相关插件和Agent模板。 FactSet、Nubank、Intuit、Kepler、Morgan Stanley等机构分享了各自在金融AI治理、Agent评估、供应链安全、可验证AI等方面的实践和挑战。 金融数据客户需要AI技能的所有权、搜索、评估、审计和治理;数字银行通过模拟将Agent评估转化为发布机制;通用LLM无法满足金融场景需求,需要理解真实状态、行动、结果和风险;金融研究中的可验证AI要求每个答案都有溯源、对账和审查。
评论点赞收藏17 天前

多家顶尖 AI 企业联名呼吁人为放缓自动化研发速度

1171 名前沿 AI 实验室员工联名致信美国政府,呼吁建立国际机制以“人为控制”自动化 AI 研发速度。OpenAI、Anthropic、Meta 等公司高管背书,称能力发展可能失控且当前缺乏治理工具。 3 年前马斯克与 Bengio 曾呼吁暂停 AI 研究被忽视,如今支持者发声。信件虽声明仅代表个人立场,但伴随官方账号转发,实际影响力远超此前类似倡议。
评论点赞收藏18 天前

从0到1000万用户:打造ChatGPT工作——Akshay Nathan,OpenAI

使用代码的人大约是能写代码的人的100倍。1 随着“能用”的代码变得更容易生成,这组人可能是最大的奖赏——如果你能把代理界面弄好。 我们一直是关键趋势AINews的追踪功能是今年Codex使用量的爆炸式增长,其中现在的MAU 比2026年1月增长>10倍.不到两周后7月9日发射 OpenAI表示,ChatGPT的工作和Codex已经达成目标1000万用户合并(正如我们在播客中讨论的,Codex现在...
评论点赞收藏18 天前

[AINews] 关于开源权重的喧嚣

Moonshot AI 发布 Kimi K3 开源模型,参数量达 2.8T,上下文窗口 1M-token,视觉理解原生支持,经独立验证超越 Opus 4.8。文章批评当前 Open Weights 讨论多为姿态表演,实际推动者寥寥,建议关注技术报告而非社交媒体情绪。
评论点赞收藏19 天前

Claude Opus 5:以 Opus 的价格实现 Fable 级性能(Fable 价格的一半)

在罕见的周五发布中,《Opus 5》成为了今天的头条新闻。大多数官方基准测试都支持它技术上击败《Fable》,官方消息依然显示”差不多 ”.这主要反映了评估——今日的AIE赛道发布 ( 没有反映出“大模型气味”,而Anthropic显然知道Fable保留了但无法测量。 幸运的是,独立评估确认了Opus的优异表现: @AnthropicAI发布了Claude作品5,成为人工智能指数的新领导者,以及“...
评论点赞收藏22 天前

[AI新闻] Black Forest Labs 发布 FLUX 3:多模态流模型,性能超越 Seedance 2.0 与 Gemini Omni

Black Forest Labs (BFL) 发布 FLUX 3 多模态流模型,支持文本/图像/视频生成及原生音频。文章指出其声称在性能上超越 Seedance 2.0、Gemini Omni 和 Grok Imagine。此外还提及基于 FLUX 模仿的机器人视频动作模型。作为周四 AI 发布汇总的一部分,本文涵盖了 BFL 的最新进展及 OpenAI 新功能的对比。
评论点赞收藏23 天前

Laguna S 2.1发布:比DeepSeek V4 Flash更便宜,性能优于V4 Pro

撇开重新燃起的 蒸馏战争 话题不谈,今天的新闻走势与以往的新闻周期如出一辙——而今天正是发布 我们与康德的访谈 的好日子。这款全新的西方新实验室产品,不知为何竟与 Thinking Machines 相抗衡(其基准测试成绩更优,且体积仅为其十分之一左右),而且比中国同类模型更加高效。 我们实在无法用更好的语言来描述它——不如直接引用下面几位 Reddit 用户的评价:“比Deepseek v4闪存...
评论点赞收藏24 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。