Qwen 3.8 Max(2.4T)与 27B:面向编码与协作的新开源权重模型

在去年的Qwen出埃及记新管理层接手推出更多封闭模型API,当时人们对这个领先的开放模型实验室是否会继续发布相关模型产生了真正的怀疑。

这种怀疑现在已经消失了。Qwen 3.8 Max是一台MONSTER 2.4T型号,本应成为世界上最顶尖的开放型号,但我们已经介绍过的Kimi K3版本.

Qwen在API上以每百万个代币2美元输入/6美元输出的价格提供,但他们承诺会对两种模型进行开放权重。

主要能力与突破亮点

  • 自主长视界编码:
    • 10+天无人值守编码:经过数周的自主运行,从零开始构建了一个自我演化的编码工具。
    • 自主人工智能研究:重建了一篇完整的论文流水线(LLM推理的统一数据选择然后自主运行了一个迭代研究循环,持续了125小时,发明了一种新的数据选择方法,其基准性超过了原论文的基准。+2.71分.
    • 竞争性数据科学:对手526支人类团队在WWW2025多模态对话意图识别挑战赛中,排名前13%(表现优于87%的人类团队)在24小时内。
  • 自主硬件与芯片设计:
    • 执行了完整的硅片设计流程(GCD/RSA加密加速器),从RTL编辑到仿真、综合和物理布局。
    • 门数减少于8,298至678个大门同时实现模具面积减少81%并且在500 MHz频率下满足物理时序闭合。
  • 深入的现实工作与运营:
    • 在数百个专业工作流程中展示了生产级输出(如企业法律审查、UI/UX设计、结构工程模型和自动化ETF量化研究)。
    • 在电子商务工作台(365天的商店运营模拟),生成4.16倍回报(¥416,252余额)通过持续的博弈论谈判和库存规划。
  • 多模态代理与视觉反馈:
    • 整合了跨规划、编码和图形界面交互的原生视觉反馈,实现跨平台(桌面、移动、网页)的直接应用创建。
    • 发布Qwen-MM-插件将多模态能力扩展到现有代理框架。

对公开重量来说,这是一场非常棒的胜利!开始今天的巴塞顿播客我们谈到了支持这些大规模模型发布的体验。

2026年7月25日至2026年7月27日的AI新闻。我们检查了12个子版块,544条推特不再有Discord。AINews网站允许你搜索所有过去的问题。提醒一下,AINews 现已成为 Latent Space 的一个部门.你可以选择电子邮件频率!

AI推特回顾

头条新闻:Qwen 3.8 Max 开放型发布

发生了什么

阿里群岛Qwen宣布Qwen3.8-Max为其新旗舰,并表示开放重量系统将于下周推出。

  • 阿里巴巴的引入Qwen3.8-Max称其为“迄今为止最强大的型号”,并称其为2.4T参数该模型专注于编码、长期代理工作和多模态推理,明确主张公开重量将于下周发布,并列Qwen 3.8-27B我也转为无障碍级别@Alibaba_Qwen
  • 发布推文还包括了API定价:$2.00 / M 输入代币,$6.00 / M 输出代币, 和$0.25 / M 缓存令牌 @Alibaba_Qwen
  • 阿里巴巴围绕几个主要功能构建了该模型:10+天的自主编码,500+匝芯片设计优化,电商365天战略, 和原生多模态智能视觉是执行循环的一部分,而不仅仅是输入通道@Alibaba_Qwen
  • 公司同时推动了自家表面和合作伙伴的可用性:Qwen 工作室,API,指令代码,以及之后威尼斯;基础设施和应用构建者迅速确认了支持计划或集成,包括巴塞顿,赫尔墨斯特工, 和指令代码 @Alibaba_Qwen @Alibaba_Qwen @baseten @Teknium
  • 这一宣布作为更广泛模式的一部分出现:多位观察者将其描述为中国的开放重量前沿车正直接与西方顶级封闭车型竞争尤其是在编码、代理工作流和多模态任务中@kimmonismus @matvelloso

官方声明与报告规格

厂商报告的车型细节和性能声明对于开放重量发布来说异常激进。

  • 阿里巴巴自己的框架:
  • 来自ZhihuFrontier的第三方摘要推文补充了更多声称或报道的技术细节:
    • 每个代币95B的激活参数,这意味着MoE激活比大致为4%
    • 1M标记上下文窗口
    • 暴露的API。低/中/高推理-努力模式
    • 兼容性OpenAI与Anthropic协议
    • 基准宣称:纸质长凳 93.0,CoWorkBench 74.8,宽搜索81.9 @ZhihuFrontier
  • Vals AI 独立发布了具体的评估/运行时设置:
    • 1M 令牌上下文
    • 128k 最大输出令牌
    • 测试地点温度 0.7默认的 top-p / top-k@ValsAI

这些数据很重要,因为它们将Qwen3.8-Max与其他大型稀疏开放模型(如Kimi K3以及GLM-5.2,而不是更实用的30B–70B本地层。

独立评估与排行榜排名

该模型立即在第三方方面取得了强劲表现,尤其是在编码相关、视觉和设计为重的领域。

  • 前端代码竞技场:Qwen3.8-Max 首次亮相于#4,整体排名第1,668 Elo。,仅克洛德作品5 [最高限度] 1705以及Kimi K3 [Max] 1676,大致与克洛德作品5【高音】,1669 @arena
  • 在前端代码竞技场子片中,它的排名是:
    • #2 消费品
    • #3 品牌与营销、参考设计、游戏、内容创作工具
    • #4 数据与分析
    • #5 模拟 @arena
  • 愿景竞技场:Qwen3.8-Max排名#2其中1,305,只有落后克劳德·福布尔5分13分【高分】 @arena
  • 虚假索引:Qwen3.8-Max排名#2 在无重型号中,43辆车中排名第10,得分为66.1 @ValsAI
  • 瓦尔斯还报道:
    • 它与克洛德作品4.7相匹配在目录中,66.1 vs 66.1
    • 大约在每次检测成本降低2.3倍:2.68美元对比6.17美元 @ValsAI
  • Vals的基准数据:
    • SWE替补席:87.3%,在GPT-5.5(82.6%)以及GLM-5.2(83.3%),但落后克洛德作品4.8(89.2%)
    • 终端工作台 2.1:67.4,从上61.0Qwen 3.7 Max@ValsAI
  • 瓦尔斯还强调了进展的速度:
    • Qwen 3.7 最大值 = 57.5
    • Qwen 3.8 最大 = 66.1
    • 增益8.6分,时间~2.5个月
    • 降价$2.50/$7.50到$2.00/$6.00输入/输出@ValsAI

还有一些更多轶事性但技术上相关性的说法:

  • 一位用户可视化了基准差值并提出了异议“Opus 4.8 大部分被 3.8-Max 所吸收”在他们重建的图表上@deliprao
  • 另一位声称Qwen 3.8在终端长椅上超越了Fable 5并表示Anthropic现在正面临明显压力@kimmonismus
  • 另一条推文叫Qwen 3.8 Max the“最佳物体检测VLM”涵盖卫星、红外、文档、技术图纸、草图、拥挤场景和小物体,尽管这些内容基于示例而非引用的基准论文@skalskip92

事实与观点

事实 / 直接归因的主张

  • 阿里巴巴宣布Qwen3.8-Max并且说公开重量赛将于下周发布;Qwen 3.8-27B也会选择纯重@Alibaba_Qwen
  • 阿里巴巴披露了API定价每百万个令牌,输入2美元,输出6美元,缓存0.25美元。 @Alibaba_Qwen
  • Arena报道#4在Frontend Code Arena,1668以及#2 在 Vision Arena 1,305 分 @arena @arena
  • 瓦尔斯报道Vals指数上的66.1,#2 在无重型号中,87.3% SWE替补,67.4 终端-工作台 2.1,1M背景,128k输出,且每次测试的成本低于作品4.7@ValsAI @ValsAI @ValsAI
  • ZhihuFrontier表示95B活动参数以及协议兼容性;这似乎是一份次要摘要,而非原始阿里巴巴规格表@ZhihuFrontier

观点 / 推断 / 修辞

  • “中国不再落后,而是在平等的竞争中”@kimmonismus
  • “开放模型现在正在获胜”@JonathanRoss321
  • “看起来作品4.8大部分被吞没了”@deliprao
  • “人为受到压力”和“情绪剧烈转变”是生态系统的读数,而非测量@kimmonismus
  • “最佳对象检测VLM”是一个有根据的产品判断,但并非与标准基准表绑定在线程内@skalskip92
  • 声称Qwen3.8-Max加上开放智能体证明开放模型“赶上”的说法,是用户层面的解读,而非共识评估结论@omarsar0

即使剥离了炒作,核心事实故事依然强有力:a非常大的稀疏模型,无重承诺,价格低于之前的Qwen Max。, 和在多个第三方排行榜上排名很高.

基础设施现实:“开放权重”并不意味着易于运营

讨论中的一个重要反驳是,前沿开放模型在操作上是开放的,但在局部推断意义上并不广泛可及。

  • Jamin Ball认为,定价比较被夸大了,因为“原版”代币价格忽视了代币效率,而且这些模型巨大:
    • Qwen 3.8 Max >2T 参数
    • Kimi K3 ~104B active per token
    • GLM 5.2 = 总计744亿,活跃40亿
    • 对于K3来说,单靠负重是>1TB内存
    • 至少需要8 块 H100/B200 GPU去跑步
    • 登月推荐64+加速器在超节点风格设置中@jaminball
  • 同样的批评隐含适用于Qwen3.8-Max,尽管其主动参数数量略低于K3:2.4T类的MoE并非商品本地模型@jaminball
  • StableQuan 对同一观点的实际版本表达得更直白:冗长且内存占用较大的提示和缓慢的工具调用,使得大型模型在消费级硬件上变得痛苦,建议改用 API@stablequan
  • 与此同时,周围的兴奋感Qwen 3.8-27B许多开发者认为真正的采用浪潮可能来自:同一家族中一个较小的开放权重后代,可能继承旗舰机的部分培训后或精炼能力@kimmonismus @TheZachMueller

这是开放模型故事的关键分歧:生态系统影响力和基准认证来自发布2.4T旗舰机;实际大规模部署可能来自27B版本。

许可争议与地理限制

最明确的怀疑反应不是关于性能,而是关于授权。

  • OstrisAI标记了他们认为是许可禁止的内容,涵盖了美国、欧盟、英国和韩国他表示,这些条款似乎甚至禁止从美国下载该模型@ostrisai
  • 这一担忧呼应了另一款开放权重发布MiniMax H3的更广泛讨论,用户认为地理限制削弱了开放性的主张@kimmonismus
  • 阿里巴巴本身的数据集中没有出现澄清Qwen许可的推文,因此限制性许可的解读在这些推文中仍未得到解决

对工程师来说,这比营销标签更重要。“开放重量”仍然可以指:

  • 没有OSI式的开源权利,
  • 使用场景限制,
  • 出口/管辖权限制,
  • 或者在关键地区没有商业部署的合法许可。

这种许可模糊性是部分反应更谨慎而非庆祝的主要原因之一。

发布在战略上的重要性

这被阿里巴巴广泛解读为战略转变,而不仅仅是例行产品更新。

  • 直湖前线明确将此举描述为阿里巴巴选择生态系统对排他性的影响,之前的论证马克斯模型保持关闭,而开放式排气线此前已达到约Qwen3-235B @ZhihuFrontier
  • 在那个解读中,深搜,有些以及其他中国开放模型削弱了顶级系统仅支持API的优先性,促使阿里巴巴在生态系统采用度和模型质量上竞争@ZhihuFrontier
  • 多位观察者将Qwen3.8-Max与更广泛的中国模型激增联系起来:
    • “前脸设计前三名现在由两款中国车型和一款西方车型共同占据”@kimmonismus
    • “还记得中国落后两年吗?”@matvelloso
    • “过去两年,公开重量领域一直由中国实验室主导”@_micah_h
  • 有些发帖者将此事升级为地缘政治担忧,认为美国实验室不能永远依赖封闭模型的线索,尤其是如果中国实验室继续将前沿系统推入开放权重通道@kimmonismus

这里的潜台词是护城河可能正在移动:

  • 不仅仅是原始的预训练,
  • 但是培训后,代理线束,推断基础设施,蒸馏管道, 和开发者锁定.

这正是为什么2.4吨的开放级旗舰赛具有战略价值,尽管很少有车队会自行承办。

模型架构与稀疏性影响

技术特征显示阿里巴巴比一些竞争对手更倾向于稀疏的MoE。

  • 如果95B活跃 / 总计2.4吨ZhihuFrontier引用的数字准确,Qwen3.8-Max仅激活约4%每个代币的总参数@ZhihuFrontier
  • ZhihuFrontier将其与Qwen3-235B-A22B他们说,该激活点更接近10% @ZhihuFrontier
  • Elie Bakouch 更广泛的评论——“世界上最大的两个 OSS 模型使用线性注意力?”——捕捉了生态系统讨论中的另一条架构线索,尽管该线索并未直接关联到 Qwen3.8-Max,且线中引用了来源@eliebakouch
  • 围绕稀疏的 MoE 和 Switch TTChangemer 的广泛讨论反映了人们为何在意这些参数数:前沿的开放模型看起来“存储巨大但运行成本低廉”,因为每个代币只激活一个狭窄的专家切片@ProfTomYeh

这很可能是阿里巴巴降低API定价同时向上扩展总参数数的部分原因:更大的专家池,更低的活跃占用,更低的有效推理成本假设路由和系统优化在生产环境中依然有效。

长期代理、合作项目与基准匹配

Qwen3.8-Max 被定位为长期工作的模型-框架,而非聊天机器人。

  • 阿里巴巴自己的语言强调“编码与协作”,而非泛泛的助理使用。@Alibaba_Qwen
  • 发射声明与当前“长期探测商”论调异常契合:
    • 10+天自主编码
    • 500+回合在芯片优化中
    • 365天商业战略@Alibaba_Qwen
  • ZhihuFrontier的基准推荐——纸台,CoWorkBench,广域搜索——所有这些都强调持续的客观维护、工具使用和弹道一致性,而非一次性问答@ZhihuFrontier
  • Omar Sar0 明确将此次发布与 agent harnesss 联系起来,表示使用 Qwen3.8-Max 在赫尔墨斯特工这使得开放式前沿模型与封闭式前沿系统之间弥合了差距的事实变得难以否认@omarsar0
  • Cline关于开放权重模型的另一个讨论是相关的背景:他们认为许多开放模型经过强化学习训练,会花更多代币进行验证,并且当工具允许它们发挥这种行为时效果最佳,产生~20% 的增长仅凭换安全带@cline

这与Qwen3.8-Max发布的叙事异常契合。其含义不仅仅是“模型更智能”,而是“当模型与专为长期验证重度工作设计的线束结合时,可能更具竞争力”。

反应中的不同视角

支持性

  • 开放模式开发者和基础设施提供商的强烈热情:
    • “Qwen 3.8 Max和新的本地27B频道Qwen 3.8即将推出”@Teknium
    • “是的,我们将有Qwen3.8-Max。”@baseten
    • “试试Qwen3.8-Max在赫尔墨斯特工上......”@omarsar0
    • “不错!开源的Max模型”@NerdyRodent
  • 多位评论者将此次发布视为证明开放模型处于或接近前沿的奇偶在有意义的工作量上@JonathanRoss321 @kimmonismus

中立/分析型

  • Jamin Ball的帖子是主要的“是,但是”的反应:
    • 价格差距可能被夸大了,
    • 代币效率很重要,
    • 对于>2T开放型号,基础设施负担依然极高@jaminball
  • Nrehiew质疑性能提升是否可能更多来自训练后而非新预训练,本质上是在问差异中有多少是配方还是规模@nrehiew_
  • 瓦尔斯补充了一个重要的方法论说明:阿里巴巴公布的终端工作台结果调整了基准超时而Vals则保留了原始的超时时间@ValsAI

持怀疑态度/反对

  • 许可问题是最明确的实质批评:如果在主要市场限制使用,“开放”的主张就会变得更狭窄@ostrisai
  • 一些最强烈的怀疑是间接的:如果这些庞大的开放权重模型需要超级节点和精心的线束工程,那么它们的实际竞争效果可能没有排行榜标题所显示的那么显著@jaminball
  • 还有更广泛的生态系统怀疑,认为仅靠基准跳跃就能与最强的封闭模型完全平等;例如,一些用户认为开源“非常接近”,但实际上在顶级代理编码方面还未达到@scaling01

背景:2026年开放模型周期中的Qwen3.8-Max情况

此次发射位于中国实验室密集的巨型开放或准开放释放物群中。

  • 讨论中反复提及的对比集:
  • Artificial Analysis评论中引用的评论称,中国前沿模型总体落后于美国顶级车型大约3–9个月而无重级前沿领域则由中国实验室主导,时间大约是两年 @_micah_h
  • 这有助于解释为何此次发布会引起如此多关注:这不仅仅是又一次车型发布,而是一次明显的调整,其中:
    • 中国在开放权重前沿秤
    • 美国实验室仍然常常领先封闭模型的顶尖表现
    • 在某些领域,如编码、设计和一些多模态任务,差距正在缩小@_micah_h @kimmonismus

对工程师的实际影响

对于工程师来说,最重要的问题不是营销宣传,而是部署形状。

  • 如果你想要边境级别的空重质量,Qwen3.8-Max 建议现在的权衡空间是:
    • 评估表现非常强劲
    • 激进的代币定价
    • 巨大的供应空间
    • 可能的许可/管辖权限制
  • 该1M背景以及128k输出数字使其适用于存储库规模和工作流程规模的任务,这些任务需要转录重用和缓存定价@ValsAI @Alibaba_Qwen
  • 该缓存代币价格为$0.25/M对于反复回放代码库、工具追踪和大指令前缀的代理来说尤其相关@Alibaba_Qwen
  • 宣布Qwen 3.8-27B它可能和旗舰机一样重要,因为它是最有可能在更广泛的开源堆栈和本地服务生态系统中真正可用的层级@Alibaba_Qwen @kimmonismus
  • 已有几位开发者将此次发布从下游线束和代理角度出发,而不仅仅是聊天用户体验:赫尔墨斯特工,指令代码,巴塞顿,且任何支持OpenAI/Anthropic兼容协议的提供商都能迅速将其纳入现有工作流程@Alibaba_Qwen @Alibaba_Qwen @baseten
  • TeortaxTex 的一个显著解释是,Qwen 3.8 Max 可能是:
    • 异常强劲图像识别/标签
    • 有可能样本效率
    • 可蒸馏/OPD化为Qwen 3.8 27B对于任务特定水平,意味着从旗舰能力到笔记本电脑部署专用的路径@teortaxesTex

其他话题

代理基础设施、线束与长视野系统

  • 一份详细的调查摘要认为,长视野能力是×型线束属性,而不仅仅是模型属性;它将失败分解为目标漂移、上下文损坏和稀疏奖励/不可逆动作问题,并将控制平面框架为从提示工程转向运行时线束 @ZhihuFrontier
  • Cloudflare 启动@cloudflare/计算机,一种能够动态在隔离和Linux容器之间路由的代理运行时,使每个代理拥有“自己的计算机”@Cloudflare
  • 光标报告代币效率提升20–30%对于云代理和电脑运行效率提升80%,并推出了谷歌工作空间跨 Gmail、云端硬盘、日历、文档和表格访问@cursor_ai @cursor_ai
  • LangChain 发出信号管理深层特工进入公开测试版,内置评估、内存、OAuth 工具访问、渠道集成和沙箱功能@hwchase17
  • 多篇文章强调,工具选择会实质性改变基准结果和生产行为:
    • 终点选择的变化Kimi K3CEO-Bench 的成绩非常显著@tonychenxyz
    • Cline表示,开放权重模型通常在允许在验证上花费额外代币时受益,结果是~20% 的增长在他们的连载中@cline
    • 新报纸组织41种代理故障模式通过交互边缘而非单一组件,实现自动标记覆盖范围k = 0.76对人类@omarsar0

基准测试、评估以及自动化的研究/后期培训

  • RSIBench-Data 结果Kimi K3 + Kimi Code在27.317%加权分数涵盖六个基准,包括50% 软件工程师实验室验证以及17% SWE-bench Pro @FanqingMengAI
  • Intology表示,其自动化人工智能研究系统基因座SOTA 是否开启PostTrainBench,以及Locus后训练Qwen3 1.7B 基础变体版本超过了官方人类后期训练的Qwen3 1.7B版本;在Kaggle的实时合成中,它达到了第四高的平均排名之后16天 @intology
  • 纪元更新镜像代码其中Claude Fable 5 以 64% 的破解率以及GPT-5.6 Sol 20%,使用15个中大型项目,每人有两种语言, 和每次尝试可获得10B个代币 @EpochAIResearch
  • 沙胡勒斯主张应该发布基准数据航迹,不仅仅是分数,因为任务缺陷和脆弱验证器可能主导失败;他们还强调ITSMBench作为一个开放基准测试,具有发展轨迹@Shahules786
  • 新的评估/基准检测结果包括:
    • 商人长椅: 365天电子商务模拟98,843条产品记录,26个工具,总净资产得分@dair_ai
    • 更深一层:基于重复模平方的自适应计算挑战@SolidlySheafy
    • Artifacts Hub / 采用仪表盘追踪792个开放模型、下载、情报和地理@natolambert

开放模型、推理与系统工程

  • 多篇帖子强调,开放前沿如今已被中国巨头MoE主导,Kimi K3、Qwen3.8-Max、GLM和DeepSeek经常被拿来比较规模、成本和性能@_micah_h
  • Databricks 声称#1 Kimi K3 推理速度/延迟关于人工分析,引用239 tok/s在一个柱子中,以及来自Casper Hansen的独立单节点编号。947 tok/s 批次-32解码以及152 Tok/s 单用户在单一B300节点 @Yuchenj_UW @casper_hansen_
  • Vikhyat宣布光子2.0,将Moondream、Qwen 3.5和Gemma 4整合为巨核横跨全前传@vikhyatk
  • 系统论文讨论串TokTier有人认为分词化可以消耗最多64%的TTFT在缓存代理工作负载中,带状态令牌化通过 TTFT 减少16–34%以及渐进修复437×更快在某些设置中,高频分词器(HF tokenizer)更甚@omarsar0
  • DSPy 3.3.0 发布:
    • DSP。Flex用于优化代码+提示
    • ReActV2使用原生/并行工具调用
    • 类型化的提供者-中性LM接口@isaacbmiller1

多模态、视频和视觉模型

  • MiniMax H3Qwen之外的主导讨论:
    • 描述为33B带有文本/图像/视频/音频引用的视频模型,最高可达15秒夹子,可在其中运行RTX 5090有了ComfyUI协议栈40GB以及5代后~5.5分钟在早期测试中@kimmonismus
    • 后续排名视频竞技场中的#1开放模特, +280分超过次佳开场,整体图像与视频排名并列前列@arena
  • 关于H3的许可问题也曾有激烈争论:一方认为它不能在美国、欧盟、英国和韩国以公共许可证合法使用。@kimmonismus而另一种明确的正式授权则通过MiniMax获得,且“法律上不能使用”则过于严格@VictorSuOrtiz
  • Jina被释放Jina-Reranker-v3.5, a0.6B按列表重新排序评分63.20 nDCG@10 在BEIR,拍打Qwen3-Reranker-4B大致在7× 参数更少 @JinaAI_
  • Qwen3.8-Max 还引起了视觉/物体检测应用的关注,包括文档、红外、卫星和拥挤场景,声称每张图片的成本约为0.007美元 @skalskip92

前沿实验室、政策、安全与竞争

  • 时间线上的一个大型元线索美国与中国以及中国实验室是否正在追赶或已经领先某些开放/前沿细分领域:
    • Hugging Face CEO报道称中国正在赢得/主导开放模式@CNBC
    • 引用人工分析数据称,中国领导人历来落后于美国顶尖车型3–9个月 @_micah_h
    • 一些发帖者认为,尽管资源不对称,中国的综合科研能力可能已经超过美国实验室@teortaxesTex
  • 据报道,白宫邀请了OpenAI、Anthropic、Google 和 Meta审查一个新的自愿人工智能框架并最终确定了新的网络安全测试/黑客基准@steph_palazzolo @AndrewCurran_
  • 网络安全依然是一个主要的子主题:
    • Epoch大致报道2500个高危重度CVE7月披露21个主要科技组织,关于5×此前Anthropic自主发现露点前的月度记录@EpochAIResearch
    • Hugging Face的采访认为,开放权重模型是OpenAI关联黑客事件后防御反应的一部分@BloombergTV @BusinessInsider
  • OpenAI 宣布了内部下一个模型的发现关于数学/理论计算机科学中长期存在的未解决问题的10个新结果大约2000美元以GPT-5.6 Sol的代币成本计算,这引发了人们对总尝试成本与已解决成本会计的既兴奋又持怀疑态度@OpenAI @NickEMoran
  • OpenAI 还发布了技术深度分析,内容包括GPT-Live注意专用低延迟音频路径、异步推理/工具使用以及启动时间从往返6次,1次 @OpenAI @gdb

产品与生态系统说明

  • 谷歌推出了双子星火花自动浏览使用 Chrome 在登录账户中执行任务,并对敏感步骤进行用户确认@Google
  • Google AI Studio促使开发者开展当前的“氛围编码”项目,而Gemini侧的产品信息则强调在Notebooks/Canvas中构建业务的工作流程@GoogleAIStudio @Google
  • 萨卡纳号下水Namazu API,被描述为基于有些并针对日语/文化/商业进行调校,减少不必要的拒绝和偏见@SakanaAILabs @SakanaAILabs
  • LiteParse 增加了直接结构化的 PDF 提取功能,用于表单字段、复选框状态、注释、嵌入图片、矢量图形、标签结构和字级边界框MS/页面对于简单的页面@llama_index
  • Hermes 代理生态系统发布了大量“Herald”版本,包含语音聊天、基于插件的桌面功能、A2A协议、外呼webhook、研究和生产力技能,以及令牌效率提升@Teknium

中国的开放模式浪潮:Kimi、DeepSeek、GLM与日益缩小的差距

  • 无障碍级前沿如今看起来由中国主导:在整个文摘中,主导的元故事是中国实验室在开放模型领域引领潮流.来自的帖子@kimmonismus,@JonathanRoss321, 和@_micah_h所有这些都指向同一模式:Kimi、Qwen、DeepSeek、GLM和MiniMax现在定义了开放前沿的大部分,而美国实验室主要在部分封闭式产品中保持领先地位。@ClementDelangue相关报道进一步放大了中国主导开放重量区的更广泛说法。
  • Kimi K3 与背带灵敏度K3继续发布强劲的下游和下游成绩。RSIBench-Data报道Kimi K3 + Kimi Code在27.317%加权分数涵盖六项自动化研究基准,包括50% 软件工程师实验室验证以及17% SWE-bench Pro.但是@tonychenxyz指出一个关键的工程注意事项:推理提供商实质性改变了排行榜结果,其中一个提供者产生了退化的循环行为,而Modal的终点在CEO-Bench上获得了#1的结果。在服务端,@Yuchenj_UWDatabricks现在已经实现了239 tok/s以及K3的最高延迟,而@casper_hansen_引用第32批次解码吞吐量为947 tok/s在单个 B300 节点上。
  • DeepSeek V4闪存器作为性价比破坏者:Deepseek 最新的 Flash 检查点成为当天最强的成本调整代理模型故事。@htihle报道57.1% / 63.0%在WeirdML上为Flash-0731高/最大能力辩称,背带可能低估了真实能力。错误叫DeepSeek V4 闪光灯(0731)该Vals指数60以上最便宜的车型, 和35×便宜而在该阈值下,下一个最佳模型,而大部分优势来自编码和代理任务。共同人工智能立即将其定位为长期运营代理的生产终端。
  • GLM与未来展望:建议多篇帖子GLM-5.3即将发布,包括@AiBattle_以及@arena,这提醒读者GLM-5.2 Max已经坐下了#2 整体评价以及#1 开门在Frontend Code Arena中。

代理工具、长视野系统,以及为何仅靠模型质量已不再足够

  • 安全带已经成为控制平面:技术推文中反复出现的一个主题是,长期视野表现现在最好理解为×型线束,而非仅靠模型。详细的调查摘要来自@ZhihuFrontier将长期视野能力框架为基础模型与运行时系统共同演化的产物,负责内存、规划、工具使用、验证、编排和恢复。这与@omarsar0,他重点介绍了一篇分类论文41种代理故障模式通过模型、用户、工具、内存和环境之间的交互,而不是单一归咎于某一个组件。
  • 制作时长发货速度很快:Cloudflare介绍@cloudflare/计算机,一个能动态切换轻量隔离和完整Linux容器的代理运行时。光标他们说其云代理现在已经代币效率提升20–30%以及电脑运行效率提升80%接着是直接Google Workspace 插件适用于Gmail、Drive、日历、文档和表格发射.LangChain说管理型深度特工将进入公开测试阶段,内置评估、内存、开放模式、通道和沙盒功能。
  • 开放模型的线束协同优化开始变得重要:克莱恩这是当时最敏锐的实践观察之一:许多开放模型出现强化学习训练用来花费额外的代币验证工作——重跑测试、检查构建、重新阅读差异——而克莱恩故意让他们“按照训练的方式工作”,大致地说20% 的增长仅从背带更换来看。这个主题也出现在其他帖子里赫尔墨斯特工来自@Teknium该项目发布了语音激活、插件/API扩展、A2A协议支持、外呼webhook、研究技能以及重大代币效率改进。
  • 内存和解析在可能的情况下被去LLM化:@dair_ai重点零记忆该方法将LLM调用从内存维护中移除,仅在最终响应时调用LLM,从而降低内存运算成本57.6%对比匹配预算下的最快基线。羊驼指数同样,更丰富的结构化PDF提取LiteParse,可以展示字段、复选框、注释、图形和页面复杂度信号,而无需为每页都配备视觉模型。

自动化研究、后期培训和基准设计正逐渐成为更严肃的工程学科

  • 自动化的后期培训正在带来真正的成果:@intology声称其基因座系统是PostTrainBench上的WAR并且可以进行后行Qwen3 1.7B-基底超越官方人类调校的变体Qwen3 1.7B Instruct模型在扩展计算预算下。同一帖子说Locus推广到了实时Kaggle竞赛,达到了第四高的平均排名16天后。单独,@mervenoyann指出基于沙箱任务、TRL和验证器的编码代理强化学习管道的公共工具。
  • 自动化基准研究揭示了束带效应:简洁却信号明确RSIBench-Data 结果以及@gneubig的反应强调了非常长远的自动化研究任务正在日益被测量专用研究工具,不仅仅是模型智力。这也出现在来自的批评中@Shahules786,论证基准应开源完整轨迹,因为仅凭分数无法判断失败是由于模型薄弱、验证器脆弱还是任务要求不足。
  • 噪音、验证和被忽视的现实依然刺痛他们:@ddkang反驳了那个想法RLVR数据100%噪声匹配干净数据训练与报告>9% 数学准确率降低在更严谨的噪声数据构造下。@ArmenAgha共享一个较小但有启发性的结果,即优化代理目标提升了所选速度MSE,但这让实际的推断推断变得更糟基于被保留的数据。这提醒我们,许多“自我提升”的标题如果评估不够有力,仍然会崩溃。

多模态与视频系统:MiniMax H3、世界模型与本地生成

  • MiniMax H3 是多模态/视频版本的杰出版本社区的反应显示MiniMax H3是开放权重视频生成的一大进步。@arena排名为视频竞技场中的#1开放模特无论是文本转视频还是图像到视频,均为+280分在次优的开放模型之上;在图像到视频方面,它实际上并列#1 整体.@MiniMax_AI说的H3现在是SOTA 开放视频生成模型同时用于Arena和人工分析基准测试。
  • 为什么H3在技术上很重要: 多篇帖子强调H3不仅仅是另一款T2V模型,而是通用多模态生成模型文本、图像、视频和音频在一个上下文中,以及可用的本地部署路径。@kimmonismus关键警告总结得很清楚:开放重量,强大的本地视频潜力,但这不是完全开源的技术栈,由于上下文编排、2K 再生和少量关注仍限于服务器端或其他方面。@ComfyUI,@victormustar, 和@MiniMax_AI所有这些都强调了实用的本地工作流程,包括RTX 5090级使用。
  • 授权问题依然混乱关于H3的地理限制存在混淆。@ostrisai最初将许可证理解为禁止在美国/欧盟/英国/韩国,这种担忧也随之蔓延开来。后来,@VictorSuOrtiz澄清了这些区域需要正式授权流程而不是完全无法授权,这对于评估部署能力的团队来说是一个重要的区别。
  • 世界模型和多模态仿真仍是一个新兴的主题: 几篇参与度较低但技术上实质性的帖子指向无监督潜模拟器以及作为不断发展的领域,世界模型风格的系统包括@soniajoseph_以及@taiuti.

推理系统、编译器、实时语音以及其他值得追踪的基础设施

  • OpenAI 的实时语音栈重设计:OpenAI详细描述了新的GPT-Live支持全双工对话的架构——边听边说——通过分离专用快速音频路径避免了较慢的异步推理/工具使用路径。他们还减少了会话启动时间从六次网络往返一次并在链接的工程文章和后续讨论中讨论了长上下文语音会话的异步压缩@juberti.
  • 编译器正在吞噬手工调优的推理内核:@vikhyatk已宣布光子2.0,一个能够转模型的编译器,如月梦、Qwen 3.5和Gemma 4进入巨核将整个前向传递表示为单一 GPU 程序。该讨论串描述了一个用于数据流规范的追踪器 DSL 和一个用于编译前修剪调度候选节点的 CPU 成本模型。这与更广泛的讨论相呼应@waterloo_intern,他认为经典的手工优化GPU内核工作正逐步自动化和商品化。
  • 代币化和服务瓶颈现已成为一流:@omarsar0重点TokTier,一种有状态的令牌化服务,用于重用和修复代理会话的令牌化前缀,并进行报告16–34%的TTFT减免在vLLM下及以下437×在增量修复场景下,这比标准的Hugging Face标记化更快。这正是当代理转录变得很长、缓存命中率高时,那种“非模型”瓶颈就很重要。
  • 较小但显著的工具:吉娜 AI发布Jina-Reranker-v3.5, a0.6 亿列表级重排序器宣称63.20 nDCG@10 在BEIR还有殴打Qwen3-Reranker-4B大致在减少7×参数;DSPy 3.3.0通过以下方式增加了代码和提示符优化DSP。Flex改进了工具的使用情况ReActV2以及一个与提供者中立的LM接口。

热门推文(按互动数)

  • Qwen3.8-Max 版本阿里巴巴宣布2.4T下周的旗舰版Open Weights是该套装中规模最大的技术发布@Alibaba_Qwen.
  • OpenAI数学成绩:OpenAI表示,其下一个主要模型的内部版本已生成关于长期悬浮问题的10个新结果数学和TCS大约是这样2000美元 GPT-5.6 等值代币成本 @OpenAI.
  • GPT-Live 架构:OpenAI的新实时语音协议支持说话时持续监听和异步工具/推理执行@OpenAI.
  • 源代码抽象之争埃隆·马斯克曾辩称源代码正处于类似汇编的边缘,AI最终会直接将意图编译成二进制@elonmusk.
  • 光标工作区集成: 光标已发货代理访问权谷歌工作空间应用程序,将编码代理更接近一般工作自动化@cursor_ai.

AI Reddit 回顾

/r/LocalLlama + /r/localLLM 回顾

1. Qwen3.8-Max和27B无障碍级发射

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论