参数之死:Z.ai CEO唐杰谈GLM 5.3与后训练缩放定律
我们已经涵盖了 GLM 5.2 之前非常兴奋,唐杰教授相信会有一个 Fable级模型将于年底开放重量 (抽查——还剩134天,现有两款2-3T车型(酷文3.8最大 和 基米K3)估计寓言是 3-7T,仅AA指数上涨2点.)
唐杰教授回归X频道告诉我们,我们对模型尺寸的简写已经不够了:参数计数只有在另外三个因素中才有意义——具体有多少数据你有,你打算在哪里度过你的计算,以及谁将运行该模型,在什么条件下.”
我们已经涵盖了龙猫(和龙猫之后)过去LS年份的定律,但我们就跳过历史课,但有必要理清为什么Chinchilla的假设是错误的推断屈折世界(无固定数字,介于200-900 tok/param之间,引用如下Roberts 等人关于任务依赖性)。
简而言之:记忆更倾向于更多参数。推理更倾向于更多训练后的数据,有效深度.GLM-5.3大幅跳跃完全来自强化学习,尤其是在长视野环境中:
这些环境现在涵盖了更广泛的生产工作流程,任务围绕工程和研究工作在实际执行中的实际执行方式设计。有些工程师需要数天时间才能完成。例如,在机器学习基础设施任务中,模型可能与工程师处于相同的工作环境,且访问计算集群、存储系统、内部文档、代码库和实验结果.它必须诊断训练栈中的瓶颈,实施优化,运行实验,并在保持正确性的前提下实现可衡量的端到端加速。在这一层次的环境中训练会推动模型趋向于对大量工作的所有权,端到端而不是依赖用户拆解问题并监督每一步。
给后续人员递归自我提升的故事,他们的整个环境、评判和验证过程都是人工的:
随着代理能力的提升,训练后扩展的难度从模型转移到了环境。一个有用的任务环境必须是可执行的、可验证的,并且接近真实的专业工作——我们需要很多这样的环境,而不是几台手工构建的。为了扩大这一过程,我们建造了集成环境的管道对于部分任务,也包括强化学习的奖励信号。研究代理从真实工作中收集任务模式,并将其转化为具有多步依赖关系和隐藏状态的可运行长期环境;法官代理随后尝试每个任务,以验证其是否真的可解决。验证器在不访问参考解的情况下合成,而求解器轨迹则用于发现和关闭奖励捷径。通过oracle、no-op和unsolved状态检查的验证器会产生足够可靠的二元奖励,可以直接训练。
为了结束对参数计数的痴迷,杰教授指出了5个缩放旋钮,包括MoE稀疏性,其中新的XA-YB符号.他指出,高级技能(例如发现软件漏洞)并非检索或记忆问题。
它们需要携带较长的因果链(20+推理步骤)而不丢失线索。一旦达到某个知识持有阈值,该能力就不再存在于总参数计数中。
而且看起来还有许多路要走。
2026年8月18日至8月19日的AI新闻。我们查了12个子版块,544条推特不再有Discord。AINews网站可以搜索所有过去的期刊。提醒一下,AINews 现已成为 Latent Space 的一个部门.你可以选择电子邮件频率!
AI推特回顾
开放权重模型、压缩与基准移动
- Ornith-1.5 作为一个严肃的新开放家庭登陆:@ornith_发布奥尼斯-1.5在9B密集,35B MoE,397B MoE变体其中,其量子化格式包括FP8、GGUF、MLX和NVFP4.标题是端到端的自我提升模型提出任务,生成支架,并生成强化学习(RL)推广,以创造新的培训体验。报告的评估在代理/编码工作负载中表现强劲,包括终端工作台2.1:86.1,SWE-替补认证:86,DeepSWE:56,HLE:44.6, 和工具十项全能:71.2.释放装置迅速接入了发球堆,由vLLM以及奥拉玛.
- 压缩效果持续加剧,但并未完全削弱效用:@UnslothAI以及@danielhanchen全新发货Qwen3.8-27B GGUFs使用动态V3,大致声称准确率提高10%保持相同大小和释放1位量化仍保持约BF16准确率的77%在继续运行时8GB 内存.他们的新分歧-300度量通过以下未公开的例子,将前1%的贪婪准确率扩展到更长的世代中。终端长椅,DeepSWE,以及相关任务。
- 代理人和法律评估委员会仍在不断调整:@arena发表了帕累托观点特工阿雷纳, 其中克劳德作品5(高音)以高品质为主,但价格较低的型号如Kimi K3,GLM 5.2,格罗克4.5, 和GPT-5.6 露娜定义价值前沿的大部分内容。单独,@ValsAI报道格罗克4.6在#3/49关于法律研究小组其中48.1%,50万背景、工具/图像/文件支持,以及相对较低的价格。对于开放模型,@ValsAI另见重点GLM 5.3作为#2 站长椅,#3 法律法庭, 和技能长椅上的#6在开放重量组中。
代理安全带成为新的竞争层
- DeepSeek Harness 的极简主义是刻意为之,而非不完整:详尽的介绍,由@ZhihuFrontier并总结如下@TheTuringPost框架DeepSeek 安全带(DSH)作为一个有意设计的薄壳,覆盖在名为科迪斯.关键的设计选择是一切都是一个插件,包括代理环本身。据报道,早期测试版用户已发布100+ 插件并提交了400+ 发行期不到一周;例子包括五牧模型测试平台转给数据库代理通过将模型与实时查询执行连接,闭合了SQL反馈循环。最明显的结论是架构:DSH不像是“产品化助手”,而不是开放代理运行时,优化于用户可扩展工具、可切换控制环路和业务规则注入。
- TrueFoundry 开源了 TrueForge,并明确提出了线束成本论点:@truefoundry,@omarsar0, 和@kimmonismus所有内容都涵盖了真锻, an麻省理工学院许可, 为生产代理提供自托管、供应商中立的框架。该栈包括工具编排、上下文管理、子代理、代码沙盒、人工审批和跟踪,两者皆可实现本地以及主持人部署模式。引起共鸣的技术性主张:关于14任务企业基准测试,TrueForge 匹配Claude 管理代理关于作品4.8在使用 about代币减少30%,并路由到GLM-5.2成本降低了大约75%同时保持准确性。更广泛的行业主题——也呼应了@bradenjhancock以及@dbreunig 通过@rseroter——那是会话/环境/内存/工具层正成为差异化和节省成本的重要来源。
- 管理式线束的可观察性和控制也变得更加清晰:@ClaudeDevs新增内容自托管沙盒的内存支持,域允许/阻挡控制用于网页工具,以及重新设计多智能体会话查看器其中小地图,分组文字记录, 和每线程/会话成本.与此同时,OpenAI则继续推动相反方向:为团队提供嵌入其产品中的束缚原语。@OpenAIDevs重点显示开源Codex工具作为内部工具、运维仪表盘和自定义应用下的运行时,而@cursor_ai发布了围绕持久目标和长寿命会话的云代理用户体验改进。
培训后、中期培训及强化学习系统工作
- 更多证据表明,缩放正从参数转向训练配方质量:@kimmonismus出现了一项来自zAI/GLM创始人:进展仍在扩展,但太多讨论聚焦于参数数量而非数据质量、推理计算和训练后.引用的例子是GLM-5.3据称基于与GLM-5.2但通过约 实现了显著改进一个月的额外强化学习.
- Microsoft的Agent Lightning指出,通过线束进行强化学习(RL)是一种实用的配方:@omarsar0重点闪电特工 v1.0,通过终端代理将任意线束连接到强化学习,处理以下问题重新分牌化、样本合并、优势计算、归一化以及调度器/后端协调.其中~6K训练示例据报道,它在进行中,计算量适中Qwen3.5-9B关于SWE-bench验证来自41.8%对56.4%.
- 训练中被更明确地视为优化曲面:@cwolferesearch阐述了当前实践者的观点上尉/中训:优化数据混合,持续时间,舞台顺序,序列长度,甚至后可训练性而不是仅仅“继续用更好的数据进行预训练”。线之所以有用,正是因为它将这些旋钮定位为相互作用的旋钮,而非独立的技巧。
- 在研究的基础下,强化学习基础设施不断提升:@SergioPaniego重新浮出水面的作品显示TRL中的政策提炼成为快40倍通过生成缓冲区、批量教师调用和二进制logprob编码;@mikasenghaas已宣布自适应并发在PRL在一次强化运行过程中动态调整飞行中的滑行。
基准测试、检索和制作中重要的基础设施细节
- Qdrant的可筛选HNSW与ACORN是实质性的检索系统更新:@qdrant_engine主张过滤后的人工神经网络应在索引,不仅仅是在查询时。他们的可过滤的HNSW添加共享索引有效载荷值的点之间的边,保持过滤后的子图连接。在他们的基准测试中1% 滤波器对 1M 向量他们报告1.0毫秒时99.8%的回忆率对抗67.7%,4.7毫秒对于阿康.他们还提到ACORN仍然有帮助广义价值观以及AND滤波器尤其是在已经为滤波器优化的图之上。
- Sentence Transformers v6.0 反映了从单向量检索向多向量检索的实际转变:@tomaarsen清晰总结了区别:稠密检索将每个文本压缩为一个向量,而多向量检索保留令牌级向量,并在汇总最佳匹配前对查询令牌与文档令牌进行评分。这很重要,因为延迟交互检索正日益成为质量敏感搜索系统的默认权衡。
- 生产代理延迟通常与模型本身关系不大:@dair_ai总结了一篇对十个能体应用进行测验的论文,发现非LLM组件在其中一半的延迟中占主导,其中沙盒内存峰值为每会话28GB。,延迟变化可达32倍跨子系统,以及步骤间长时间的空闲状态保留。这些优化并不令人意外,但非常重要:任务感知服务降低延迟29–40%,州卸载减少记忆4.6倍, 和工具-结果缓存去除35.2%重复的搜寻电话。
- 线性和涡轮排气管显示矢量红外进入非搜索热路径:@turbopuffer说线性移动了它的三角洲同步读路径来自后期到涡轮增压使用属性索引进行权限过滤,并将最大同步减少约8秒.
谷歌、OpenAI、Anthropic 以及产品化竞赛
- Gemini 3.7 Flash在评估和产品集成方面表现强劲:@_philschmid以及@NewsFromGoogle重点双子座3.7闪电夺取#1关于人工分析AA-分析代理,其中60.0% 通过^5,70.5%pass@1,77.5%pass@5,1.32秒/任务, 和平均成本0.54美元横跨80个电子表格/文档密集的定量任务.谷歌还将其深入产品表面:双子座聊天与火花,基于搜索的交互式仿真在AI模式下即兴构建(示例),以及AI Studio GitHub 同步用于构建工作流程。
- OpenAI 正在倾向于低成本部署和隐私定位:@Replit启动自由模式动力来源GPT-5.6 露娜,@kimmonismus被包装为一次有意义的效率胜利:一款本应成为SOTA的车型,现在便宜到可以广泛赠送。在企业方面,@OpenAI介绍私人安全处理,旨在保持零数据保留对于前沿模型,在无需人工访问底层内容的情况下,仍能检测跨交互安全风险。
- Anthropic 持续收紧开发者的人体工学流程:除了上述托管代理更新之外,@ClaudeDevs添加了一个简明输出风格Claude Code,这又是一个标志,表明产品团队不仅在调优能力,还在将响应形态作为一流的用户体验变量。
热门推文(按互动数)
- Ornith-1.5 发布:@ornith_揭幕麻省理工学院许可来自9B至397B,具有强有力的编码/智能基准声明和广泛的量子化支持。
- OpenAI 隐私/安全基础设施:@OpenAI已宣布私人安全处理同时重申零数据保留针对Frontier模型。
- Gemini学生推送与产品捆绑:@GeminiApp向全球学生提供了一年的Gemini计划,同时推出了新的学习导向功能。
- Claude Code 用户体验更新:@ClaudeDevs已发货简明模式,这是编码代理日常交互中虽小但广为人知的改进。
- OpenRouter 收购:@patrickc确认OpenRouter 正在加入 Stripe许多人将其解读为验证代币路由/市场正在成为核心基础设施,而非边缘工具。
AI Reddit 回顾
/r/LocalLlama + /r/localLLM 回顾
1. Qwen/DeepSeek 开权推断加速
- 介绍Qwen3.8-27B 动态版Unsloth GGUFs。(活动时间:1428年):该图片是“Dynamic v3.0 Qwen3.8”的技术公告图,展示了Unsloth的新Qwen3.8-27B Dynamic v3 GGUF训练后量化,并声称
>10%在相同的GGUF规模下,比其他供应商拥有更高的前1%准确率。它包含一个内存表,表明模型可以从 1 位量子到 ~ 运行8GB内存可达BF16,并附有一张比较各量化尺寸精度的图表;帖子链接了GGUF的发行版本拥抱脸,动态3.0文档/基准测试,以及图像本身.Unsloth强调这些仅是训练后量子化释放——“我们不使用QAT或QAD”——并表示iMatrix校准文件公开,供独立评估和微调实验使用。评论大多是正面的,但有一个技术请求请求Unsloth补充之前的评论UD 2.0在图表上用量化分析,让用户可以与本地已有的比较。另一位评论者要求更深入的诊断,特别是每个类别和KV缓存量化 KLD数字,参考了本地bench式的报道。- 多位评论者要求对新Qwen3.8-27B 动态 v3 Unsloth GGUFs尤其是与先验比较的直线图Qwen 3.8 27B UD 2.0量化。建议指标包括KLD和/或顶级协议这将帮助用户判断新的动态量化是否比许多人已存储的版本在实质上更好。
- 有评论者问按类别划分的 KLD以及KV缓存量化 KLD报道,引用了以下分析的风格localbench.substack.com.这将使量化质量讨论更具可操作性,通过展示在不同GGUF定量格式下哪些基准/任务类别或缓存-定量设置最为劣化。
- 有人关注量化器的实际内存占用:一位用户指出
~15 GBQ4_K_M,而另一位推断IQ4_XS现在可能适合16 GBVRAM“没有MTP。”技术上的担忧在于,这些较小的格式是否能保持足够的模型质量,以支持在普通消费级GPU上完全运行27B级型号。
评论
?
参与讨论