科学空间

RSS: https://spaces.ac.cn/feed
苏剑林(Jianlin Su)的科学空间博客,专注于机器学习、自然语言处理、深度学习与数学建模研究。

慢即是快:1. Shampoo 的尽头是 Muon?

众所周知, Muon 优化器流行起来已经有好一段时间,虽然说不上完全取代Adam,但已经算得上不能忽视的、极具竞争力的优化器。与此同时,这两年Shampoo系优化器也“不甘落后”,除了原始Shampoo外,还演变出 KL-Shampoo 、 OKLS 、 PSGD 、 SOAP 等变体,都声称获得了比Muon更好的结果。 然而,本文将会泼一盆冷水:所有类似于Shampoo的、基于Kronecker...
评论点赞收藏2 天前

排序不等式及其推广

排序不等式是一个经典的不等式,本身不难理解,很多读者可能在中学阶段就已经了解过它,尤其是准备过数学竞赛的同学。但排序不等式也远不止表面上那么简单:它在矩阵世界中有一个深刻的对应物——冯·诺伊曼迹不等式;它还可以沿着“多序列”、“多矩阵”的方向继续推广。 本文就沿着这条线索,将这些内容串联起来介绍一下。 基本形式 设有两个从大到小排好序的实数列$a_1\geq a_2\geq \cdots\geq ...
评论点赞收藏8 天前

让炼丹更科学一些(十):单调性假设的拆与补

上文 《让炼丹更科学一些(九):经典自适应梯度算法》 中,我们为形如$\boldsymbol{\theta}_{t+1} = \boldsymbol{\theta}_t - \eta_t \boldsymbol{H}_t^{-1}\boldsymbol{g}_t$的一般更新规则建立了收敛框架,并以它为出发点重新理解了AdaGrad等经典自适应梯度算法。不过,当时的完整结论依赖于两个前提:一是学习率...
评论点赞收藏16 天前

经典自适应梯度算法:AdaGrad及其传承

本系列前面八篇文章,都是在围绕SGD及其学习率讨论。而从本文开始,我们将正式进入自适应梯度算法的世界。可以说,现在所有的自适应梯度算法,都有一个共同的源头,那就是2011年的经典之作 《Adaptive Subgradient Methods for Online Learning and Stochastic Optimization》 ——也就是著名的AdaGrad论文。 这篇论文将SGD的经...
评论点赞收藏25 天前

让炼丹更科学一些(八):多阶段训练的学习率

上篇文章 《让炼丹更科学一些(七):步长调度与权重平均》 我们简单介绍了无调度(Schedule-Free)学习率的工作,它试图通过某种权重平均来替代学习率调度,实现常数学习率就可以训出最优模型的效果。然而,上文我们也提到,如果不引入额外假设,这个最优的常数学习率也是依赖于训练步数的,所以也做不到真正的无调度。 这篇文章我们从多阶段训练角度,来重新思考这个问题,主要思想是将调度目标折中为“每个阶段...
评论点赞收藏30 天前

动量的新理解:逼近特征层面的梯度下降

一个以动量为状态变量的优化器,基本形式如下: \begin{equation}\begin{aligned} \boldsymbol{M}t =&\, \beta \boldsymbol{M}{t-1} + (1 - \beta) \boldsymbol{G}_t \[4pt] \boldsymbol{W}t =&\, \phi(\boldsymbol{W}{t-1}, \boldsymbol{M...
评论点赞收藏38 天前

Stiefel流形上的最速下降:解析解的推导

对于正交流形,我们此前的结论是:方阵情形下,我们可以完整地写出对应最速下降的解析解(参考 《流形上的最速下降:2. Muon + 正交》);但对于非方阵的Stiefel流形,其最速下降问题需要求解一个非线性方程组,其解析解无法直接写出(参考 《流形上的最速下降:3. Muon + Stiefel》)。 但近日, 《Muon on the Stiefel Manifold Admits an Exa...
评论点赞收藏44 天前

除了交叉熵,语言模型的Loss还有什么选择?

一直以来,交叉熵(Cross Entropy)都是LLM预训练和微调的标准损失函数。那这个“标准”可以改吗?如果想改,那又有哪些选择呢?改完之后又会带来什么影响呢? 可能很多读者从未认真推敲过这些问题。一方面,交叉熵简洁有效,又有信息论诠释作为背书,让我们觉得它非常“理所当然”,以至于欣然接受;另一方面,换损失函数是“牵一发而动全身”的事情——换了之后意味着所有基于损失的比较都不再有效,我们只能去...
评论点赞收藏52 天前

K3的MoE和Attention设计

上个月,我们发布了迄今为止最大的开源模型 K3。 作为K2的继任者,K3并不是一次从零开始的重新设计,而是沿着我们过去一系列工作自然演化而来,并融合了我们对效果、效率、稳定性的一些最新理解和改进。可以说,它是一项持续的、“集大成”的研究成果,而非孤注一掷的豪赌。 这篇文章,我们来聊聊K3在架构上的一些设计思路。 写在前面 简单来说,在架构方面K3 = KDA + MLA + Stable Late...
评论点赞收藏57 天前

解构Scaling Law:优化、架构、数据的三重奏

训练一个大型的神经网络,最终效果会受到非常多因素的影响,换个优化器,换个模型架构,或者换一个训练集,结果都可能截然不同。在工程实践中,我们将调试这些因素的经验结果,戏称为“炼丹”。但如何从经验上升到规律,更准确、定量地描述它们之间的关系呢?如果能搞清楚这个问题,我们的炼丹将会更有底气。 “Scaling Law”便试图以一种相对定量的方式来回答这个问题。自OpenAI在2020年的奠基性工作(Ka...
评论点赞收藏62 天前

将Softmax注意力机制线性化为门控Delta网络

基于LogSumExp和Softmax的泰勒展开,推导了将Softmax Attention线性化为具有Delta Rule的线性注意力变体的方法。结果并非基本的DeltaNet,而是直接得到了Gated DeltaNet (GDN)。 文章展示了从Query条件下Attention输出随Key、Value变化规律的数学推导过程。
评论点赞收藏70 天前

基于排序不等式的相似度指标

受论文启发,作者利用排序不等式构造了一种新的相似度指标 rcos。该指标将完全同序和完全反序分别映射为 1 和 -1,解决了传统余弦相似度无法区分同序与反序的问题。 文章推导了公式,并与 Spearman 秩相关系数建立联系,提供了比现有方法更合理的语义解释。
评论点赞收藏76 天前

让炼丹更科学一些(七):步长调度与权重平均

精通炼丹的同学都知道,步长调度,或者说学习率调度(LR Schedule),对模型最终效果来说至关重要。 我们在前几篇文章中已经推导过,即便只考虑SGD,终点收敛的最优学习率函数也具有Warmup...
评论点赞收藏86 天前

矩阵函数近似中的暴力美学

此前,我们在《矩阵平方根和逆平方根的高效计算》和《矩阵r次方根和逆r次方根的高效计算》探讨过矩阵幂的高效计算, 它们将原本用于计算$\newcommand{msign}{\mathop{\text...
评论点赞收藏96 天前

强制间隔投影(Margin-Enforcing Projection)

这篇文章我们介绍一个数学运算,名为“强制间隔投影(Margin-Enforcing Projection,MEP)”,它将向量按指定方式划分为两部分,然后要求这两部分的间隔至少为$m$(Marg...
评论点赞收藏103 天前

为什么官方版Muon比MuP版多出一个max(1, ⋅)?

在文章《Muon优化器指南:快速上手与关键细节》中,我们罗列了Muon的几个版本, 它们的区别是学习率的矩阵形状相关的缩放因子不同,其中“官方版(KellerJordan版)”只比“MuP版”多出...
评论点赞收藏119 天前

矩阵参数的奇异值熵越高越好吗?

在去年的技术报告《Muon is Scalable for LLM Training》中,为了对比Muon与Adam所训练出来的模型的差异, 我们引入了“奇异值熵”的概念,观察到Muon训练出来的...
评论点赞收藏124 天前

MoE环游记:8、强制序列级均衡

到目前为止,“MoE环游记”系列已经写了7篇文章,其中5篇都是围绕着MoE的路由和负载均衡展开的。 从路由的形式来看,它们可以分为静态计算和动态计算两类; 从实现负载均衡的方法上看,它们又可以分为A...
评论点赞收藏131 天前

DeepSeek V4的tid2eid是怎么来的?

训过MoE的同学都知道,如果把整个模型的MLP部分都换成MoE,那么靠近Embedding的前几层MoE往往很难实现负载均衡。 对此,DeepSeek V3,包括我们的Kimi K2,采取的应对策...
评论点赞收藏138 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。