GLM-5.3-Flash中的快权重与稀疏注意力机制GLM-5.3-Flash用KDA快权重在推理时实时更新内部矩阵作为动态记忆。KDA占34/45层,百万token序列中仅选2048位置做稀疏检索。固定大小矩阵作为动态记忆,与320B参数和KV缓存并存。 KDA与稀疏注意力3:1配比,后者负责精确检索数字、标识符等场景。Qwen也独立走向相同方向。核心判断:上下文窗口不等于记忆容量。 评论点赞收藏25 天前
Tokenization:谁来定义一个 token?<p>神经网络如何理解文本?这个问题如此基础,以至于你甚至可以原谅自己忘记它。单词和字母是人类可读的,但它们是离散的(即使组合起来是无限的),与神经网络所使用的连续表示方式并不兼容。</p> 评论点赞收藏50 天前
Thinking Machines 放弃 RoPE,这是一个好主意Thinking Machines 发布 Inkling 模型,其位置编码摒弃了主流的 RoPE,改用基于学习到的局部注意力偏置和位置无关的远距离交互。 文章详细拆解了其通过共享函数库和每 token 系数混合来实现位置信息的机制,并分析了 QK Norm、Log-Length Attention Scaling 等配套技术对训练稳定性的影响。 评论点赞收藏69 天前
The annotated PyTorch training loopWhat every line of a PyTorch training loop does, why it belongs where it is, and what breaks if you move it. 评论点赞收藏99 天前
MAE与MSE之争:不止于均值和中位数的较量文章深入分析了均方误差(MSE)和平均绝对误差(MAE)在最大似然估计下的本质区别,指出前者对应高斯噪声,后者对应拉普拉斯噪声。 通过推导梯度特性,解释了为何MSE对异常值敏感而MAE更稳健,并讨论了异方差性、偏态及双峰目标下的适用场景。 评论点赞收藏103 天前
DiffusionGemma:大语言模型中的离散扩散DeepMind 发布 DiffusionGemma,放弃自回归,采用离散扩散生成。在单张 H100 上速度提升显著,量化后仅需 18GB 显存。 该模型目前性能接近旗舰版,但尚未超越。 文章同时列出了相关的算法挑战题目,涉及采样、注意力掩码等技术细节。 评论点赞收藏110 天前
天知道我现在的困惑度文章深入解析 Perplexity(困惑度)的本质,指出它是逆概率的几何平均值,代表了模型选择的有效分支因子。作者认为单独看这个数值意义不大,但在模型初始化阶段作为合理性检查非常有用。 评论点赞收藏115 天前
读懂MAI的效率增益:如何像专业人士一样挑选模型架构微软MAI报告提出效率增益指标,揭示模型在FLOPs和实际训练时间上的优化差异。 通过数学公式和代码示例,展示如何评估新架构在真实硬件上的表现,避免纸上谈兵。 评论点赞收藏118 天前
对比损失本质上就是交叉熵文章指出对比损失函数本质上是基于嵌入相似度的交叉熵。这一视角解释了为何模型容易过拟合。 对于熟悉深度学习底层原理的技术人员来说,这是一个清晰且有力的洞察。 评论点赞收藏120 天前
Every Token, Everywhere, All at Once探讨将变长向量集合压缩为单一向量的过程中,池化方法所做的取舍。 前沿嵌入模型在池化光谱上占据特定位置,决定了信息的保留与丢弃。 评论点赞收藏127 天前
混合专家计算图中的那个“切口”MoE(混合专家)模型的训练背后隐藏着一个关键的计算图技巧。如果忽略这个细节,模型将无法训练。作者通过手动推导反向传播过程,揭示了这一容易被忽视的工程细节。 评论点赞收藏134 天前
DeepSeek V4 内部技术解析深度解析 DeepSeek V4 的核心效率技术,包括压缩稀疏注意力机制、流形约束超连接、Muon 优化器以及 MXFP4 量化方案。 文章基于论文和推理代码,拆解了这些技术如何协同工作以提升模型性能与效率。 评论点赞收藏141 天前
Gemma 4 is not your standard transformerGemma 4 makes five quiet departures from the standard transformer recipe. QK-norm instead of 1/√d, partial RoPE on global layers, per-layer input gating, KV sharing across layers, and an MoE that sits... 评论点赞收藏161 天前
cross-entropy: the simplest gradient in all of machine learningCross-entropy paired with softmax produces one of the most elegant gradients in ML — prediction minus truth. Here's the full derivation. 评论点赞收藏193 天前