idlemachines essays

RSS: https://idlemachines.co.uk/feed.xml
Idle Machines,关于现代机器学习背后的数学与工程的深度文章。

GLM-5.3-Flash中的快权重与稀疏注意力机制

GLM-5.3-Flash用KDA快权重在推理时实时更新内部矩阵作为动态记忆。KDA占34/45层,百万token序列中仅选2048位置做稀疏检索。固定大小矩阵作为动态记忆,与320B参数和KV缓存并存。 KDA与稀疏注意力3:1配比,后者负责精确检索数字、标识符等场景。Qwen也独立走向相同方向。核心判断:上下文窗口不等于记忆容量。
评论点赞收藏25 天前

Tokenization:谁来定义一个 token?

<p>神经网络如何理解文本?这个问题如此基础,以至于你甚至可以原谅自己忘记它。单词和字母是人类可读的,但它们是离散的(即使组合起来是无限的),与神经网络所使用的连续表示方式并不兼容。</p>
评论点赞收藏50 天前

Thinking Machines 放弃 RoPE,这是一个好主意

Thinking Machines 发布 Inkling 模型,其位置编码摒弃了主流的 RoPE,改用基于学习到的局部注意力偏置和位置无关的远距离交互。 文章详细拆解了其通过共享函数库和每 token 系数混合来实现位置信息的机制,并分析了 QK Norm、Log-Length Attention Scaling 等配套技术对训练稳定性的影响。
评论点赞收藏69 天前

MAE与MSE之争:不止于均值和中位数的较量

文章深入分析了均方误差(MSE)和平均绝对误差(MAE)在最大似然估计下的本质区别,指出前者对应高斯噪声,后者对应拉普拉斯噪声。 通过推导梯度特性,解释了为何MSE对异常值敏感而MAE更稳健,并讨论了异方差性、偏态及双峰目标下的适用场景。
评论点赞收藏103 天前

DiffusionGemma:大语言模型中的离散扩散

DeepMind 发布 DiffusionGemma,放弃自回归,采用离散扩散生成。在单张 H100 上速度提升显著,量化后仅需 18GB 显存。 该模型目前性能接近旗舰版,但尚未超越。 文章同时列出了相关的算法挑战题目,涉及采样、注意力掩码等技术细节。
评论点赞收藏110 天前

天知道我现在的困惑度

文章深入解析 Perplexity(困惑度)的本质,指出它是逆概率的几何平均值,代表了模型选择的有效分支因子。作者认为单独看这个数值意义不大,但在模型初始化阶段作为合理性检查非常有用。
评论点赞收藏115 天前

对比损失本质上就是交叉熵

文章指出对比损失函数本质上是基于嵌入相似度的交叉熵。这一视角解释了为何模型容易过拟合。 对于熟悉深度学习底层原理的技术人员来说,这是一个清晰且有力的洞察。
评论点赞收藏120 天前

Every Token, Everywhere, All at Once

探讨将变长向量集合压缩为单一向量的过程中,池化方法所做的取舍。 前沿嵌入模型在池化光谱上占据特定位置,决定了信息的保留与丢弃。
评论点赞收藏127 天前

混合专家计算图中的那个“切口”

MoE(混合专家)模型的训练背后隐藏着一个关键的计算图技巧。如果忽略这个细节,模型将无法训练。作者通过手动推导反向传播过程,揭示了这一容易被忽视的工程细节。
评论点赞收藏134 天前

DeepSeek V4 内部技术解析

深度解析 DeepSeek V4 的核心效率技术,包括压缩稀疏注意力机制、流形约束超连接、Muon 优化器以及 MXFP4 量化方案。 文章基于论文和推理代码,拆解了这些技术如何协同工作以提升模型性能与效率。
评论点赞收藏141 天前

Gemma 4 is not your standard transformer

Gemma 4 makes five quiet departures from the standard transformer recipe. QK-norm instead of 1/√d, partial RoPE on global layers, per-layer input gating, KV sharing across layers, and an MoE that sits...
评论点赞收藏161 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。