Ian’s Blog

RSS: https://ianbarber.blog/feed/
Ian 的博客。

用于大语言模型的LSP

在那个在编辑器中输入代码的黑暗时代,我们借助破碎代码下的曲线、点击定义链接等辅助。它由语言服务器和类型检查器驱动。现在有几个线索将LSP暴露为工具,基于合理的前提:更好的代码智能造就了更好的代理。 不过模型主要用他们一直拥有的工具训练,通常是grep和远程阅读。取代那些增益效果很棘手。 模型对代码库的理解和人类略有不同。人类可以同时在视野中保留少量文件,工作记忆中稍多一些,随着时间推移,他们会构建...
评论点赞收藏4 天前

Power by the hour

It is a truth universally acknowledged that an airline in possession of an airplane must be in want of engines to make it go. Yet, somewhat surprisingly, they don’t really buy engines. Rolls-Royce wer...
评论点赞收藏26 天前

LLMs are adapting their environments to themselves

One good way to annoy a neuroscientist is to compare an LLM to the brain. It’s appealing though! There are similarities! In infancy we take a complex fusion of sensory inputs and learn to make predict...
评论点赞收藏35 天前

基准测试的商业意义

文章探讨了评估(eval)在衡量模型性能中的基本作用,以及建立统一基准对于公平比较不同模型的重要性。作者指出,虽然构建良好的基准测试很难,但它是确保竞争公平的关键。
评论点赞收藏46 天前

永远都是学习率的问题

文章探讨了在大语言模型预训练中,学习率调整往往比单纯增加算力或数据规模更能显著影响最终效果。作者引用 Lilian Weng 关于缩放定律的观点,强调工程细节中的超参数调优常被忽视。 这反映了当前 AI 训练中对“Scaling Laws”的过度依赖与实际操作中学习率策略关键性之间的反差。
评论点赞收藏48 天前

现在的LLM架构变得错综复杂

早在2022年和2023年,Meta 都迎来了机器学习领域的两大重要分支。促成 Llama 的 LLM 工作,其架构简洁流畅,由多次重复的 Transformer 模块构成;相比之下,推荐系统图谱却令人不寒而栗。所幸的是,业界已经通过让 LLM 变得更加……来改善了这一局面。
评论点赞收藏57 天前

FactWorld:当智能体不再只是“知道”事情

文章指出早期大模型开发主要关注让模型“记住”知识,但真正的智能体需要结合多种知识类型。作者认为许多知识仍编码在权重中,但智能体还需要其他形式的知识处理能力,这反映了从单纯检索到综合推理的技术演进思考。
评论点赞收藏64 天前

关于知识蒸馏的更多思考

文章探讨了大语言模型能力如何从训练数据中涌现的问题。虽然大家公认需要大量数据和算力,但对于数据的具体形态和来源存在分歧。作者引用了微软AI近期发布的深入技术报告,进一步讨论了知识蒸馏在其中的作用。
评论点赞收藏71 天前

我们可以为你批量蒸馏

文章讨论了前沿模型蒸馏带来的行业动荡。指出Anthropic和OpenAI在智能体编程领域拥有显著优势,部分原因得益于其拥有的高质量数据。作者认为这种数据优势正在被其他实验室通过蒸馏技术获取,从而缩小差距。这引发了关于模型能力边界和数据垄断的讨论。
评论点赞收藏76 天前

也许AI代理不该负责编写操作系统内核

文章探讨了一个激进的想法:让大模型去写操作系统内核这种对性能和正确性要求极高的底层代码。作者引用了斯坦福的KernelBench基准测试,指出虽然Chatbot有时能写对,但风险极大。核心观点是,对于关键基础设施,AI代理不应直接生成内核代码,而应作为辅助工具或审查者。这引发了关于AI在系统编程中边界和可靠性的讨论,适合对底层系统和AI能力感兴趣的工程师阅读。
评论点赞收藏80 天前

elusive的异步GPU内核秩序:调度、抽象与DSL启示

文章深入探讨了异步GPU内核调度的复杂性,从SIMT模型的静态、时间(流水线)和空间(Warp专用化)三种调度方式入手,分析了Nvidia不同架构(如Ampere到Blackwell)带来的挑战。作者指出,虽然CUTLASS等库封装了常见模式,但显式调度增加了移植负担。文章重点讨论了AsyncGraphene、TAWA、TileIR等抽象层如何通过数据流图简化调度,并提出了构建内核领域特定语言(DSL)时的三个关键问题:如何平衡性能与可移植性、AI Agent在代码生成中的角色及其局限性、以及如何跨越算子边界进行优化。核心观点是编译器本质上是硬件知识的编码,未来的方向是将这些知识从开发者头脑中移出,通过搜索和表达的结合来自动化优化过程。
评论点赞收藏82 天前

损失爆炸:FAIR OPT-175B 预训练过程中的痛苦复盘

文章通过回顾 FAIR 在 2021 年预训练 OPT-175B 模型时的日志,展示了机器学习研究中极具代表性的一段痛苦经历。作者详细记录了团队在调整学习率、权重衰减和梯度裁剪等超参数时,损失函数(Loss)如何剧烈爆炸又反复震荡的过程。这不仅是一篇技术复盘,更揭示了大型模型训练中隐藏的高风险与不确定性,对于从事 AI 研究的工程师和科学家来说,具有极高的共鸣价值和参考意义。
评论点赞收藏111 天前

工作的解绑:从紧密协作到独立交付

作者通过与基础设施团队和机器学习建模团队的协作经历,探讨了工作模式解绑的趋势。传统上两个团队紧密合作共同交付实验,但现在这种模式正在发生变化。文章分析了这种组织结构调整背后的原因和影响,适合对工程管理和团队协作感兴趣的读者。
评论点赞收藏129 天前

PyTorch 中的原生 DSL 算子操作

FlashAttention 4 在 PyTorch 中支持速度极快,关键在于引入了 Simon Layton 开发的 torch.native 基础设施。与之前使用 Cutlass/C++ 编写内核不同,FA4 团队采用 CuteDSL 实现内核。这一转变展示了原生领域特定语言在加速深度学习算子开发和集成方面的优势,为后续类似工作提供了新的工程范式。
评论点赞收藏151 天前

编程的闭环:当AI成为独立代理后,程序员该做什么?

文章探讨了随着AI从智能补全工具演变为独立代理(如Claude Code),程序员角色的变化。作者认为,当AI具备足够能力时,程序员的职责将从编写代码转向引导、审查和架构设计,即进入一个“编程循环”。这引发了关于未来开发者核心技能和工作流的思考。
评论点赞收藏158 天前

解析 CuTe 布局代数与 FlyDSL:GPU 内核开发的数学统一

文章分析了 FlashAttention 4 背后的布局代数(Layout Algebra)技术演进。首先介绍了 AMD 发布的 FlyDSL,这是基于 CuTe 理念的开源实现,旨在改善 GPU 内核开发的迭代体验。随后重点解读了 Nvidia 工程师 Cris Cecka 的新论文,该论文将 CuTe 布局形式化为循环变换理论,揭示了 TMA 和 swizzling 等硬件特性可以通过统一的代数操作来处理。作者认为这种数学形式的统一有助于解决内核开发中布局管理的痛点,并为 Triton、FlyDSL 等项目提供坚实基础。
评论点赞收藏161 天前

困惑度并不总能区分对错

文章讨论了语言模型训练中常用的困惑度(Perplexity, PPL)指标及其局限性。PPL本质上是交叉熵损失的指数,用于衡量模型预测下一个token的不确定性。虽然PPL越低通常代表模型表现越好,但新论文指出PPL存在缺陷:模型可能在某些构造的序列上表现出极低的困惑度(即极度自信),但预测却是错误的。这种现象在长上下文场景中尤为明显,因为并非所有token同等重要。这意味着单纯依赖PPL来评估模型性能或筛选数据可能误导,需要结合其他方法。
评论点赞收藏167 天前

模型大概能写出代码

文章探讨了软件工程领域当前的矛盾心态:一方面,开发者对个人多年积累的技能被AI取代感到绝望;另一方面,企业对现有代码库投入巨大,但这些代码缺乏AI所需的“氛围感”。作者指出,人们担心模型在特定编程语言中的有效性,这反映了行业对AI介入核心开发流程的焦虑与不确定性。
评论点赞收藏174 天前

TileIR:关于GPU操作分类与资源分配的思考

作者提出对GPU操作的大致分类,指出当前大量资金投入的硬件主要服务于其中一类操作,同时许多顶尖人才也在关注这一领域。文章暗示这种资源分配可能存在偏差或不平衡,引发对GPU技术发展方向和人才投入重点的思考。
评论点赞收藏184 天前

什么是“分布内”?大模型推理本质的迷思

文章探讨了大模型开发中的一个核心问题:模型的推理能力究竟是真正的逻辑推导,还是仅仅基于训练数据(如互联网文本)的模式回忆?由于LLM的训练数据几乎覆盖了网络上的一切,区分“真正理解”与“统计拟合”变得非常困难。作者指出,定义什么是“分布内(In-Distribution)”数据对于评估模型的真实推理能力至关重要,这是一个在模型评估和开发中持续存在的难题。
评论点赞收藏187 天前

万物皆MoE:从架构到设计哲学的演进

文章认为MoE(混合专家)不仅是架构,更是一种解耦容量与计算的设计哲学。通过分析DeepSeek的最新论文(Engram、mHC、NSA),作者指出当前大模型演进的核心模式是:识别瓶颈、增加资源并引入条件路由以避免线性扩展。理解这一模式有助于预判未来技术方向。
评论点赞收藏207 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。