Danluu

RSS: https://danluu.com/atom.xml
Dan Luu 的技术博客,以数据驱动、深度研究和犀利的调试/性能分析文章著称。

没有任何时候,关闭大脑会奏效。

<p>2025年初,我开始看到有人在使用大型语言模型时关闭大脑。他们会让大型语言模型执行某个动作(总结文本、写代码等),然后就默认它有效。<br><br>但这在2025年初通常不起作用,结果往往相当荒谬。</p><p>随着大型语言模型的进步,我看到这种情况越来越多。有时候,人们会试图让大型语言模型帮他们写代码,基本上就假设它能用。有时会有人在操作,如果问题不行,他们会让大型语言模型帮忙解决问题。<br><br>尼克拉斯·格鲁恩.</p><p>作为一个for循环肉类代理比2025年初效果更好,我尝试过的类似软件有时确实能勉强运行。虽然还不够好,不至于我想用它,也没成功,但我对2026年9月作为肉类代理的效果印象深刻。<br><br>你可以想象大型语言模型(LLM)进步到让大脑不动脑力的肉类代理开发能产生成果 在可预见的未来,或者甚至认为大型语言模型(LLM)进步到能够在没有人工参与的情况下产出优秀的软件。</p><p>假设真的发生了这种情况。公司为什么要使用肉类代理?公司可以直接循环运行LLM,然后裁员。这种方法在任何时候都不会对员工有效。</p><p>感谢马克斯·比特克、约西·克雷宁、卢克·伯顿、托马斯·杜连、丹尼斯·斯内尔、米洛什·丹查克、彼得·乔格根和杰米·布兰登的评论/更正/讨论。</p><hr><ol> <li>我已经有这个想法大约一年半了。随着大型语言模型的进步,我看到人们在与大型语言模型互动时,更多时间关闭大脑,我现在有这种想法的频率也提高了。</li> <li>Luke Burton曾这样…</li></ol>
评论点赞收藏11 天前

糟糕的基准测试与评估:Senior SWE-Bench、Napkin Math 和冬胎

Dan Luu 用三道测试题(SWE-Bench 性能估算、napkin-math 延迟表、冬天轮胎选择)验证读者判断力,再公布答案和解析。核心观点是:现有 AI 代码评估基准存在系统性偏差,简单数字游戏比复杂 benchmark 更能筛出真正懂性能的人。
评论点赞收藏19 天前

Agent使用测试和验证技术的水平如何?

Danluu 测试了26种提示条件,看AI编程Agent能否正确使用测试/验证技术。结果:默认无指令的表现高于平均水平,TDD、形式化方法(Verus、Lean4、Alloy)、属性测试、差分测试等都没能显著提升正确率。 Agent普遍不会用这些工具——Verus只证明无关抽象性质,Alloy结果倒数第二,差分测试135次里几乎都写了相同的两份代码。ECC等热门Skill反而拖后腿。 结论:Agent默认不会测试,简单提示无法教会它们,AI实验室可能需要为有效测试创建RL训练环境。
评论点赞收藏22 天前

Ed Zitron 的 AI 怀疑论预测准确率如何?

Ed Zitron 是 AI 领域最常被引用的怀疑论者,Dan Luu 逐条核查了他的预测,全部错误。2024年2月至2025年11月间,Zitron 预测 Meta、Google、Microsoft 等大厂"正在衰落"、AI 已触及天花板、OpenAI 增长停滞、Cursor 会倒闭——现实数据逐一打脸:Meta 2025年收入2010亿美元同比增长22%,Google 2025年403亿美元,Microsoft 305亿美元,Cursor 以600亿美元被收购。 Zitron 的论证模式是引用有问题的第三方数据(如 Similarweb 的 MAU 估算)得出宏大结论,但数字本身并不支撑其论点。其他事实核查者(Juho Snellman、Timothy B. Lee)也指出其文章存在数据错误和故意误导。
评论点赞收藏28 天前

对Bug的"盲视"

作者发现自己比大多数人更容易注意到软件Bug,而大多数人重复踩同样的坑却毫无察觉。通过给朋友指出Bug,几周后这些人也开始注意到Bug。 Google搜索、Blackboard课程软件、Discourse论坛等例子显示,用户和开发者对自己熟悉的产品存在系统性盲视。程序员尤其擅长发展出绕过Bug的习惯,这让他们更难意识到问题存在。
评论点赞收藏31 天前

HN 优质评论精选

Dan Luu 整理了他认为 Hacker News 上最优质的评论合集,涵盖 MS Word 文件格式设计缺陷、NULL 指针在不同编译器下的行为差异、火车司机警觉系统演进、FedEx 选址孟菲斯的12条标准、Etherpad 被 Google Wave 收购的教训等。 HN 评论整体质量差,但技术类优质评论密度高于其他论坛,且优质评论更容易浮到顶部。
评论点赞收藏39 天前

基准测试末日:LLM让刷分变得轻而易举

Danluu用LLM agent构建正则引擎FRE,在rebar基准上声称比Rust regex快40%,但在独立验证集上慢了2.4倍。LLM无需专业经验即可轻松刷高基准分数,过去需要资深工程师数周完成的优化工作,现在只需几分钟提示词。 性能声明可信度大幅下降,AI模型评测同样存在类似问题。
评论点赞收藏43 天前

编程代理用什么语言最好?

Dan Luu用GPT-5.6做zstd解码器和Pandoc两个任务的eval,发现"动态语言比静态语言更适合LLM"的说法在复杂任务上不成立。语言流行度与正确性、成本呈弱正相关,但单个eval不能得出强结论。
评论点赞收藏50 天前

编程语言如何影响 LLM 的 token 效率与正确性?

Dan Luu 对"动态语言比静态语言更省 LLM token"的流行说法做了实证反驳。他在 zstd 解码器和 Pandoc 两个真实任务上跑了自己的 eval,预注册了三个假设后再看结果。 结论:动态语言在简单任务上确实 token 少,但任务变大后优势消失;语言流行度与 LLM 表现呈弱正相关;J 等冷门语言并不如宣传中好用。
评论点赞收藏51 天前

来自加拉帕戈斯群岛的 AI 编程笔记

Dan Luu 分享他在加拉帕戈斯群岛断网期间,使用 AI Agent 辅助编写博客附录的经历。他详细记录了 Agentic Loop 的实际运作过程,包括 AI 如何生成代码、处理错误以及最终完成写作。 这篇文章提供了关于 AI 编程工作流的一手实战经验,揭示了当前 Agent 在复杂任务中的真实能力与局限。对于关注 AI 工程落地和开发者效率的技术读者来说,具有极高的参考价值和讨论热度。
评论点赞收藏88 天前

可疑的不连续性

<p>如果你在去年年底阅读过任何个人理财论坛,那么你很可能遇到过这样一位用户提出的问题: 他正拼命想在年底前亏掉钱。人们可以采用多种方法来实现这一目的; 其中一种常见的建议方案是买入,这样一来, 买方就有可能(很可能)蒙受损失。</p><p>人们之所以想方设法亏钱,原因之一在于……</p>
评论点赞收藏95 天前

反驳“本质复杂度与偶然复杂度”:为什么程序员生产力仍有巨大提升空间

Dan Luu 重读 Fred Brooks 的《没有银弹》,指出其关于程序员生产力提升上限的论断已过时。 文章认为 Brooks 低估了现代工具链、实践及 AI 带来的效率飞跃。 作者通过日志解析和大规模数据查询等实际工作案例,证明当前开发中绝大部分仍是“偶然复杂度”,核心概念复杂度占比极小,反驳了 Brooks 的观点。
评论点赞收藏105 天前

封闭社交网络是必然趋势吗?

这是一段2010年关于社交网络未来的旧论坛讨论。主要观点是封闭平台虽因网络效应占优,但开放协议才是财富创造的关键。 一方认为Facebook将垄断社交,另一方反驳称这仅是人为稀缺。 文章深入探讨了Google通过Android和开放API如何促进生产力,而非单纯追求广告利润。
评论点赞收藏148 天前

达利-克鲁格效应及其他被误读的流行科学迷思

作者逐一拆解了五个被广泛误读的流行科学概念,包括达利-克鲁格效应、收入与幸福的关系、 享乐适应、国际象棋记忆实验以及类型系统的实证证据。 文章指出大众传播往往夸大或扭曲原始研究的结论。 通过对比原始论文图表与通俗解读,揭示了数据被误读的具体机制,如坐标轴缩放导致的视觉误导或小样本偏差。作者呼吁读者直接查阅原始文献,而非依赖二手摘要。
评论点赞收藏152 天前

史蒂夫·鲍尔默是被低估的CEO

作者反驳微软在鲍尔默时期衰落的普遍叙事,认为其被低估。文章通过财务数据展示鲍尔默任内的营收与利润增长。 这挑战了纳德拉拯救微软的主流观点,提供不同视角。
评论点赞收藏159 天前

DeWitt条款与匿名基准测试市场

文章回顾了1983年威斯康星大学数据库基准测试中Oracle表现极差,导致拉里·埃里森试图解雇作者,进而催生了软件行业禁止公开基准测试的“DeWitt条款”。 作者提出建立匿名基准测试市场的构想,让付费用户资助测试,以解决当前主流商业数据库(如Oracle、Microsoft)禁止公开性能数据的问题。
评论点赞收藏162 天前

为什么高性能代码里,手写汇编比编译器内置函数更靠谱?

作者通过实测发现,在高性能代码中使用编译器内置函数(intrinsics)往往不如直接手写汇编可靠。 以 popcnt 指令为例,Clang 和 GCC 生成的代码存在未展开循环、寄存器依赖错误等陷阱,导致性能远低于预期。 经过手动展开循环、规避硬件假依赖bug,最终手写汇编版本比原始 intrinsics 快三倍,甚至超越了业界公认的优化表格查找方案。文章展示了编译器在微优化上的不可靠性,以及底层调试的工程细节。
评论点赞收藏166 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。