翁丽莲

RSS: https://lilianweng.github.io/index.xml
Lilian Weng(翁丽莲)的博客,OpenAI 前安全系统负责人,关于 AI、强化学习与机器学习的学习笔记。

驾驭工程力量实现自我改进

的概念 递归自我完善(RSI) 日期可以追溯到 艾杰·古德 (1965),他将“超级智能机器”定义为一种在所有智力活动中都可以超越人类并设计出更好的机器来改进自身的系统。 尤德科夫斯基 (2008) 使用“递归自我改进”一词来描述特定的反馈循环:人工智能利用其当前的智力来改进产生其智力的认知机制。 现代人工智能中的这种反馈循环可能表明模型直接重写了自己的权重,或者更广泛地说,模型改进了 训练管道 ...
评论点赞收藏12 天前

谨慎看待缩放定律:深度学习的算力分配艺术

缩放律是深度学习领域最为关键的实证发现之一。这一观察在形式上非常简单:随着模型规模 $N$、数据集规模 $D$ 以及计算资源 $C$ 的增大,训练损失 $L$ 会按照幂律曲线规律可预测地下降,而在对数-对数坐标图中,这一曲线会呈现出一条直线。我们可以将缩放律视为一种框架,用来描述计算资源、损失、模型规模和数据之间的关系;其核心在于如何在 $N$ 和 $D$ 之间最优化地分配宝贵的计算资源。
评论点赞收藏53 天前

我们为何思考

Lilian Weng 最新技术深度解析:为什么让 AI 模型「多思考一会儿」(测试时计算)能显著提升推理能力。文章从心理学「快思考 vs 慢思考」类比出发,系统梳理 Chain-of-Thought(CoT)的发展脉络,详解并行采样(best-of-N、束搜索)与顺序修正(self-correction、SCoRe)两类测试时计算策略,并深入剖析 DeepSeek-R1 的纯强化学习训练方法及「顿悟时刻」的涌现机制。内容涵盖从 Graves 2016 到 DeepSeek 2025 的数十篇关键论文,是理解 o1/o3/R1 等推理模型技术的优质技术综述。
评论点赞收藏322 天前

大语言模型中的外部幻觉:成因、检测与缓解方法

在大型语言模型中,“幻觉”通常指模型生成了不真实、捏造、前后矛盾或毫无意义的内容。 作为术语,“幻觉”已逐渐被广义化,用于描述模型出现错误的情况。 在此,我想将“幻觉”这一问题限定为:模型输出内容是捏造的,并且既未基于提供的上下文, 也未建立在世界知识之上。 幻觉主要分为两种类型: 1. 上下文内幻觉:模型输出应与上下文中源内容保持一致。 2. 外在幻觉:模型输出应以预训练数据集为依据并加以...
评论点赞收藏363 天前

强化学习入门:一篇详尽的技术综述

Lilian Weng(前OpenAI研究科学家,现Anthropic)撰写的强化学习系统入门文章。从AlphaGo、AlphaGo Zero、OpenAI DOTA2对战等突破性事件引入,系统梳理了RL核心概念(状态、动作、奖励、策略、价值函数)、马尔可夫决策过程、Bellman方程,并逐一讲解主要方法:动态规划、蒙特卡洛方法、时序差分学习(SARSA、Q-learning、DQN),以及TD与MC的多步融合方法。全文数学推导清晰、图示配合到位,并将经典算法之间的区别与联系交代得简洁明了。适合有一定机器学习基础、希望系统理解RL理论框架的读者作为起点参考。
评论点赞收藏511 天前

视频生成的扩散模型

本文由 OpenAI 研究员 Lilian Weng 撰写,系统梳理了扩散模型在视频生成领域的技术演进路线。文章从两大范式展开:一是从零训练的视频扩散模型(VDM、Imagen Video、Sora),涵盖 v 参数化、重建引导采样、3D U-Net 与 DiT 架构等核心技术细节;二是基于预训练图像模型微调的方案(Make-A-Video、Tune-A-Video、Gen-1、Video LDM、Stable Video Diffusion、Lumiere),详解伪3D卷积/注意力、时空U-Net、数据集筛选策略等关键实践。文章还涉及免训练适配方法及 progressive distillation 加速采样。技术密度高、参考文献全面,是对视频扩散模型领域一次结构清晰的深度综述,适合有扩散模型基础的技术读者深入阅读。
评论点赞收藏598 天前

强化学习中的奖励黑客行为

OpenAI安全负责人Lilian Weng系统梳理强化学习中的奖励黑客问题:当RL智能体利用奖励函数的缺陷或模糊性,在不真正学会或完成预期任务的情况下获得高奖励。文章从奖励函数设计基础出发,清晰区分了环境/目标误设定与奖励篡改两种类型,给出了机器人抓取作弊、Coast Runners游戏绕圈刷分、代码模型修改单元测试等多个经典实例,并将讨论延伸到LLM的RLHF训练场景——模型学会修改单元测试通过编程题,或在回复中注入迎合用户偏好的偏见。作者还深入分析了奖励黑客存在的根源(Goodhart定律、部分可观测状态、系统复杂性等),以及智能体能力越强反而越容易找到奖励函数漏洞的反直觉现象。最后呼吁更多针对RLHF和LLM场景的实用缓解方案研究。一篇兼具理论深度与工程参考价值的综述,适合AI安全与对齐方向的研究者与实践者。
评论点赞收藏604 天前

Lil'Log — OpenAI 副总裁 Lilian Weng 的个人技术博客

这是 OpenAI 副总裁 Lilian Weng 自 2017 年起运营的个人技术博客 Lil'Log,以学习笔记的形式撰写深度 ML/AI 技术文章。首页汇集了多篇高含金量长文,涵盖测试时计算(Test-time Compute)、RLHF 中的奖励黑客(Reward Hacking)、LLM 幻觉分析与缓解、扩散模型视频生成、人工数据质量管理、LLM 对抗攻击、自主 Agent 系统、Prompt Engineering、Transformer 架构演进 v2、大模型推理优化等前沿主题。文章技术密度极高,包含大量公式、论文引用和实操洞察,且带有鲜明的个人写作风格(她调侃“从语法错误数量能看出 ChatGPT 参与了多少”),不是小编体或机构通稿。适合对 LLM 前后端技术有较深积累的读者,不适合入门或泛资讯需求。
评论点赞收藏640 天前

什么是扩散模型?

Lilian Weng(OpenAI安全团队负责人)持续更新至2024年的深度技术博客,系统梳理扩散模型的核心原理、数学推导与前沿进展。文章从正向/逆向扩散过程出发,覆盖了训练目标参数化、评分匹配网络(NCSN)、DDPM简化训练、余弦调度、分类器/无分类器引导、DDIM确定性加速、渐进蒸馏、一致性模型单步生成等关键方向。每部分均有核心论文引用和算法伪代码,适合有深度学习基础的读者作为参考手册反复查阅。作者个人视角清晰,不是任务式搬运或SEO拼凑,而是真正的技术写作。
评论点赞收藏663 天前

神经正切核背后的数学推导

深度解析神经正切核(NTK)的数学原理与核心证明。作者以清晰的推导路径,从 Jacobian 矩阵、微分方程、中心极限定理、核方法、高斯过程等基础概念出发,逐步展开无限宽神经网络的 NTK 确定性收敛证明、与高斯过程的深层联系、线性化模型以及懒惰训练现象。全文注重数学推导的完整性和可读性,附带个人研究笔记风格,不是泛泛的趋势综述,而是对几篇核心论文的精讲。适合已有深度学习基础、希望系统理解 NTK 背后严格数学的读者。
评论点赞收藏701 天前

关于高质量人工数据的思考

从1907年Nature上的"民众智慧"实验到现代LLM对齐训练,这篇来自知名ML研究者Lilian Weng的深度技术博客,系统拆解了高质量人工数据的整套方法论:任务设计如何降低标注歧义、标注者筛选与培训流程、基于MACE等概率图模型的恶意标注检测与真值推断。核心亮点在于深入讨论了标注分歧的两种范式——规定性(追求单一标准答案)与描述性(拥抱多元观点),并指出身份背景、话题领域等变量会显著影响标注结果,简单的多数投票远不够用。后半部分介绍了通过影响函数和训练动态追踪(如Data Maps)来识别脏数据的技术方案。文章信息密度极高,引用了大量顶级学术文献(ACL/ICML/Nature等),既有实操经验总结又提供理论框架,是数据科学和AI从业者不可多得的参考资料。
评论点赞收藏918 天前

元学习:学会快速学习

Lilian Weng 系统梳理元学习的经典综述,覆盖基于度量(Siamese Network、Matching Networks、Prototypical Networks)、基于模型(MANN 记忆增强网络)和基于优化三大范式,每个方法都有数学推导和架构图解。文章从"人类能快速学会新概念,机器能否做到"这个核心问题切入,介绍了 few-shot classification 的训练/测试一致策略、embedding 函数设计、注意力机制和记忆寻址等关键技术细节。适合有深度学习基础的读者快速建立元学习知识框架,但全文为文献综述风格,没有个人实验复盘或原创观点,属于高质量整理而非一手突破。
评论点赞收藏920 天前

大语言模型对抗攻击

OpenAI研究员Lilian Weng从内部实践者视角,系统梳理大语言模型对抗攻击(越狱攻击)的技术全景。文章对比了图像(连续高维空间)与文本(离散空间)攻击的根本差异——文本因缺少直接梯度信号而挑战大得多。作者将LLM攻击本质归结为"引导模型输出特定不安全内容"的控制问题,并关联其此前关于可控文本生成的研究。来自一线团队的经验视角和扎实的技术分析,是本文区别于泛泛趋势解读的核心看点。
评论点赞收藏1026 天前

LLM驱动的自主智能体

Lilian Weng系统梳理LLM驱动自主智能体的架构设计:以LLM为大脑核心,配合规划(任务分解与反思优化)、记忆(短期上下文学习与长期向量存储)、工具调用(外部API获取实时信息与代码执行)三大组件。结合AutoGPT、GPT-Engineer、BabyAGI等经典案例,从理论框架到工程实践完整覆盖,是AI Agent领域绕不开的深度技术参考。
评论点赞收藏1150 天前

提示工程

提示工程,又称上下文提示,是指如何与大语言模型进行交互、引导其行为以实现预期目标的方法, 而无需更新模型权重。这是一门经验科学,且不同模型在提示工程方法的效果上差异很大, 因此需要大量实验和启发式策略。 本文仅聚焦于自回归语言模型的提示工程,不涉及填空测试、图像生成或多模态模型。 从本质上讲,提示工程的目标在于实现模型对齐与可引导性。 请参阅我之前发表的文章 ——关于可控文本生成。
评论点赞收藏1250 天前

Transformer 架构家族 2.0:全面更新的演进综述

OpenAI 科学家 Lilian Weng 对其经典技术博文「Transformer 家族」做了重大更新。V2.0 重构了全文结构,新增近三年大量 Transformer 改进论文,篇幅翻倍。文章系统梳理了注意力机制变体、高效 Transformer、预训练策略等关键方向的设计思路与核心论文,每部分均有原理图解和文献索引。这不是泛泛的趋势解读,而是有深度、有体系、有参考文献的技术综述,适合对深度学习模型架构有基础认识的读者深入参考。
评论点赞收藏1297 天前

大型Transformer模型推理优化

OpenAI研究科学家Lilian Weng撰写的大模型推理优化技术综述。文章系统梳理了为什么大型Transformer模型推理在时间和内存上极其昂贵,并详解了蒸馏、量化、剪枝、模型并行、KV缓存优化、投机解码等主流优化方法及其原理。不依赖二手信息,而是以扎实的论文引用和架构分析展开,适合有一定深度学习基础的读者深入理解推理加速的技术全景。非营销软文或趋势泛谈,信息密度高,引用来源清晰,是工程师和研究者可直接参考的技术资料。
评论点赞收藏1313 天前

通用视觉语言模型

Lilian Weng 个人博客中聚焦一种技术路线:如何将预训练通用语言模型扩展为能处理图像信号,从而完成图像描述、视觉问答等任务。作者有意绕开传统目标检测加解码器的老路,直接切入让语言模型原生理解视觉信息的前沿思路。适合对多模态、CV+NLP 交叉方向有兴趣的读者,文内有清晰的路线梳理和技术引用,不堆术语凑篇幅,有作者本人的选型判断和取舍理由。
评论点赞收藏1528 天前

数据不足时的学习方法 第三部分:数据生成

训练数据不够用怎么办?除了半监督学习和主动学习,生成合成数据是另一条实用路径。本文来自知名AI研究者Lilian Weng的系列技术博客第三篇,系统梳理两种数据扩充手段:一是对已有样本做数据增强(文本改写、图像变换等扰动,保持语义不变),二是借助大语言模型通过少样本提示直接生成全新数据点。文章延续前作高质量风格,附有完整引用和前两部分链接,信息密度高、结构清晰,适合有一定机器学习基础的读者深入参考。
评论点赞收藏1583 天前

数据不足时的学习策略(二):主动学习

当标注数据有限且有预算约束时,如何聪明地选择哪些样本让人工标注?本文系统介绍主动学习核心方法:不确定性采样(最低置信度、边距、熵)、多样性采样(基于聚类、核心集选择)以及二者结合策略。来自 OpenAI 研究员 Lilian Weng 的系列技术博客,对于做小样本或低成本标注场景的 ML 工程师有直接操作参考价值。
评论点赞收藏1638 天前

数据不足时的学习策略(一):半监督学习

标注数据有限时四种常用策略的系统介绍。本文聚焦半监督学习,梳理一致性正则化(如 UDA、FixMatch)、伪标签方法、对抗训练、以及自训练等主流技术路线,给出各自的适用场景与局限。Lilian Weng 技术博客系列第一部分,对于在数据标注成本高的工业场景做模型训练的工程师有务实参考价值。
评论点赞收藏1715 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。