Yingru Li

RSS: https://richardli.xyz/index.xml
强化学习与决策方向的研究员。

最优Token基线:解决LLM强化训练崩溃的新方法

针对大语言模型强化训练中常见的梯度爆炸和训练崩溃问题,提出了一种基于第一性原理推导的“最优Token基线(OTB)”。 该方法认为梯度噪声具有异质性,更新时应根据累积不确定性进行加权。 通过引入计算成本为零的Logit-Gradient代理,仅利用前向传播概率即可近似真实的梯度范数,无需额外反向传播。实验显示,该方法能显著稳定训练过程,在减少60%以上Token消耗的同时,实现了与更大组规模相当的性能。
评论点赞收藏239 天前

稳定性鸿沟:为什么Top-K路由会破坏强化学习优化

文章深入分析了为什么在混合专家(MoE)语言模型中使用强化学习(RL)训练时会变得不稳定。 核心原因在于Top-K路由机制引入了离散跳跃,导致梯度黑障和近似失效。 作者指出,未选中的专家接收不到梯度信号,且参数微小变化会导致专家切换,破坏了PPO等算法依赖的一阶近似假设。这解释了MoE模型RL训练中的常见崩溃现象,并提出了软路由或熵正则化等潜在解决方案。
评论点赞收藏252 天前

Ensemble++:通过集成方法实现可扩展的深度强化学习探索

文章介绍了Ensemble++算法,旨在解决深度强化学习中Thompson Sampling计算成本过高的问题。该方法通过共享集成矩阵因子和增量更新,大幅降低了计算复杂度。 理论证明其在线性及非线性设置下均能保持接近最优的遗憾界,并在实验验证了其在不同场景下的有效性。
评论点赞收藏260 天前

语言作为强化学习智能体的通用接口

文章建立数学框架,指出语言是强化学习代理的通用接口,具备主动词汇管理、上下文管理和双层决策结构三大核心能力。 通过SWE-Bench实例分析,揭示了状态压缩的物理必要性及稀疏奖励下的信用分配难题,为设计高效智能体提供理论蓝图。
评论点赞收藏282 天前

第3部分:通过序列掩码实现信任域优化

本文深入分析了强化学习训练中因训练与推理分布不匹配导致的崩溃问题。指出传统的序列重要性采样在长文本生成中存在严重的长度偏差,即长序列容易被错误拒绝。 作者提出了几何序列掩码(Geo-Mask)方法,通过基于每个token的信任区域来消除长度依赖,从而稳定大模型推理能力的训练过程。
评论点赞收藏285 天前

Rollout 校正方法的数学公式详解

本文详细推导了 verl 框架中处理离线策略问题的 rollout 校正数学公式,涵盖从 REINFORCE 到 Decoupled PPO 的演进。 针对策略不匹配、异步延迟及回放缓冲区等场景,提供了统一的处理框架与实现细节。
评论点赞收藏285 天前

应用SGA框架:Token级与序列级校正对比

本文深入分析了强化学习中序列级与Token级重要性采样的偏差与方差问题。指出传统PPO等方法虽控制了方差,但存在随序列长度平方增长的严重偏差。 提出序列级截断重要性采样(Seq-TIS),通过调整截断阈值在偏差和方差间取得最优平衡,为解决RL崩溃提供了新的理论框架。
评论点赞收藏289 天前

为什么离策学习会破坏强化学习:基于 SGA 的分析框架

文章从随机梯度上升理论出发,解释强化学习中 Off-Policy 导致崩溃的两个根源:偏差和方差。指出 PPO 等算法主要控制偏差,但无法解决由分布差异引发的方差爆炸问题。 作者认为现有信任域方法存在盲区,并提出需要新的评估框架来平衡偏差与方差,以解决分布式训练中的策略失配难题。
评论点赞收藏290 天前

强化学习中的信息带宽:梯度结构如何决定信息容量

文章从信息论角度分析了强化学习中的策略梯度算法。指出标量优势(Scalar Advantage)会将大量奖励信息压缩为极少比特,造成信息瓶颈。 而时间步级优势(Per-Timestep Advantages)能保留更多奖励熵。这解释了为何在密集奖励场景下,Actor-Critic等方法比简单REINFORCE更有效。
评论点赞收藏317 天前

未知博弈中的无后悔学习及其应用

作者分享了关于未知博弈中无后悔学习的研究进展及应用。内容主要基于其在南京大学及博士后的学术论坛邀请演讲。 涉及强化学习理论、多智能体系统及算法优化等专业领域。
评论点赞收藏1453 天前

HyperDQN:深度强化学习中的随机探索策略

作者介绍其在 NeurIPS 研讨会上的演讲内容,主题为 HyperDQN,一种用于深度强化学习的随机探索算法。 主要涉及强化学习、大规模优化及大语言模型推理的研究方向。
评论点赞收藏1706 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。