超越精度:为何训练-推理失配是优化问题,以及简单学习率调度如何解决它文章指出大语言模型强化学习训练不稳定源于训练与推理的不匹配。作者从优化角度分析,发现随着训练进行,梯度噪声和不匹配程度同时增加。 提出一种基于响应长度变化的动态学习率调度方案,在噪声上升时降低学习率,从而稳定训练过程并控制不匹配风险。 评论点赞收藏239 天前
最优Token基线:解决LLM强化训练崩溃的新方法针对大语言模型强化训练中常见的梯度爆炸和训练崩溃问题,提出了一种基于第一性原理推导的“最优Token基线(OTB)”。 该方法认为梯度噪声具有异质性,更新时应根据累积不确定性进行加权。 通过引入计算成本为零的Logit-Gradient代理,仅利用前向传播概率即可近似真实的梯度范数,无需额外反向传播。实验显示,该方法能显著稳定训练过程,在减少60%以上Token消耗的同时,实现了与更大组规模相当的性能。 评论点赞收藏239 天前
面向长程大模型强化学习的信任区域掩码方法针对大语言模型强化学习中长序列生成的策略梯度误差问题,提出信任区域掩码方法。 传统边界在长序列下失效,该方法通过序列级掩码解决离策不匹配,提供单调改进保证。 评论点赞收藏239 天前
稳定性鸿沟:为什么Top-K路由会破坏强化学习优化文章深入分析了为什么在混合专家(MoE)语言模型中使用强化学习(RL)训练时会变得不稳定。 核心原因在于Top-K路由机制引入了离散跳跃,导致梯度黑障和近似失效。 作者指出,未选中的专家接收不到梯度信号,且参数微小变化会导致专家切换,破坏了PPO等算法依赖的一阶近似假设。这解释了MoE模型RL训练中的常见崩溃现象,并提出了软路由或熵正则化等潜在解决方案。 评论点赞收藏252 天前
Ensemble++:通过集成方法实现可扩展的深度强化学习探索文章介绍了Ensemble++算法,旨在解决深度强化学习中Thompson Sampling计算成本过高的问题。该方法通过共享集成矩阵因子和增量更新,大幅降低了计算复杂度。 理论证明其在线性及非线性设置下均能保持接近最优的遗憾界,并在实验验证了其在不同场景下的有效性。 评论点赞收藏260 天前
语言作为强化学习智能体的通用接口文章建立数学框架,指出语言是强化学习代理的通用接口,具备主动词汇管理、上下文管理和双层决策结构三大核心能力。 通过SWE-Bench实例分析,揭示了状态压缩的物理必要性及稀疏奖励下的信用分配难题,为设计高效智能体提供理论蓝图。 评论点赞收藏282 天前
第3部分:通过序列掩码实现信任域优化本文深入分析了强化学习训练中因训练与推理分布不匹配导致的崩溃问题。指出传统的序列重要性采样在长文本生成中存在严重的长度偏差,即长序列容易被错误拒绝。 作者提出了几何序列掩码(Geo-Mask)方法,通过基于每个token的信任区域来消除长度依赖,从而稳定大模型推理能力的训练过程。 评论点赞收藏285 天前
Rollout 校正方法的数学公式详解本文详细推导了 verl 框架中处理离线策略问题的 rollout 校正数学公式,涵盖从 REINFORCE 到 Decoupled PPO 的演进。 针对策略不匹配、异步延迟及回放缓冲区等场景,提供了统一的处理框架与实现细节。 评论点赞收藏285 天前
应用SGA框架:Token级与序列级校正对比本文深入分析了强化学习中序列级与Token级重要性采样的偏差与方差问题。指出传统PPO等方法虽控制了方差,但存在随序列长度平方增长的严重偏差。 提出序列级截断重要性采样(Seq-TIS),通过调整截断阈值在偏差和方差间取得最优平衡,为解决RL崩溃提供了新的理论框架。 评论点赞收藏289 天前
为什么离策学习会破坏强化学习:基于 SGA 的分析框架文章从随机梯度上升理论出发,解释强化学习中 Off-Policy 导致崩溃的两个根源:偏差和方差。指出 PPO 等算法主要控制偏差,但无法解决由分布差异引发的方差爆炸问题。 作者认为现有信任域方法存在盲区,并提出需要新的评估框架来平衡偏差与方差,以解决分布式训练中的策略失配难题。 评论点赞收藏290 天前
强化学习中的信息带宽:梯度结构如何决定信息容量文章从信息论角度分析了强化学习中的策略梯度算法。指出标量优势(Scalar Advantage)会将大量奖励信息压缩为极少比特,造成信息瓶颈。 而时间步级优势(Per-Timestep Advantages)能保留更多奖励熵。这解释了为何在密集奖励场景下,Actor-Critic等方法比简单REINFORCE更有效。 评论点赞收藏317 天前
当速度扼杀稳定性:揭秘强化学习崩溃背后的训练推理失配研究发现强化学习中的训练与推理速度差异会导致模型崩溃。智能体工作流产生的低概率令牌是薄弱环节,引发梯度爆炸。不同GPU架构会加剧这一问题。序列级重要性采样被证明是恢复稳定性的有效方案。 评论点赞收藏333 天前
HyperAgent:一种简单、高效、可扩展且可证明的强化学习框架提出HyperAgent强化学习框架,通过超模型和增量更新机制提升大规模环境下的数据与计算效率。 理论层面首次实现可证明的线性复杂度与次线性遗憾,填补了理论与实践之间的空白。 评论点赞收藏875 天前
HyperAgent:一种简单、高效且可扩展的复杂环境强化学习框架提出HyperAgent框架,通过超模型和增量更新机制,解决资源受限下强化学习在大规模状态空间中的效率问题。 理论证明其具备可扩展的计算复杂度和次线性遗憾界,并在基准测试中展现出显著的数据和计算效率优势。 评论点赞收藏945 天前
通过高效强化学习迈向人类通用人工智能深圳大学研究生论坛获奖演讲摘要。介绍HyperFQI算法在Atari游戏基准测试中的效率表现及理论保证。 旨在通过高效强化学习推动通用人工智能发展。 评论点赞收藏1029 天前
未知博弈中的无后悔学习及其应用作者分享了关于未知博弈中无后悔学习的研究进展及应用。内容主要基于其在南京大学及博士后的学术论坛邀请演讲。 涉及强化学习理论、多智能体系统及算法优化等专业领域。 评论点赞收藏1453 天前
HyperDQN:深度强化学习中的随机探索策略作者介绍其在 NeurIPS 研讨会上的演讲内容,主题为 HyperDQN,一种用于深度强化学习的随机探索算法。 主要涉及强化学习、大规模优化及大语言模型推理的研究方向。 评论点赞收藏1706 天前