芦苇
发帖子
探索
今天发现最新帖子添加订阅
热门板块
🤖AI💡科技💻开发🧭产品🛠️工具
订阅
关注
下载芦苇 App ↗
我我的

HyperAgent - A Simple, Efficient, Scalable and Provable RL Framework

Yingru Li,强化学习与决策方向的研究员。关注
添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论

登录芦苇

登录后关注作者、收藏内容和参与讨论。

关于作者
Yingru Li强化学习与决策方向的研究员。
相关文章
超越精度:为何训练-推理失配是优化问题,以及简单学习率调度如何解决它查看相关内容
最优Token基线:解决LLM强化训练崩溃的新方法查看相关内容
面向长程大模型强化学习的信任区域掩码方法查看相关内容