芦苇
发帖子
探索
今天发现最新帖子添加订阅
热门板块
🤖AI💡科技💻开发🧭产品🛠️工具
订阅
关注
下载芦苇 App ↗
我我的
进入阅读器模式

Scaling Coding-Agent RL to 32x H100s. 160% Improvement on Stanford's TBench

Danau5tin (GitHub),首席软件工程师 — 研究 AI 代理和强化学习。关注
添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论

登录芦苇

登录后关注作者、收藏内容和参与讨论。

关于作者
Danau5tin (GitHub)首席软件工程师 — 研究 AI 代理和强化学习。
相关文章
Terminal-Bench-RL: Training long-horizon terminal agents with RL查看相关内容
科技爱好者周刊第412期:Laravel禁止issue、AI完成费马大定理证明、特斯拉出售Cybercab查看相关内容
该不该向社区要赞助?——一位R Markdown维护者的自白查看相关内容