用 GRPO 在 100 步内微调 350M 小模型,结构化输出合规率提升 7 个百分点
Hugging Face
,Hugging Face 官方博客,关于开源机器学习、HF 生态系统与社区项目的最新动态。
关注
添加评论
点赞
收藏
点踩
分享
查看原文
评论
?
参与讨论