芦苇
发帖子
探索
今天发现最新帖子添加订阅
热门板块
🤖AI💡科技💻开发🧭产品🛠️工具
订阅
关注
下载芦苇 App ↗
我我的
进入阅读器模式

用 GRPO 在 100 步内微调 350M 小模型,结构化输出合规率提升 7 个百分点

Hugging Face,Hugging Face 官方博客,关于开源机器学习、HF 生态系统与社区项目的最新动态。关注
添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论

登录芦苇

登录后关注作者、收藏内容和参与讨论。

关于作者
Hugging FaceHugging Face 官方博客,关于开源机器学习、HF 生态系统与社区项目的最新动态。
相关文章
Hugging Face 开源 Funes:给编程 Agent 的本地记忆层查看相关内容
Jenzin-Wuang-Nemotron-30B-A3B-BF16查看相关内容
K2 Horizon 模型系列发布:从 0.9B 到 375B 的全尺寸开源模型族查看相关内容