芦苇
发帖子
探索
今天发现最新帖子添加订阅
热门板块
🤖AI💡科技💻开发🧭产品🛠️工具
订阅
关注
下载芦苇 App ↗
我我的
进入阅读器模式

What are RL environments and how to build them

Unsloth,Unsloth,开源大语言模型高效微调与训练库,显著降低显存占用与训练时间,让更多人能在消费级硬件上微调模型。关注
添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论

登录芦苇

登录后关注作者、收藏内容和参与讨论。

关于作者
UnslothUnsloth,开源大语言模型高效微调与训练库,显著降低显存占用与训练时间,让更多人能在消费级硬件上微调模型。
相关文章
Run DeepSeek R1 Dynamic 1.58-bit查看相关内容
罗伊斯笔下的19世纪旧金山:淘金热时代的财富、混乱与人情查看相关内容
DeepSeek发布V4.1-Flash:新架构小模型性能超越旗舰V4-Pro查看相关内容