Unsloth 桌面版发布:本地运行和训练 AI 模型Unsloth 发布桌面版应用,支持在本地运行和训练 LLM、图像/视频扩散模型、音频模型等,兼容 macOS/Windows/Linux。宣称工具调用准确率提升 50%、推理速度 2 倍、显存节省 70%,支持 Claude Code 等 Agent 接入本地模型。 评论点赞收藏4 天前
Unsloth 正式加入 PyTorch 生态系统Unsloth 官方宣布加入 PyTorch 生态系统。文章主要回顾了他们与 PyTorch 在 FP8 RL、手机端部署及量化训练等方面的合作成果,并列举了 Unsloth 的核心功能(如加速训练、降低显存占用、提供 Studio UI 等)。这是一篇典型的项目公关通稿,旨在宣传品牌背书和社区感谢,缺乏新的技术深度或独立观点,对科技读者的互动吸引力有限。 评论点赞收藏96 天前
Unsloth与英伟达合作:如何在消费级显卡上将大模型训练提速25%Unsloth与NVIDIA合作,在不损失精度的前提下将LLM训练速度提升约25%。主要优化包括:1. 缓存打包序列元数据,减少跨层重复同步,使前向传播提速14.3%;2. 使用双缓冲异步梯度检查点重载,隐藏CPU到GPU的数据拷贝延迟,在大模型上提速约8%;3. 优化MoE路由逻辑,用argsort和bincount替代动态查询,进一步加速。这些改进针对的是算子之外的胶水代码开销,随着核心算子变快,这类系统级优化变得尤为重要。 评论点赞收藏101 天前
Gemma 4 微调实战指南:避坑与性能优化Unsloth 发布了针对 Google Gemma 4 模型的微调指南和新工具 Unsloth Studio。文章核心内容包括:1. 性能优势:Unsloth 比原生 FA2 快 1.5 倍且显存降低 60%。2. 避坑指南:详细解释了 Gemma 4 训练中常见的 Loss 异常(梯度累积 bug)、推理 IndexError 以及 use_cache=False 导致生成乱码的技术原因及修复方案。3. 实操教程:提供了从安装到使用 Web UI 或代码进行微调的完整步骤,涵盖文本、视觉、音频及强化学习场景。4. 硬件门槛:列出了不同参数量模型所需的最低显存配置。这是一篇针对开发者的实用技术文档,解决了新模型落地时的具体工程痛点。 评论点赞收藏128 天前
Unsloth Studio 发布:面向本地 AI 的开源无代码 Web UIUnsloth 发布了 Unsloth Studio Beta,这是一个开源的本地 AI Web UI,旨在提供无代码的训练、运行和导出模型的一体化界面。主要功能包括:支持在 Mac、Windows、Linux 上本地运行 GGUF 和 safetensor 模型;利用优化内核实现 500 多种模型 2 倍速度训练且显存降低 70%;内置“自我修复”工具调用、高级网页搜索和代码执行能力;支持从 PDF/CSV 等文件自动创建数据集;可作为 API 端点集成到 Claude Code 等工具中;强调隐私安全,支持完全离线运行。目前支持 NVIDIA 和 Intel GPU 训练,Mac 全支持,AMD 训练支持即将推出。 评论点赞收藏151 天前
什么是RL环境以及如何构建它们:NVIDIA NeMo Gym实战指南文章由Unsloth与NVIDIA合作撰写,深入解析了强化学习(RL)在构建Agentic AI时的核心角色。主要观点包括:1. 从SFT转向RL的必要性:SFT擅长模仿,但RL能让模型在多步推理和工具调用中通过验证性奖励(RLVR)自我修正,提升鲁棒性。2. 环境设计的挑战与架构:传统RL耦合度高,NVIDIA推出的NeMo Gym通过解耦环境运行与训练,标准化轨迹数据,解决了资源管理和并行扩展问题。3. 实战流程:分为环境准备(基准测试、任务生成、奖励配置)和模型训练两个阶段。4. 技术细节:介绍了Agent Server、Resource Server和验证逻辑的具体实现,强调使用确定性验证器替代复杂的奖励模型,以提高效率。 评论点赞收藏154 天前
如何使用 Unsloth 在本地运行大模型并接入 Claude Code本文是一份详细教程,指导用户如何在本地通过 Unsloth Studio 和 llama.cpp 运行开源大模型(如 Gemma 4、Qwen3),并将其连接至 Anthropic 的终端编程代理 Claude Code。文章核心亮点在于解决了一个具体的工程痛点:Claude Code 默认添加的 Attribution Header 会导致 KV Cache 失效,使本地模型推理速度下降 90%。作者提供了通过环境变量或配置文件禁用该 Header 的具体修复方案,并给出了完整的跨平台安装与配置步骤。对于希望利用本地算力替代云端 API 以降低成本或保护隐私的开发者来说,这是一篇具有实际参考价值的操作指南。 评论点赞收藏156 天前
如何在本地运行 Qwen 3.5本文介绍了如何在本地运行阿里最新的 Qwen 3.5 系列大模型。主要内容包括:1. 硬件需求:提供了不同参数量模型(从 0.8B 到 397B)在不同量化精度下的显存/内存需求表,指出 27B 和 35B 模型可在 22GB 内存的 Mac 上运行。2. 推荐设置:详细列出了思考模式和非思考模式下的温度、Top-p 等参数建议,以及针对代码任务和通用任务的不同配置。3. 运行指南:重点介绍了使用 Unsloth Studio(新的 Web UI)和 llama.cpp 进行本地推理的步骤,包括安装、下载 GGUF 模型文件和运行命令。4. 注意事项:提到目前 Qwen 3.5 的 GGUF 版本在 Ollama 中尚不兼容,建议使用 llama.cpp 兼容的后端。 评论点赞收藏161 天前
Qwen3.5 微调完全指南:Unsloth 加速与显存优化实战Unsloth 官方文档详细介绍了如何使用 Unsloth 对 Qwen3.5 系列模型进行微调。支持视觉和强化学习(RL)微调。主要亮点包括:Unsloth 比 FA2 快 1.5 倍且显存占用减少 50%;提供了从 0.8B 到 122B 不同规模模型的显存需求参考;支持 bf16 LoRA 和全量微调;针对 MoE 模型给出了特定的训练建议;提供了 Unsloth Studio 图形界面和代码两种使用方式;包含详细的安装、训练、监控和导出步骤(支持 GGUF 和 vLLM)。 评论点赞收藏164 天前
Unsloth 发布 Dynamic 2.0 量化技术:更小的体积与更高的精度Unsloth 发布 Dynamic 2.0 量化方案,宣称在精度和效率上超越主流方法。文章核心亮点包括:1. 技术升级:动态调整每一层的量化类型,支持所有模型架构,并提供多种新格式以优化 Apple Silicon 等设备性能。2. 评测体系革新:引用论文指出 MMLU 分数可能因错误答案翻转而失真,主张使用 KL Divergence 作为量化误差的金标准,并批评了现有基准测试中的过拟合问题。3. 实测数据:展示 Gemma 3 和 Llama 4 的对比数据,声称其 4-bit 量化版本比官方 QAT 版本更小且准确率更高。4. 社区贡献:详细列举了协助修复 Llama 4 和 Qwen 等模型在 llama.cpp 中的 Bug,体现了其在本地 AI 生态中的实际影响力。 评论点赞收藏169 天前
Unsloth 发布 Qwen3.5 量化基准:张量敏感度分析与 imatrix 优化实战Unsloth 发布了 Qwen3.5 系列模型的 GGUF 量化基准测试与优化建议。核心发现包括:1. 不同张量对量化敏感度差异大,ssm_out 和 attn 层不宜过度量化,而 ffn 层在 3-bit 左右较平衡;2. 使用 imatrix 校准数据能显著降低 KL 散度,提升聊天、代码和工具调用能力,但推理速度可能下降 5-10%;3. 传统困惑度(PPL)和 KL 散度指标可能误导,实际表现需结合 LiveCodeBench 等真实场景评估;4. 废弃 MXFP4 格式,推荐 Q4_K 等更优方案。文章提供了详细的对比图表和下载链接,适合本地部署 AI 的技术读者参考。 评论点赞收藏169 天前
MiniMax-M2.5 本地运行指南:Unsloth 量化技术让 230B 模型跑在消费级硬件上Unsloth 发布了 MiniMax-M2.5 大模型的本地运行指南。该模型在代码和搜索任务上表现强劲,通过 Unsloth 的动态量化技术,将 230B 参数模型压缩至 101GB(3-bit),使其能在 128GB 内存的 Mac 或消费级显卡上流畅运行。文章提供了详细的 llama.cpp 部署步骤、推荐参数及第三方基准测试对比,证明其量化版本在精度与体积间取得了极佳的平衡。 评论点赞收藏174 天前
使用 Unsloth 将 MoE 模型微调速度提升 12 倍Unsloth 发布了针对 MoE 架构大模型的微调加速方案,声称比 Transformers v5 快 12 倍且显存降低 35%。核心创新包括自定义 Triton 内核和 Split LoRA 算法,通过改变矩阵乘法顺序来避免全量参数合并带来的显存爆炸。实测数据显示在 B200、H100 及消费级显卡上对 Qwen3、gpt-oss 等主流 MoE 模型均有显著提速和显存优化,解决了长上下文训练易 OOM 的痛点,适合有本地微调需求的开发者。 评论点赞收藏183 天前
Qwen3-Coder-Next:如何在本地运行介绍如何本地运行 Qwen3-Coder-Next 模型。该模型为 80B MoE 架构,支持 256K 上下文,仅需 46GB 内存即可运行。文章提供了基于 Unsloth Studio 和 llama.cpp 的详细部署教程,包含参数设置、量化版本选择及代码示例,适合有本地部署需求的开发者参考。 评论点赞收藏193 天前
使用 Claude Code 和本地开源模型运行代码智能体的完整指南本文是一篇由 Unsloth 发布的详细教程,指导开发者如何在本地部署并连接开源大模型(如 Gemma 4、Qwen 3.6)到 Claude Code 终端代理中。文章核心亮点在于解决了一个具体的性能痛点:Claude Code 默认添加的 Attribution Header 会导致 KV Cache 失效,使推理速度降低 90%。作者提供了通过命令行参数或修改 settings.json 来禁用该 Header 的具体修复方案。此外,教程涵盖了 Unsloth Studio 和 llama.cpp 的安装配置、API Key 设置以及跨平台(Mac/Win/Linux)的操作步骤,旨在帮助用户利用本地算力运行低成本、高隐私的代码智能体。 评论点赞收藏198 天前
Unsloth 支持 Embedding 微调:速度提升 1.8-3.3 倍Unsloth 官方文档宣布支持 Embedding 模型的微调,速度提升 1.8-3.3 倍且显存占用更低。文章详细列出了支持的模型列表(如 Qwen3-Embedding, ModernBERT),提供了针对语义搜索、医疗、技术文档等场景的免费 Colab 笔记本,并说明了使用 FastSentenceTransformer 进行训练和推理的具体代码流程。适合需要优化 RAG 检索效果的技术人员参考。 评论点赞收藏205 天前
Unsloth Studio:本地部署 GLM-4.7-Flash 模型指南Unsloth 推出新 Web UI 支持本地部署 的 GLM-4.7-Flash 模型。该模型为 30B MoE 架构,激活参数仅约 3.6B,可在 24GB 显存下运行,支持 200K 上下文。文档提供了详细的 llama.cpp 运行指南、微调方法以及针对代码生成和工具调用的推荐参数。此外还修复了导致输出循环的 bug,并演示了模型生成 Flappy Bird 游戏代码的能力。 评论点赞收藏207 天前
如何在 ComfyUI 本地运行 Qwen-Image-2512本文介绍了如何在本地使用 ComfyUI 运行最新的开源图像生成模型 Qwen-Image-2512。文章提供了详细的安装步骤,包括下载 GGUF 格式的模型文件、配置工作流以及具体的参数设置技巧(如提示词工程和负向提示词的自然语言写法)。此外,还展示了多参考图像生成的具体案例,并附带了 Diffusers 和 stable-diffusion.cpp 的运行代码示例。对于希望本地部署最新开源图像模型的开发者来说,这是一份实用的操作指南。 评论点赞收藏227 天前