Ollama

Ollama — 使用开放模型自动化的最简单方式。

Ollama 现在在 0.35 版本中支持完全本地运行的 Jev 类决策模型

Ollama 0.35 起支持本地运行 9B 级“决策模型”Nimble(基于 Qwen3.5-9B 微调,Apache 2.0),通过 /v1/systemone 端点接受文本和最多 64 个结构化问题,返回 choice/true-false/rubric 三类答案及其概率,无推理步骤、响应 <100ms。 核心卖点:一次调用批量判断路由、条件、政策或评分;支持 cURL 与 TypeSafe SDK 直接接入 Ollama;训练数据用对比对(一条事实翻转改变答案),13 个人工标注公开数据集平均准确率 75.7%,略低于 Jev 1.13(76%),但在 Score 类任务上高于 Jev。 限制:仅文本,8K token 上下文,概率不等同于真实准确率,不能生成解释或嵌套 JSON。适合需要轻量本地分类/审核/路由的工程场景,值得关注。
评论点赞收藏4 小时前

Ollama 现已支持 Jev 风格的决策模型

Ollama 0.35 起新增对"决策模型"的支持,基于 TypeSafe 的 Jev API,通过本地 /v1/systemone 端点一次请求返回多个结构化判定(选择题、布尔、打分等)。 首批三个模型:Bespoke Labs 的开源 9B "nimble"、Together AI 的实验性 4B "tev1" 和 0.8B "tev1:0.8b"。本地 M5 Max 上 nimble 单次决策约 91ms,适合工单分诊、模型路由、内容/安全审核等低延迟场景。 后续将加入 MLX 加速和更多专用决策模型。附具体 curl 示例和 13 个公开数据集(3880 个判定)的平均准确率对比。
评论点赞收藏8 小时前

Ollama 定价策略变更

Ollama 推出新的订阅定价模式,Free 计划含 starter 额度,Pro 计划每月 60 美元额度,Team 计划 500 美元/月含 1000 美元共享额度。 各模型按 token 计费,deepseek-v4-flash 输入 0.44 美元/百万 token,输出 1.32 美元/百万 token。
评论点赞收藏28 天前

Ollama 推出透明按 Token 计费方案

Ollama 宣布 Pro、Max 和 Team 计划改为按 Token 计费,取消 GPU 时长计费。Pro 月费 $20 含 $60 用量,Max $100 含 $300,Team $500 含 $1,000 共享用量。 免费计划也新增每月少量用量。原因是开源模型变大(如 Kimi K3 达 2.8 万亿参数),GPU 时长计费难以预测。
评论点赞收藏29 天前

在 Claude Desktop 中运行开源模型

Ollama 推出 Claude Desktop 集成,用户可在 Claude Desktop 内直接调用 Ollama 的本地和云端开源模型,同时保留切换回 Anthropic 模型的能力。 遥测默认关闭,Ollama 承诺零数据保留策略。
评论点赞收藏35 天前

Meta Superintelligence Labs 开源模型 Muse Glimmer 现已上线 Ollama

Meta Superintelligence Labs 发布首个开源模型 Muse Glimmer,30B 多模态,Apache 2.0 许可,通过 Ollama MLX 引擎在 Apple Silicon 上运行。 支持 128K+ 上下文长度和可控推理强度(low/medium/high/xhigh),专为本地编码 Agent 和个人助手设计,兼容 Claude Code、Pi、OpenClaw 等。 MLX 引擎新增 DFlash 支持,推理速度提升 1.5×–1.8×,并首次支持图像输入,可用于从草图生成应用、截图驱动电脑操作、读取文档图表等场景。
评论点赞收藏50 天前

Ollama: All Aboard Open Models

Ollama 创始人宣布完成 8800 万美元融资,由 Benchmark 领投。文章回顾团队创立 Docker 的经历,强调 Ollama 作为开源模型运行平台的定位,提出所有权、成本和隐私三大原则,并宣称已覆盖 85% 的财富 500 强企业。
评论点赞收藏73 天前

Ollama:拥抱开源模型时代

Ollama 创始人宣布完成 8800 万美元融资,由 Benchmark 领投。文章回顾团队创立 Docker 的经历,强调 Ollama 作为开源模型运行平台的定位,提出所有权、成本和隐私三大原则,并宣称已覆盖 85% 的财富 500 强企业。
评论点赞收藏73 天前

MLX 平台上借助多令牌预测加速 Gemma 4

Ollama 0.31 在 Apple Silicon 上通过多令牌预测(MTP)技术,使 Gemma 4 模型生成速度平均提升近 90%。该技术利用小型草稿模型并行提议后续令牌,主模型单次验证接受,特别适用于代码生成场景。 Ollama 实现了运行时自动调整草稿长度,并贡献了针对小批量验证优化的 MLX 内核,无需手动配置即可显著加速 Coding Agent 的响应速度。
评论点赞收藏91 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。