Mozilla

RSS: https://blog.mozilla.ai/rss/
开放、透明的 AI,为真实世界带来影响。为开发者、创作者与塑造未来的团队而建。

本地 LLM 服务器性能实测:llama.cpp、llamafile、LM Studio 与 Ollama 横向对比

<p>本地运行LLM不仅仅是选择模型。服务工具起着关键作用,它决定了提示处理的速度、令牌生成的速度以及模型部署的难易程度。我们在四台流行的本地服务器上测量了这些差异(,,,以及我们自己的)利用我们的,一种依赖于比较不同平台上的服务器。</p><p>我们在Mac Studio M4(使用Metal GPU加速)、搭载NVIDIA L40S的Linux服务器(CUDA)和Steam Deck(Vulkan)上进行了测试。我们涵盖了三种Qwen型号大小:0.8B、9B和27B(最后一个因内存限制在Deck上跳过),并测试了提示解析从1,024到8,192个令牌,以及32或64个令牌输出的令牌生成。</p><p>这不是最终排名。它是在三种不同环境中,提供相同模型权重时这些工具表现的实用快照,试图理解每个服务器的“秘密武器”所在。</p><h2><strong>我们发现了什么</strong></h2><ul><li><strong>最大的加速来自配置,而非发动机选择。</strong>在llamafile构建中启用CUDA图后,0.8亿模型的L40S解码提升了16.8%。较新的Vulkan着色器工具链在9B模型上提高了Steam Deck提示处理效率高达63%,且最佳的推测解码草稿长度在不同平台间互换,Metal版本中第二轮获胜,CUDA上第四轮获胜。</li><li><strong>这四台服务器共用同一个核心。</strong>每个设备都通过底层llama.cpp服务GGUF,这也是为什么一旦权重和环境固定,它们在提示处…</li></ul>
评论点赞收藏13 天前

开源不是美德,而是所有权模式

开源是所有权模式,不是道德选择。租用单一厂商的AI控制面会形成架构脆弱性——模型本身短暂,持久的是控制面系统,包括上下文组装、路由决策、回退策略。 推出开源LLM控制面Otari,主张关键抽象边界应当自主掌控而非依赖闭源网关。
评论点赞收藏41 天前

作为产品运营经理,我是这样用 Octonous 的

在,产品运营经理用 Octonous 自动化日常重复工作:每周从 GitHub 抓取发布记录生成用户通讯、通过 Slack emoji 触发竞品情报收集、将客户反馈自动转为格式规范的 GitHub issue。 这些自动化把原本分散在多工具中的琐碎任务整合起来,节省出时间用于需要判断力的产品工作。
评论点赞收藏47 天前

llamafile v0.10.5

llamafile v0.10.5 is out, and it tracks a much more recent llama.cpp, which lets it run two models people have been using lately: Ternary Bonsai 27B and Poolside's Laguna-S-2.1. Both already existed a...
评论点赞收藏56 天前

前沿实验室如何打造微妙的开发者锁定效应

<p>关于AI厂商锁定的讨论通常集中在模型权重、专有微调格式或自定义提示语法上。然而,随着前沿模型从简单的单回合完成引擎转向长期运行的多回合智能系统,前沿实验室正悄悄构建一种更深层次的锁定形式:状态和执行基础设施锁定。</p><p>OpenAI 最近的帖子,,清楚地展示了这一转变。通过实现跨回合隐藏推理的持久性和自动上下文压缩,GPT-5.6 Sol的ARC-AGI-3得分从13.3%跃升至38.3%,同时消耗了6×的输出代币。</p><p>性能提升是真实存在的,但对于开发者构建开放、可移植代理系统的架构影响同样重要。</p><h2><strong>无开发者控制的状态持久化</strong></h2><p>在OpenAI的响应API下,多回合推理可以使用以下任一服务器管理的延续,使后续响应能够访问存储的对话状态和兼容的持久推理项,或由客户端管理的无状态延续,使用,客户端保留并重放完整的响应输出项,包括不透明的<em>reasoning.encrypted_content</em>.</p><p>随着讨论的深入,OpenAI 也可以使用在延续选定状态和推理的同时,减少了它们的语境。由此产生的加密压缩项对开发者来说是不透明的:它可以存储并重放给OpenAI,但不能被检查、解密或翻译给其他模型提供者。</p><p>这不仅仅是OpenAI API的特殊性。人性化的以及双子座都被加密了,并且像OpenAI一样,…</p>
评论点赞收藏62 天前

谁在乎大语言模型的成本?

<p>你为什么要担心他们?大型语言模型承诺几乎无限的能力,担心电表感觉像是别人的问题。支持这部电影。让模型思考多久,对吧?</p><p>右。直到账单到来。</p><h2>震惊</h2><p>想象一下:你最好的聊天助手刚刚上线。几百次测试对话,一张你几乎不注意的账单,一个让团队兴奋的演示。你就发货。使用率会随着功能运行良好时的增长而上升。<br><br>干得好,你!更多用户,更长的会话,存在一个代理循环,现在每个用户操作调用模型三到四次,而不是一次。没人会改代码。</p><p>然后有人打开账单页面,期待看到上个月的数字,结果却看到了一个巨大的数字。遗憾的是,这种情况比我们愿意承认的还要频繁。</p><h2>关于代币经济学的简要说明</h2><p>这些成本意外令人惊讶的地方在于代币经济学的新颖性。普通云支出会根据你配置的资源:实例、数据库层级、核心——而扩展。而LLM的支出则随着对话的波动而扩展。<br><br>冗长的系统提示、用户粘贴长文档,或在错误响应后出现重试循环,都可能使一次请求的成本成倍,而无需更改任何代码。遗憾的是,问题是你仍然会为计算资源付费。<br><br>只是现在,计算资源是别人的行为迫使你使用的。</p><h2>乘数</h2><p>乘以不同供应商的不可预测性,做好应对影响的准备。你不喜欢锁定,所以一个功能运行在OpenAI,另一个运行在Anthropic。六个月前有人把一个成本敏感的批次作业迁移到了自托管模式。<br><br>每个平台都有自己的仪表盘、计费周期,甚至对“代币”的定义。这种缺乏集中化造成了危机,因为从来没有人能在特定日期范围内准确指出支出。</p><p>更…</p>
评论点赞收藏62 天前

别追逐新模型:构建一次即可访问所有模型

<p>发布了一台新的大型语言模型。它更快、更便宜、推理能力更好,或者更适合你的某个工作量。</p><p>产品团队想测试它。从外部看,这听起来像是改个型号名称然后做几次评估。</p><p>从平台或基础设施的角度来看,事情很少那么简单。</p><p>新型号可能通过你的应用不支持的供应商发布。这意味着还需要另一个SDK、认证方法、请求格式、错误模型、环境变量集以及提供者特定的行为集合。</p><p>真正的挑战是不能访问更多模型。它防止每一个新模式都变成另一个基础设施项目。</p><h2><strong>模型只是集成的一部分</strong></h2><p>当应用直接连接到大型语言模型提供商时,它依赖的远不止模型本身。</p><p>它还取决于提供商的SDK、凭证、请求和响应模式、流式流实现、工具调用约定、速率限制、重试、模型标识符和使用数据。</p><p>提供者专用逻辑开始扩展到应用代码、秘密管理、可观测性、测试、部署流程和事件响应等领域。</p><p>这可能需要两个医生来管理。当新厂商出现、模型被弃用、API演变,团队需要不同工作负载的模型时,情况就变得更难了。</p><p>最终,团队不再维护AI应用。它维护的是内部的提供者兼容性层。</p><h2><strong>我们以前见过这个问题</strong></h2><p>软件团队以前也遇到过类似问题。</p><p>在可重复包管理和容器化环境成为标准之前,应用程序经常因库、运行时和操作系统预期版本不兼容而出现故障。更新一个依赖可能会破坏一个无关的组件。<br><br>在两个环境中部署相同软件可能会产生不同的结果。</p><p>我们称之为依赖地狱。</p><p>问题并不是依赖本身就是坏事。应用程序代码与独立演进的系统耦合得过于紧密。</p><p>工程实践通过引…</p>
评论点赞收藏65 天前

从评估到护栏:我们在 ACM FAccT 2026 上的实践

Mozilla 团队在 ACM FAccT 2026 分享了关于 LLM Guardrails 的研究。他们针对难民和庇护场景,使用母语者评估了 120 组多语言案例,发现静态规则无法处理事实核查等复杂问题。 通过引入搜索和检索工具构建“Agentic Guardrails”,实验显示工具调用能显著改变判定结果,但也暴露出不同模型(如 Claude 与 GPT)在工具使用策略上的巨大差异。 Mozilla 同时开源了 any-guardrail 和 Otari 网关,旨在让 Guardrails 像模型一样可配置和灵活切换。
评论点赞收藏70 天前

作为 AI 安全工程师如何使用 Octonous

团队展示 Octonous 在 AI 安全工程师工作流中的作用,包括自动监控库文件和跟踪 AI 安全领域的最新进展。目的是削减日常琐事。 内容侧重于内部工具对特定岗位工作流的优化,属于企业效能案例,对于外部读者而言,其技术借鉴意义和讨论价值相对有限。
评论点赞收藏83 天前

AI 下一个时代的关键在于基础设施,而非仅仅是模型

发布文章认为 AI 竞争焦点已从模型能力转向基础设施控制层。指出多模型部署导致碎片化、成本不透明及治理缺失问题。 文章介绍了其开源项目 Otari,旨在提供统一的 LLM 控制平面,解决企业在生产环境中对 AI 的成本、合规与路由管理需求。
评论点赞收藏83 天前

Otari:开源的大语言模型控制平面

发布开源项目 Otari,旨在为多 LLM 提供商提供统一的基础设施管理平台。支持路由、预算控制和故障转移等功能。 这是典型的机构产品发布通稿,缺乏技术深度或独立评测,主要面向开发者推广其开源工具。
评论点赞收藏86 天前

Mozilla.ai 发布开源 C++ 语音转文本库 transcribe.cpp

发布了 transcribe.cpp,一个基于 ggml 运行时的开源 C/C++ 语音转文本推理库。它支持 Metal、Vulkan 和 CUDA 后端,旨在解决现有 STT 模型在便携性和 GPU 加速上的痛点。 该库是 Mozilla Builders in Residence 项目的独立成果,允许开发者轻松将本地转录功能集成到应用中,或通过 Handy 应用直接体验。
评论点赞收藏89 天前

作为产品经理如何使用 Octonous

介绍内部工具 Octonous 在产品管理中的应用,包括将 Slack 反馈转化为 GitHub Issue 以及跨工具上下文查找。旨在减少日常产品工作的开销。 这是一篇典型的内部工具效能分享,展示了自动化工作流如何提升团队协作效率,但缺乏对外部开发者具有普适性的技术深度或创新方法论。
评论点赞收藏93 天前

Encoderfile 新增图像分类功能

Encoderfile 新增图像分类功能,支持将视觉模型打包为单一可执行文件。用户只需提供文件路径即可输出标签,无需 Python 运行时或复杂的部署基础设施。 这简化了边缘端或轻量级场景下的模型部署流程,适合希望快速集成 AI 能力但又不想维护复杂服务架构的开发团队。
评论点赞收藏99 天前

What Is an LLM Control Plane?

An agent stuck in a reasoning loop doesn't crash. It just quietly burns through your monthly budget until someone notices the bill. A week later, a provider has an outage and your app goes down with i...
评论点赞收藏110 天前

Otari: Own Your AI Stack

Meet Otari, an open-source LLM gateway powered by any-llm, and, the hosted platform built on the same foundation. Run frontier or open-weights models through one API with usage tracking, budget contro...
评论点赞收藏124 天前

AI Got Expensive. Now What?

Cloud AI pricing changed fast in 2026. This post looks at why more teams are moving back to local models, the tradeoffs behind tools like Ollama and LM Studio, and why portability and ownership are be...
评论点赞收藏127 天前

The interface is no Longer the product

The future of AI may not be agents using today’s apps. It may be apps rebuilt around structured representations agents can inspect, modify, and validate directly. The deck, doc, or dashboard becomes t...
评论点赞收藏134 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。