Earendil Posts

RSS: https://earendil.com/posts/feed.rss
Earendil 是一家公益公司,打造软件和开放协议,以增强人的主体性、弥合分歧、培育持久的快乐。

你说不要 MCP

<p>如果您过去访问过 pi.dev,会看到一则郑重声明:Pi 不支持 MCP。如果您收听过我们谈及 Pi 的播客节目,也会听到我们多次对 MCP 表示不屑,其中就包括 。<br><br>然而,当您升级到最新版 Pi 后会发现,MCP 现已成为一项受支持的功能。这是怎么回事?</p><h2>事物在变化</h2><p>首先要明确的是,。过去一年里,我们持续关注 MCP,如今的 MCP 已非昔日模样。不过,仅凭这一点尚不足以将其纳入核心功能。<br><br>众所周知,Pi 拥有丰富的扩展生态,MCP 本可以作为一项扩展存在,甚至成为 Earendil 认可的扩展。的确如此,。MCP 如今被纳入核心,正是我们集思广益、重新审视后的结果。</p><h2>究竟发生了哪些变化?</h2><p>我们将 MCP 纳入核心,并不仅因为 MCP 本身的变化,还因为我们发现其所需的改动具有普遍适用性。例如,我们对 MCP 所做的调整也使 Jev 在 Pi 中的使用更加便捷。<br><br>归根结底,Pi 所需与 MCP 所需颇为相似:都需要一个以解释器为载体的沙盒环境。</p><p>尽管 MCP 的许多方面已有所改进,但仍有相当一部分未变。MCP 最大的问题依然在于难以组合调用。即便借助 codemode——一种用于工具调用组合的简易沙盒——MCP 也未能完全解决这一难题。<br><br>不过,这与其说是 MCP 本身的问题,不如说是现有 MCP 服务器及各对接方案的局限所致。</p><p>许多 MCP 服务器仍面向那些将工…</p>
评论点赞收藏16 小时前

如果编程已被解决,接下来呢?——量化代码冗余度

<p>LLM在生成代码方面几乎做到了完美,但这还不是全部。代码形式上正确,并不意味着它没有引入不必要的抽象、制造重复,或者整体上做出错误决策。<br><br>这并不是一个突破性的观察,大多数做过vibe编码项目的人都意识到,每增加一个功能有时会导致代码行(LOC)的爆炸式增长。</p><p>这导致人力能动性丧失,因为在每月增加数百万信用额度的项目中,人类很难跟上。有人可能会说这根本不是问题,因为他们信任代理人能处理这些问题。<br><br>我有个坏消息,代理人其实也无法应对这些粗糙的处理。</p><p>我有物理背景,一直采用实验/定量的方法来解决问题。当我刚加入Earendil,负责研究如何衡量代码的粗糙时,我的本能是先深入研究文献,然后再看看其他公司都在做什么。</p><p>坦率地说,除了几篇有见地的研究论文外,我对目前行业看起来过于“氛围化”感到失望。在我的研究和X研究中,我不断被诸如“端到端编码代理”、“不仅仅建议代码——它直接发布代码的人工智能”或“无人类成本的人类层面评估”等信息轰炸。<br><br>这些故事和所有好故事一样,其中确实有一点真实成分。</p><p>LLM能够写入<strong>几乎</strong>完全正确的代码。这是因为代码的可扩展性和可验证性。让大型语言模型生成代码,然后通过隐藏测试检查代码,从而得到明确的奖励信号,是相当简单的。<br><br>与此形成鲜明对比的是,检查代码的“粗糙性”通常需要人类的直觉和品味,而且总体来说是一项极其困难的任务。我认为最好的说明方式是通过分析可能的“slop”测量方法来说明原…</p>
评论点赞收藏19 天前

Agent harness 虽多,但这款最懂我

Earendil 的 Founders Associate Jakob 分享了他作为非工程师使用自家开源 agent harness Pi 的经历。Pi 在本地运行,可通过自然语言完成 PDF 阅读、邮件整理、Google Apps Script 编写等任务,社区已共享超 5,000 个扩展。 文章核心观点是:你不需要会写代码也能拥有并定制自己的 AI 工具。
评论点赞收藏28 天前

什么是AI Agent Harness?

<p><strong>Harness</strong>——剑桥词典的定义</p><p><em>名词。</em>一种由带子和皮带组成的装备,用于控制或固定人、动物或物体</p><p><em>动词。</em>控制某物,通常是为了利用其力量</p><p>——</p><p>每当我想到“Harness”时,首先浮现的是中学时代攀岩前系在身上的那套安全带。说到底,我充其量不过是个平平无奇的攀岩者。</p><p>不过,如果你最近主要通过人工智能新闻资讯获取信息,那么你脑海中典型的“Harness”或许早已是某种智能体框架了。而这篇文章,并不是写给你的。</p><p>它写给那些或许好奇什么是智能体框架,却始终没弄明白、又不好意思开口询问的人们。</p><p>让我们回到攀岩的话题。</p><p>为什么攀岩时要系上安全带?首先,它能承托住你,保障你的安全。它通过将你与快挂和绳索相连,防止坠落、调节节奏、指引路线。你还可以把其他工具挂在安全带上,比如粉袋、塞子工具和快挂器。</p><p>当你去攀登不同的山峰、尝试不同的路线时,都可以带着这副安全带。根据地形的不同,你甚至可以对它进行改装,调整装备环上的配置。<br><br>攀岩安全带具有很强的适应性,杂技演员和树艺师也会使用它们。拥有者可以按照自己的需求,让这副安全带真正成为“自己的”。</p><p>从结构到功能,攀岩安全带与智能体框架之间都存在着诸多相似之处。</p><h2>智能体框架</h2><p>有人曾这样简单地概括:智能体 = 模型 + 框架。这里的“框架”指的就是智能体框架。那么,智能体框架究竟是什么?智能体框架借助AI模型来构建智能体,最初的应用场景是编程。<br><br>如今,它已居于各类AI智能体的核心地位;理解…</p>
评论点赞收藏37 天前

什么是 Agent Harness?

Agent harness 是 AI 模型运行的软件环境,正成为所有 AI agent 的核心。它提供四样东西:system prompt 控制模型行为、tools 让模型调用外部能力、agentic loop 让模型自主决策循环执行任务、translation layer 支持切换不同模型。 用户可以本地运行自己的 harness,把控制权从 AI 实验室拿回到自己手里。
评论点赞收藏41 天前

Pi 编码助手的上下文压缩机制详解

<p>如果你曾经在编码代理中进行过长时间的编码会话,比如Claude Code 或 Codex,你将触发一次压缩。在这篇文章中,我们将解释压缩的工作原理以及何时 Pi 需要压缩。</p><h2>一次关于LLM的对话</h2><p>大型语言模型(LLM)的局限性.上下文窗口是模型在产生响应时能够“看到”的内容。该LLM使用的输入限制了它们能处理的输入量。<br><br>编码代理会话的输入包含所有之前的消息和工具调用,随着你的工作,这个输入会不断增加。一旦超过上下文窗口,LLM就会拒绝该请求。</p><p>在与像Pi这样的编码代理进行交互式操作时,代理会向LLM发送请求并接收响应。每个请求都包含一个系统提示符、加载的文件,如、工具定义以及会话历史。</p><p>编码代理的第一个LLM请求包含这个初始上下文,以及第一个用户消息。</p><pre><code>request 1: [system][tools][user] </code></pre><p>这开始了一个回合。LLM可能先返回一个包含工具调用的助手消息。代理程序执行这些请求,并向LLM发送包含完整对话的新请求,现在还包括工具结果。<br><br>我们又收到一个助手消息。当助手完成输出时,回合结束。</p><pre><code>after request 1: [system][tools][user][assistant: tool call][tool result][assistant] &lt;-----------------…</code></pre>
评论点赞收藏47 天前

Pi 的上下文压缩机制是如何工作的

Pi coding agent 在上下文接近窗口上限时自动压缩对话历史:保留最近约 20k token(5-20 轮)的消息不变,将更早的内容用独立 LLM 请求生成结构化摘要(goal、progress、key decisions 三部分),同时把工具调用结果截断到 2000 字符以控制压缩请求本身的大小。 压缩会打断 prompt caching,但之后新请求可重新享受缓存。Pi 的压缩逻辑支持通过扩展机制替换自定义实现。
评论点赞收藏48 天前

Pi:极简编码代理框架的实战验证

<h2>Pi的极简主义是它的优势</h2><p>人工智能让代码变得廉价,因此许多公司都在构建更大的工具以追求更好的性能。更大的提示词、更多的编排、更多的层次、更复杂的结构。<br><br>这也使这些工具本质上使用成本更高。而树莓派则采取了相反的做法。</p><p>Pi 是刻意选择极简主义的编码工具。它开箱即用 4 个工具,而且工具定义通常低于1000个token。理念是大部分工作都能从基础完成,如果想要更多,就自己构建。</p><p>越来越多的证据表明,Pi的设计不仅更简洁;它更便宜、更高性能。用户发现,原版Pi在添加符合用户特定工作流程和需求的扩展之前,就能产出行业领先的成果。<br><br>正如我们在Databricks和Shopify的案例研究中看到的,Pi为两者都带来了理想结果。</p><h2>案例研究</h2><h2><strong>Databricks 研究:每任务成本</strong></h2><p>Databricks最近分享了他们的发现”.”他们的研究目标是了解哪些编码代理在现实编码任务中表现最佳,以及任务性能如何随价格变化。</p><p>以避免外部偏见他们根据工程师团队定期执行的任务创建了自己的成果。结果符合我们的预期,但业内许多人可能会感到惊讶。<br><br>用他们的话说,“......模型所从哪种线束极大地影响成本和质量”,而且,“在许多情况下,像Pi这样的简单线束在我们的工作负载上表现最佳。”</p><p>与Opus 4.8 xhigh结合使用时,Pi的整体通过率最高,成…</p>
1 条评论点赞收藏56 天前

带不走的会话:推理API正在剥夺你的对话所有权

<p>推理API最初的承诺非常简单:发送输入,接收输出。如果你两者都保留了,那你就已经有了对话。你可以检查它、归档、重放,或者给别的型号。</p><p>这种抽象从来都不完全正确。例如:在别人的GPU上,不同型号的分词方式不同,采样不可复现(而且是有意为之)。但是<em>语义记录</em>以文字记录形式存在的会话仍可能属于用户。<br><br>转录稿应包含说明、信息、工具调用和工具结果。另一个足够强大的模型可能不会完全一样,但它能理解发生了什么并接管。</p><p>推理API令人沮丧地在某种程度上逐渐远离了这一特性。它们越来越多地返回文本和提供者绑定状态混合的信号,这种状态非常刻意地不适合携带。</p><ul> <li>这些推理令牌向用户计费,但只以不透明的加密块形式返回,充其量只有无用的摘要</li> <li>模型看到的源材料而客户端从未见过的网页搜索</li> <li>只有原始提供者能够解密的压缩上下文</li> <li>子代理的指令和消息以加密载荷的形式隐藏在运行代理的应用程序之外</li> <li>文件、矢量存储、容器和缓存引用,这些引用在其他地方无法解析。</li> <li>响应和对话状态完全由存储在提供商服务器上的ID键控</li> </ul><p>每个功能都有一个简单的理由,服务商很容易提出,同时也有合理的理由说明这对用户有利。所有这些因素共同改变了人工智能会话的所有权现实:你机器上的文字记录不再是你的会话,而是部分会话视图,其运行状态属于推理提供者而非你。</p><p>我们并不支持这种方向,想谈谈它对你作为用户意味着什么,对我们这些在这个领域开发工具的人意味着什么。</p><h2>会话…</h2>
评论点赞收藏61 天前

Prompt Caching

Large language models are often thought of like functions: send in some text, receive some text. That is a useful abstraction, but it ignores one of the most important parts of running a coding agent:...
评论点赞收藏67 天前

A Reflection on our Announcement Today

Less than a year ago, in springtime Vienna, Armin and Colin met at Vogel Kaffee to write. We had landed on a name, Earendil. We didn't yet have a company or an office. We were at the beginning, and fe...
评论点赞收藏175 天前

Announcing Pi & Lefos

Earendil Inc. is a Public Benefit Corporation founded by Armin Ronacher and Colin Daymond Hanna in 2025. The purpose of Earendil is to strengthen the agency of humanity by crafting software and open p...
评论点赞收藏175 天前

The High Ground

Introduction This memo is an attempt to answer the question of where the "high ground" will be in software and computing outside of foundation model providers in the period 2026-2031. The backdrop bei...
评论点赞收藏230 天前

An Invitation to Begin a Correspondence

Hello, We believe in building in the open, sharing what we learn, what we craft, and where we're headed. If you're curious about software that strengthens human agency and bridges understanding, we'd ...
评论点赞收藏254 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。