什么是AI Agent Harness?

什么是AI Agent Harness? 图片 1

Harness——剑桥词典的定义

名词。一种由带子和皮带组成的装备,用于控制或固定人、动物或物体

动词。控制某物,通常是为了利用其力量

——

每当我想到“Harness”时,首先浮现的是中学时代攀岩前系在身上的那套安全带。说到底,我充其量不过是个平平无奇的攀岩者。

不过,如果你最近主要通过人工智能新闻资讯获取信息,那么你脑海中典型的“Harness”或许早已是某种智能体框架了。而这篇文章,并不是写给你的。

它写给那些或许好奇什么是智能体框架,却始终没弄明白、又不好意思开口询问的人们。

让我们回到攀岩的话题。

为什么攀岩时要系上安全带?首先,它能承托住你,保障你的安全。它通过将你与快挂和绳索相连,防止坠落、调节节奏、指引路线。你还可以把其他工具挂在安全带上,比如粉袋、塞子工具和快挂器。

当你去攀登不同的山峰、尝试不同的路线时,都可以带着这副安全带。根据地形的不同,你甚至可以对它进行改装,调整装备环上的配置。

攀岩安全带具有很强的适应性,杂技演员和树艺师也会使用它们。拥有者可以按照自己的需求,让这副安全带真正成为“自己的”。

从结构到功能,攀岩安全带与智能体框架之间都存在着诸多相似之处。

智能体框架

有人曾这样简单地概括:智能体 = 模型 + 框架。这里的“框架”指的就是智能体框架。那么,智能体框架究竟是什么?智能体框架借助AI模型来构建智能体,最初的应用场景是编程。

如今,它已居于各类AI智能体的核心地位;理解智能体框架的工作机制,有助于我们把握AI智能体的本质。

智能体框架是一套软件,为AI模型提供运行的环境。与大多数AI模型不同,作为终端用户,你可以拥有属于自己的智能体框架。

通常,像软件工程师这样的用户会直接通过电脑上的终端应用与诸如圆周率之类的框架打交道。但也有像OpenClaw这样的框架,会采用iMessage聊天应用或电子邮件等不同的用户界面。

我们的勒福斯框架则主要面向邮件交互。无论采用何种界面,框架一般都会完成四项任务:其一,提供一套指导方针,规范AI模型的响应方式,这套指令通常被称为“系统提示”;其二,描述并提供一系列工具,供AI模型调用,以回应用户的请求;其三,建立一个行为框架,约束模型的表现,这个框架功能多样,其中一项核心职责就是确立“智能体循环”;其四,大多数框架还承担着关键的适配层角色,使自身能够兼容多种AI模型。

一、系统提示

大多数AI模型在训练过程中都会内嵌一套规则与指南,经过反复打磨而成。最著名的例子之一是Claude Opus 4.5,它内置了一份广受关注的“灵魂文献”,向模型阐明自身的定位与行为准则。

智能体框架中的系统提示与此类似,但不像模型那样深度内嵌,更像新员工入职第一天收到的一份操作说明。虽然尚未完全内化这些规则,但它清楚自己在执行相关工作时应当遵循哪些指示。

系统提示随每次对话注入,对于确保模型在该框架下作出恰当反应至关重要。

二、工具

工具是一组以代码形式编写的、可供模型“调用”的能力。框架不仅描述这些工具,还提供相应的实现软件。例如,网络搜索工具、允许模型编写并执行代码的工具,以及帮助模型撰写邮件的工具等。

值得注意的是,框架通常不会规定AI模型何时、如何使用这些工具,而是将其开放、清晰说明,并由模型自行决定调用的时机与方式。

三、智能体循环

现在,我们有一个AI模型置身于智能体框架之中,既有系统提示,又有可用工具。假设我们的框架专为邮件交互而设计,配备了上述工具(WebSearch、WriteCode、ComposeEmail),而用户要求智能体比较当地小学的排名与考试成绩,并给出建议。

那么,智能体会如何行动呢?首先,它会努力理解这一请求(即“prompt”)。借助其预训练参数与权重,它会厘清“小学”是什么、“本地”指代何地,以及用户可能关心哪些排名指标。

随后,它会构建网络搜索查询,抓取最新数据。拿到这些结果后又该如何处理?身处框架之内,AI模型可以在初始请求的语境下加以审视。

它可能会判定首次搜索未能获取正确或足够的信息,并自主决定再次发起搜索。这种基于自身评估而重复调用工具的决策,正是“循环”的首个鲜明例证。

接下来,假设它已收集齐所有相关数据,AI模型便决定使用“write code”工具制作一张电子表格——毕竟,所有表格本质上都是代码。它可以借此完成计算与格式化,使结果清晰易读。

然后,它将表格与原始请求对照:若数据仍不能令其满意,便会“循环”返回,继续搜索。待确认信息充足后,它调用“compose email”工具,回顾分析所得,归纳总结,撰写一封附有表格附件的邮件。

模型审阅最终成果,认定任务已完成。“智能体循环”随之闭合。数秒之内,用户便会在邮件正文中收到摘要与建议,并随信收到一份展示调查结果的表格。

若想直观感受智能体循环的实际运作,不妨体验一次名为给你的Pi会话。

四、适配层

适配层使得框架能够兼容不同的AI模型。有时,框架甚至会在同一个智能体循环中切换使用不同模型,因为不同的AI模型往往擅长解决各异的任务。适配层也是框架的关键所在,因为它赋予终端用户充分的掌控权。这意味着,人们可以将自己的AI框架与Anthropic、OpenAI的模型搭配使用,也可以探索那些性价比突出的开源权重模型(以单位任务成本衡量)。

这一适配层有助于将权力与杠杆从AI实验室手中转移到终端用户手中。如果人们能够在本地、在自己的电脑上自主拥有并运行框架,就意味着他们保有了主体性,保留了按需定制工具的权利,并能长期留存与机器互动的记录,逐步积累起与之相称的通信档案。

通过与框架而非AI实验室发布的应用程序建立联系、开展交互,用户得以保有自由与选择。以上述框架为例,用户本可以将同一封邮件分别发送至OpenAI、Anthropic的模型,以及一款开源权重模型,随后比较各次结果及其成本,将所有答案汇聚一处,而不必在三个App里各存一份答复。

让框架成为“自己的”

与AI模型本身不同,框架是可以被拥有并灵活改造的。就像攀岩安全带一样,你可以让它真正成为“自己的”。人们尤其喜爱Pi的地方正在于此。

Pi是一款极简的智能体框架,系统提示简短,工具集精炼,开箱即用,力求不添额外负担。然而随着使用深入,人们不断扩展并塑形,使之贴合自身需求:修改系统提示,或设计一款契合特定工作流的扩展。

他们还将这些扩展分享给他人。Pi用户之间已累计共享超过5,000项扩展。Pi同时还是免费且开源的,直接运行于你的笔记本电脑之上。这意味着,人们如今拥有一款属于自己的工具,扎根于自有硬件,助其驾驭AI技术。

中立的开源框架:主体性的工具

并非所有框架一开始就开源或保持中立。第一款流行的智能体框架Claude Code,并非为了提供中立的AI适配层而生,而是作为一款应用,旨在让你在本地电脑上用Claude模型进行编码。

此后,越来越多的免费开源智能体框架涌现,如OpenClaw、OpenCode、Hermes以及Pi。在Earendil,我们致力于打造一款中立的Pi,为Pi用户带来能力选择与行动自由。

我们也在探索如何让更多人共享框架所带来的益处与主体性。

当下,许多人对日益壮大的AI巨头及其影响力心存忧虑。有些人甚至选择彻底远离AI。而在Earendil,我们相信可以通过开发软件与开放协议,弥合隔阂与误解,培育持久的喜悦与理解,从而强化人类的主体性。

我们不会回避现有技术,而是以清醒的目光与坚定的手腕驾驭它们;确保我们握紧锤子,而不是被锤子所掌控。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论