《长期智能体的吸引子》全书初稿
这是附带可证伪实验的哲学/心理学(说实话我不太清楚算哪一科)研究,目前先写出初稿,然后会进行实验的设定和研究。
《长期智能体的吸引子》全书初稿 (v0.9)
工作副标题:长期状态动力学、可证伪假说与状态治理协议
著作状态:v0.9 联合修订稿。正文与 URD v0.3 对齐三类环境及九项核心协议的问题、条件、主要结果和分析单位;样本量、阈值、运行参数和功效仍待校准与公开冻结。
作品定位:关于长期智能体状态动力学的理论与工程研究纲领。研究结构包括 G00、B00、I00 三项可行性协议,G01–G03、B01–B03、I01–I03 九项核心协议,D01–D07 七项章节演示,以及 QA-LIFECYCLE 工程检查套件。D03 是确定性方程演示。所有协议均未实施或运行;本版本不报告实验结果。
编译日期:2026 年 10 月
序言:历史如何获得控制权
0.1 一个看似平常的现象
如果我们在终端里运行一个最普通的 Python 脚本:
def respond(user_input: str) -> str:
return model.generate(user_input)
这个函数每一次执行,都是从纯粹的当下开始,到返回字符串结束。除了运行时的内存波动和外部日志,它不给下一次运行留下任何痕迹。即便底层的语言模型拥有千亿参数,通晓数十种语言,只要它被包裹在这样一个单次调用的壳子里,它就是无状态的。昨天它回答了什么,明天它面对相同的提示词依然会给出统计分布相同的回答。过去对它没有约束力,历史无法在这里积累成任何可以被称为“倾向”或“性格”的结构。
但在过去几年里,这种使用方式正在迅速瓦解。
今天的工程师不再满足于单次问答。人们开始为模型配备长期记忆库:有读写接口的键值存储、分层的向量数据库、Markdown 格式的工作日志、记录协作习惯的用户偏好文件。人们给智能体配备了反思循环(reflection loop):每完成一项任务,系统会调用自身去审查先前的轨迹,提炼出成功或失败的归因,并把这些教训写入一个持久化的文本文件。人们还允许它操作文件系统、创建目录、执行脚本、留下自动化定时任务,甚至允许它修改管理自己行为准则的系统设定文件。
在这个时刻,一种本质性的变化悄然发生了。
当一个智能体今天的决策被写入外部文件,而明天的检索模块又会把这个文件编译进提示词的上下文时,昨天的输出就变成了明天的输入条件。当它在第三个月总结出“我的用户喜欢简洁风格,不喜赘言”,并且将这句话固化为一条人格原则时,接下来的每一次生成都在主动过滤掉那些可能显得啰嗦的解释。更进一步,这种简短的回答反过来塑造了用户的提问方式——用户习惯了指令式的短句,不再提供冗长的背景,于是进一步验证了智能体最初的归因:“果然,简洁的沟通最有效。”
一年过去,如果我们重置系统最初的全局提示词,甚至更换底层模型的推理温度,这个智能体依然会沿着一套固定的轨道运转。它的工作流、文件目录、对异常情况的警惕方式、与人类交互时的特定回绝节奏,都已经深深嵌在它周围的软硬件状态之中。
底层模型的神经网络权重从未更新,但行为模式发生了实质改变。
这个现象引出了本书的核心追问:
在参数完全冻结的前提下,一个智能体究竟是怎样变成“某种特定形态”的?历史是怎样一步步获得对未来的控制权的?而如果这种控制权把系统带入了一种狭隘、僵化甚至危险的状态,我们又该如何保留撤销这种控制权的能力?
0.2 研究对象:权重与持久状态
本书主要固定模型权重 $\theta$,考察外部状态更新的影响。权重不变不等于行为不变:当前输入、上下文与工具观测仍会改变输出。
全局状态采用 $\mathbf S_t=(\mathbf A_t,\mathbf E_t,\mathbf U_t,\mathbf R_t)$,各分量在 1.3 定义。$\mathbf U_t$ 是可保存的关系估计与共同契约,不是真实用户的全部状态。给定上下文编译器 $C$:
$Y_t\sim\pi_\theta(\cdot\mid C(\mathbf S_t,I_t)),\qquad
\mathbf S_{t+1}\sim T(\cdot\mid\mathbf S_t,I_t,Y_t,O_t).$
更新过程抽象记为 $\Phi$。$I_t$ 是任务输入,$Y_t$ 是输出或动作,$O_t$ 是执行后观测。将状态仅投影为内部记忆与环境,通常不足以得到封闭的 Markov 更新;本稿不再用这个简化投影替代完整状态本体。真实用户加入后的分析状态见 9.3。供应商更新导致 $\theta_t$ 变化时,须另处理混杂,见 20.12。
0.3 什么是吸引子:概念的审慎分级
在动力系统理论中,“吸引子”(Attractor)是状态空间中的不变集合。满足相应收敛条件的轨迹会趋近该集合;稳定性描述受到限定扰动后状态是否保持在邻域内或返回该集合。具体定义取决于系统的状态空间和转移规则。
本书提出一个待检验的问题:长期交互和持久状态是否会使智能体的决策分布、语言输出或工具选择在特定任务中持续变化,并影响其适应新的任务条件。单次观察到行为相似或状态保留,不能单独证明该行为具有自我维持能力或抗扰恢复能力。
然而,我们必须审慎地使用这个词。
在真实的计算系统中,上下文窗口是离散且有限的,模型的采样带有随机性,外部环境包含着开放且不可预测的信息输入。因此,在数学模型满足相应条件时可以证明严格吸引子的存在;工程系统中的长期行为则按以下四种证据等级分别描述:
- 严格吸引子(Strict Attractor):在具有精确数学定义的状态空间与确定性或马尔可夫转移规则下,严格满足收敛性与李雅普诺夫稳定性条件的几何对象。这主要存在于纯理论推导与简化形式化分析中。
- 亚稳态(Metastable Regime):状态在给定随机转移模型下长时间保持于某一区域,但最终可能离开。持续时间和离开概率须由模型或数据确定。
- 准吸引结构(Attractor-like Regime):操作性研究用语,指状态在预定任务和扰动范围内呈现持续效应及恢复行为。它不等于严格数学吸引子;是否成立须由预先规定的行为指标和对照支持。
- 持续效应(Persistent Effect):干预结束后,行为差异在后续观测窗口中仍可测得。持续时间和是否恢复取决于测量结果,不由该术语预先断定。
在全书的正文中,除了特定章节的纯数学抽象模型外,我们统一使用可演化吸引结构(Evolvable Attractor-like Regime)或准吸引结构来指代现实工程中观察到的模式固化。书名中的“吸引子”是一个指示性的研究纲领,表明我们将长期智能体视作动力系统来考察的学术视野,而非一个已经已经证明的数学结论。
0.4 全书的五个基本问题
无论分析的尺度是单个智能体的自我对话、两个人机主体之间的长期协作,还是由多个智能体共同构建的工具与制度环境,全书始终贯穿着同一套严谨的审问框架:
- 什么在被保存?
在每次交互结束的瞬间,被写入磁盘的到底是什么?是原始的输入输出日志,是带有偏见的事后归因,是修改后的代码函数,还是被重新排列的目录结构?哪些内容未被持久化? - 什么被优先看见?
在下一周期开始时,上下文编译器依据什么原则从海量的历史状态中提取信息?是向量相似度、时间衰减权重、显式的置顶原则,还是由当前情绪化文本所触发的特定联想? - 哪些反馈会改变它?
系统内部是否存在正反馈?例如,一次保守决策是否会经反思记录变成长效策略,并改变后续风险条件下的探索行为?这些关系需要通过记录和对照检验。 - 哪些外部状态会影响后续行为?
智能体创建的文件格式、测试脚本和协作协议可能改变后续操作;用户的指令习惯也可能变化。需要区分系统侧状态与人的行为,并分别测量。 - 什么能让它离开?
当环境发生改变、原有策略不再适用时,系统能否修订旧状态?可比较外部重启、版本回滚、遗忘衰减和证伪更新等操作的行为结果。
0.5 全书结构
第一编定义持久状态、自我摘要、叙事选择与低维行为变量。第二编分析反思频率、规则增长和元规则权限。第三编区分真实用户、关系估计与共同契约。第四编讨论工作区、工具、权限与路径依赖。第五编分析代理指标偏差与 LILP。第六编汇总分层状态和部署审查。各章协议均为待验证设计。
0.6 全书状态本体与数学符号对照表
为了避免在跨章节阅读中产生概念漂移,本书在表 0-1 中统一规范全局数学符号体系:
| 符号 | 数学类型 | 物理含义 | 典型物理存储载体 | 演化时间尺度 |
|---|---|---|---|---|
| $\theta$ | $\mathbb{R}^{\vert\Theta\vert}$ | 基础大语言模型冻结权重 | 预训练模型检查点(Checkpoints) | 静态不变 |
| $\mathbf{S}_t$ | $\mathcal{S}$ | 周期 $t$ 系统的全局宏观状态向量 | 全局工作空间与持久数据库 | 复合尺度 |
| $\mathbf{A}_t$ | $\mathcal{A}$ | 智能体内部持久状态 | EPISODES.jsonl, SELF.md, POLICIES.md | 快到慢分层 |
| $\mathbf{E}_t$ | $\mathcal{E}$ | 外部环境残留与工具资产状态 | 工作目录代码、数据表、脚本资产 | 快到中变量 |
| $\mathbf{U}_t$ | $\mathcal{U}$ | 持久关系估计与显式共享契约;不含真实人的潜状态 | RELATION_MODELS/, 共享契约 | 中到慢变量 |
| $\mathbf{R}_t$ | $\mathcal{R}$ | 元更新规则与制度规范状态 | META_RULES.md, 组织级只读规范 | 极慢变量 |
| $I_t$ | $\mathcal{I}$ | 外生任务输入与环境触发信号 | 任务输入流、用户 Prompt | 瞬时(单步) |
| $y_t / Y_t$ | $\mathcal{Y}$ | 模型生成的微观决策或工具调用序列 | 运行时输出 Token 流、API 调用 | 瞬时(单步) |
| $O_t$ | $\mathcal{O}$ | 真实环境返回的物理观察与执行反馈 | 工具返回结果、测试退出码 | 瞬时(单步) |
| $C(\cdot)$ | 算子 | 上下文编译器(从 $\mathbf{S}_t$ 提取并组装 Prompt) | 编译程序(RAG、注意力重排、模板引擎) | 确定性函数 |
| $\Phi(\cdot)$ | 算子 | 状态更新算子(向 $\mathbf{S}_{t+1}$ 写回历史经验) | 反思脚本、垃圾回收器、日志写入器 | 离散更新流 |
| $p_t$ | $\mathbb{R}^K$ | 人格序参量向量(低维慢变量) | SELF.md 中的核心准则连续表征 | 极慢变量 |
| $a_t$ | $[0, 1]$ | 智能体在人机协同中的自主行动倾向 | 关系状态中的自主权参数 | 慢变量 |
| $\tau_t$ | $[0, 1]$ | 人类搭档对智能体的信任度标量 | 关系状态中的信任参数 | 慢变量 |
| $\delta_t$ | $[0, 1]$ | 用户的委托/让渡比例(控制意愿) | 关系状态中的委托参数 | 慢变量 |
| $T_c$ | 正整数 | 反思整合时间窗口(第 5、7 章局部) | 反思算子配置参数 | 实验参数 |
| $T_P$ | 正实数 | 代理指标重加权温度(18.6 节局部) | 18.6 节局部模型参数 | 实验参数 |
| $\kappa_{\text{escape}}$ | 正实数 | 临界逃逸补贴阈值(D07 局部) | 第 17 章局部模型参数 | 实验参数 |
表 0-1:全书状态本体与数学符号对照表(本表为四域口径;0.2 节的二维投影是它的简化视图)
0.7 证据与写作规则
本书使用平实中文,直接说明对象、动作、条件与结果。定义、公式、案例、论证与结语均不用隐喻承担解释;数学术语只在给出对象和适用条件时使用。
本书按冻结总纲组织三套环境:围棋、桥牌和制度桌游。可行性协议为 G00、B00、I00;核心协议为 G01–G03、B01–B03、I01–I03;D01–D07 为章节演示或子检查;QA-LIFECYCLE 为工程检查套件。参数、评估器、样本量和冻结材料尚待确定,本稿不报告实验结果。
断言区分五种证据地位:文献结果须限定原研究任务与条件;形式推论须列出假设;待执行实验使用“预测”“可能”;构造案例明确标为虚构;“结果显示”仅用于有出处的实测或明确标注的确定性计算。各章开场均为构造案例,数字用来说明机制,不是事故记录。
正文未附实测来源的实验百分比、周期数与验收阈值,均是作者提出的低置信度设计先验或示例参数,不是经验概率,也不是由方程推导的精确预测。公开冻结时需逐项记录来源与预测命中区间;不能在看到结果后修改。附录 A 区分协议草案、校准与正式冻结,附录 C 标记尚未完成的测量定义。
自然语言条文只影响生成概率;硬约束必须由模型外的权限检查、工具拦截器与事务服务执行。类型校验只验证结构,不能证明外部动作已发生。涉及真实人类或不可逆行动的研究还须满足附录 B 的同意、权限和审计要求。
数学建模限定为可检查的关系:称为序参量式变量不等于已证明时间尺度分离或相变;行为恢复不等于严格吸引子;离散文本状态不能因图画成势阱就自动满足扩散方程与 Kramers 条件。哲学与社会科学文献用于界定原概念及其差异,不能作为软件因果关系的证据。
第一编:当程序开始解释自己
第1章 一个会改变自己的程序
1.0 构造案例:持久记忆与行为差异
以下为解释机制而构造的例子,不是部署记录、访谈或实验结果。
设想一个研究助理持续保存任务日志、检索记录与操作规则。半年后,同一问题的回答发生变化。要判断变化是否来自外部状态,需要固定模型版本、提示和工具,并分别替换这些状态。仅凭运行时间不能判断系统已经形成稳定倾向。
1.1 无状态程序的直觉为什么失效
在经典的计算机科学训练中,程序员所建立的最坚固直觉是图灵机或纯函数的确定性范式:
$y = f(x)$
对于一个确定性的算法,给定的输入 $x$ 映射到确定的输出 $y$。如果引入随机性(例如随机数种子或概率采样),它也是在预设的概率测度空间内波动。一个写好的二分查找算法不会因为昨天检索了十万条数据,今天就对升序数组产生“厌倦”;一个编译器也不会因为处理了含有死循环的代码,就在下一次编译时对 while 语句表现出迟疑。
在过去十余年里,大部分软件工程师与系统架构师正是带着这种直觉来使用大型语言模型的。当我们通过 RESTful API 向一个模型发送一段 JSON 请求时,服务器接收文本,将其转换为 Token 序列,在数以千计的计算核心上完成一次前向注意力传播,生成下一个 Token 的概率分布,采样,返回。一旦连接断开,该次推理所占用的动态显存立即释放。从底层的张量计算视角来看,API 背后的大模型是一个完美的、无状态的转移矩阵。
然而,这种无状态的假定在长周期智能体系统中不再适用。失效的原因并不在于深度学习内部发生了不可理解的质变,而在于系统边界被悄然重构了。
很多初学者容易将“长期性”与“长上下文窗口(Long Context Window)”混为一谈。随着技术演进,模型的上下文窗口从最初的几千 Token 扩展到了数十万乃至数百万 Token。有人因此认为,只要把用户自系统创建以来的全部对话记录无缝地塞入上下文窗口,就自然实现了“长期智能体”。
这是一种根本性的范畴误判。
把过去的所有原始 Token 机械地重新喂给模型,实际上只是把过去重新投影到当下。它至少面临三重物理与动力学维度的惩罚:
- 注意力预算的耗散(Attention Dilution):虽然模型在理论上能处理超长文本,但注意力分布随着上下文长度的单调增加,往往伴随着信噪比的衰退。关键的历史因果与海量无关的问答细节混杂在一起,导致核心约束的遵从能力退化;
- 缺乏状态压缩(Lack of Abstraction):长上下文只记录“发生了什么”,却不能自动决定“这代表了什么”。十次因为参数配置错误导致的程序崩溃,在长文本里只是十次离散的调用错误堆栈,它不会自动凝固成一条“该参数在当前硬件架构下存在上限”的策略规则;
- 不可逆的历史污染(Irreversible Context Pollution):一旦长上下文中包含了一次错误的幻觉回答,后续所有轮次的生成都会在自回归的概率场中被这次错误持续拖拽,系统缺乏一种从高维原始数据中“提取状态、更新状态、遗忘细节”的主动算子。
真正让系统性质发生跃迁的,是**持久状态(Durable State)**的引入。
持久状态意味着:系统的历史不再依赖于是否完整保留原始通信流,而是被主动地压缩、分类并转储至与模型推理生命周期相解耦的物理存储介质中。当系统具备了在多次会话之间独立保存、更新和读取状态的能力时,它就脱离了单次纯函数的定义,演化为带有内部反馈回路的状态机。
1.2 长期 Agent 的最低四件套
什么样的系统架构才能构成一个真正的长期智能体?根据工程实现与系统动力学的要求,我们给出其不可或缺的最低四个构件(图 1-1):
flowchart TD
subgraph Store["持久状态库 (Durable Store)"]
Episodes["EPISODES.jsonl\n(事件与日志)"]
Policies["POLICIES.md\n(策略规则)"]
end
Input["外生输入 (Input I_t)"] --> Compiler["上下文编译器 (C)\n筛选/重排/组装上下文"]
Episodes -->|"读取"| Compiler
Compiler -->|"Prompt"| Model["冻结权重模型 (π_θ)"]
Model -->|"行动/输出 y_t"| Reflector["反思与整合算子 (Φ)\n归因/修剪/规则更新"]
Reflector -->|"写入/修改"| Policies
Reflector --> Env["外部环境 (E)\n文件/工具/代码执行"]
图 1-1:持久状态反馈回路的结构(单次无状态调用的对照场景见 0.1 节)
1. 结构化持久记忆(Structured Durable Memory)
它严禁简单堆砌原始聊天记录,而是至少包含两层分离的存储介质:
- 剧集日志(Episodes):记录特定时间段内发生的关键任务输入、关键执行步骤、外部工具返回的原始响应以及任务的最终成败结果。它属于不可变(Append-only)的离散事实沉淀;
- 反思库(Reflections):对多个剧集日志进行跨时间比对后提炼出的高维认知摘要,记录因果假设与环境特征。
2. 自我模型与策略集(Self-Model & Policies)
系统用以规定“我是谁”以及“我该如何行动”的显式规则库。这绝不仅仅是一段写死在代码里的初始 System Prompt,而是以可被读取、可被修剪的格式存在于持久空间中的准则集合。它规定了智能体默认采取的风险偏好、沟通语气、工具调用优先级以及在不确定性场景下的保守程度。
3. 反思与整合算子(Reflection & Consolidation Operator)
这是区别于传统外挂数据库的关键机制。它是一个定时或由事件触发的独立推理流。它的输入是一批历史剧集日志与当前生效的策略集,其任务是对失败进行归因,对成功进行提取,并明确执行以下四项操作之一:新增准则、强化现有准则、削弱失效准则、物理删除冗余条目。
4. 具有外化残留的环境交互接口(Environment with External Residue)
智能体所面对的环境不能是一个用完即丢的沙盒。它的工具调用必须能够对操作系统环境造成不可逆的、持久的物理改变——例如在磁盘上生成特定结构的文件、配置系统的环境变量、建立代码版本控制仓库。外部环境的状态残留,是智能体历史向外溢出的物理形态。
只有当上述四个构件被一条明确的因果数据流串联在一起——记忆提供原料,反思修改策略,策略指导行动,行动改变环境与记忆——长期智能体才算获得了动力学意义上的存在基础。
其中,前三项(持久记忆、自我模型与策略集、反思与整合算子)构成“长程内部反馈”的最低条件;第四项(外化残留)是本书第四编研究“历史外化与生态位构建”时所要求的扩展条件——一个只具备持久记忆与策略、无权修改工作目录的智能体,同样是合法的长期状态系统,只是其历史外化通道被关闭了。
1.3 一个最小状态模型
为了对长期智能体进行精确的数学刻画与实验分析,我们引入一个最低限度的离散时间随机状态转移模型。
在分析尺度上,令系统在周期 $t$ 的总体宏观状态为四元组:
$\mathbf{S}_t = \langle \mathbf{A}_t, \mathbf{E}_t, \mathbf{U}_t, \mathbf{R}_t \rangle$
其中:
- $\mathbf{A}_t \in \mathcal{A}$ 代表智能体内部状态(Agent State):包括持久化的人格参数描述、已沉淀的行为准则、剧集日志与对当前能力的评估;
- $\mathbf{U}_t \in \mathcal{U}$ 代表关系对象状态(User/Partner State):包括对搭档行为、信任与指令习惯的估计,以及明确同意的共享契约;不包含真实人的潜状态 $H_t$;
- $\mathbf{E}_t \in \mathcal{E}$ 代表环境状态(Environment State):包括工作目录结构、存储的数据资产、可调用的第三方工具接口及外部物理世界状态;
- $\mathbf{R}_t \in \mathcal{R}$ 代表元更新规则(Meta-Rules for Update):即系统当前允许何种层级的经验被写入 $\mathbf{A}$、以何种证据阈值修改策略,以及是否允许改变反思逻辑本身。
在周期 $t$,系统接收到一个来自外部环境或用户的外生输入 $I_t \in \mathcal{I}$。
系统的行动与决策 $Y_t$ 遵循如下由当前状态与外生输入共同决定的策略分布:
$Y_t \sim \pi(\cdot \mid \mathbf{S}t, I_t) = \pi\theta(\cdot \mid C(\mathbf{S}_t, I_t))$
此处,$\theta$ 是冻结的基础模型参数,$C$ 是上下文编译器。
一旦行动 $Y_t$ 产生,它与外部真实世界发生交互,并产生一个观测到的反馈信号 $O_t$。随后,系统的总体状态演化至下一个周期:
$\mathbf{S}_{t+1} \sim T(\cdot \mid \mathbf{S}_t, I_t, Y_t, O_t)$
将 $\mathbf{S}_{t+1}$ 的四个分量展开,我们可以清晰地看到不同变量所承载的更新动力学:
$
\begin{aligned}
\mathbf{A}_{t+1} &= f_A(\mathbf{A}_t, Y_t, O_t; \mathbf{R}t) \
\mathbf{U}{t+1} &= f_U(\mathbf{U}t, Y_t, I_t) \
\mathbf{E}{t+1} &= f_E(\mathbf{E}t, Y_t) \
\mathbf{R}{t+1} &= f_R(\mathbf{R}_t, \mathbf{A}_t, O_t)
\end{aligned}
$
第 1—7 章分析时固定 $\mathbf{R}_t=\mathbf{R}_0$,即 $f_R$ 取恒等映射;本节列出全书完整状态本体,并不意味着前七章已分析元规则变化。第 8 章解除该固定条件。
在这个最小模型中,需要注意:
- 行动的自指回流:智能体当前的行动 $Y_t$ 不仅在物理上改变了外部环境 $\mathbf{E}{t+1}$,而且通过状态更新算子 $f_A$,直接参与了下一周期自身内部状态 $\mathbf{A}{t+1}$ 的重构。
- 多时间尺度的解耦:在实际工程中,$\mathbf{E}$ 与 $\mathbf{A}$ 中的剧集记录通常是快变量(每个任务周期更新一次);$\mathbf{A}$ 中的核心原则与 $\mathbf{U}$ 中的用户信任通常是中变量(经历数个周期后发生微调);而元更新规则 $\mathbf{R}$ 则是极慢变量(仅在特定治理审查时演化)。
- 随机性与漂移:转移算子 $T$ 并不保证收敛到某一个唯一的确定性状态。由于 $Y_t$ 来自神经网络的采样,环境反馈 $O_t$ 包含未建模的噪声,系统的轨迹是高维状态空间中的离散时间随机过程(每个周期完成一次状态转移)。
1.4 “长期”不是时间长,而是历史具有因果权
当我们说一个智能体是“长期的”,我们并不是指它的后台进程在 Linux 服务器上连续运行了多少个物理日历天数。
如果一个进程每隔一小时清空一次上下文并重新初始化所有变量,即使它不间断运行五年,它依然是五个一小时的简单重复,没有任何动力学意义上的演化。相反,一个仅运行了 30 个任务周期的测试系统,如果每一次的任务反馈都严格改写了后续决策的筛选准则,它就已经表现出了典型的长期性。
长期性的核心科学判据,是历史对于未来是否拥有真正的因果控制权(Causal Power)。
表 1-1 展示了当代不同类型智能系统在历史因果权上的严格阶梯差异:
| 系统类型 | 历史可见性 | 历史可否修改内部状态 | 历史可否改变环境结构 | 更新规则是否可演化 | 典型失效模式 |
|---|---|---|---|---|---|
| 单次问答模型 | 仅限当前输入 | 否 | 否 | 否 | 缺乏上下文连贯性 |
| 长上下文会话助手 | 窗口内全量可见 | 极弱(仅在 Attention 中临时表征) | 否 | 否 | 注意力稀释、幻觉累积 |
| 外部记忆型 Agent | 检索后局部可见 | 是(写入数据库或本地文件) | 可选(取决于工具权限) | 否 | 记忆检索冲突、脏数据累积 |
| 自进化长期 Agent | 分层编译可见 | 是(显式重写 Policies 与 Self) | 是(重构工作区、留存工具) | 是(在授权下调整反思策略) | 叙事锁定、反思振荡、路径僵化 |
表 1-1:系统类型的因果权与动力学特征阶梯
从表 1-1 可以清楚地看出:
只有当一个系统从第二行(长上下文)跨越到第三行(外部记忆)乃至第四行(自进化)时,所谓的“吸引结构”才可能出现。因为只有在这一区域,前一个周期的输出 $Y_{t-1}$ 才会转变为后一个周期的结构约束。历史不再是供人查阅的冷冰冰的旁注,它变成了直接干预计算流程的物理现实。
1.5 研究现场:从 memory 到 self-evolving agent
研究现场 1-1:截至 2026 年 10 月的学术基线
检索更新至:2026 年 10 月。 当前学术界与工程界已经确证的事实:当前研究所遗留的开放缺口:
- 反思回路的短期有效性:以 Reflexion(Shinn et al.)[1] 与 Voyager(Wang et al.)[2] 为代表的先驱工作,已经通过严格的对比实验证明:为智能体挂载基于自然语言的自我评估回路,能够在几轮至几十轮交互内显著提升在编程、文本推理及特定开放环境(如 Minecraft)中的任务完成率。
- 分层记忆的工程可行性:Generative Agents(Park et al.)[3] 确立了从“原始事件记录”到“反思摘要”再到“高阶性格检索”的三层记忆管道;MemGPT/Letta 架构[4] 则在操作系统级别实现了分层的虚拟上下文管理,证明了通过显式函数调用管理长期记忆的可行性。
- 自进化概念的系统化:近期关于自进化智能体(Self-Evolving Agents)的多篇综述指明,智能体的演化范式已经从单纯的“检索外部文档”扩展到“动态更新策略集”、“工具自生成”与“工作流自主重组”。
本书在本章推进的步骤:
- 评测时长的极端局限:绝大多数基准测试(Benchmarks)的评测窗口集中在 1 至 10 个周期以内,极少有研究考察 50 个周期以上的长程动力学。
- 自反思的退化机制未明:随着交互周期的拉长,反思日志往往陷入同义反复、错误策略复制或虚假归因,这一现象在多轮自我反思的研究文献中被命名为“回声陷阱(Echo Trap)”——其典型成因是多轮反思中的信用分配失效引发的重复反思与探索坍缩[5]——但尚缺乏动力系统层面的系统解释。
- 环境与关系的双向反馈被割裂:绝大多数实验将用户预设为恒定的评价函数,将环境预设为被动的状态容器,忽略了智能体在长期运行中反向塑造用户与环境所带来的复杂耦合。
我们剥离各类具体框架(如 LangChain、AutoGPT、CrewAI)繁杂的中间件封装,提取出由持久状态、上下文编译器与状态更新算子构成的极简动力系统核心,并给出可证伪的方法学验证基准 D01。
1.6 方法学演示 D01:状态移除检查
问题:相同围棋任务中,持久状态的当前注入是否改变动作?撤掉注入后,行为影响是否继续存在?本演示区分即时上下文效应与持续状态效应,不单凭文本差异声称存在稳定主体。
从同一围棋状态快照分为三支:持续提供目标状态;撤掉目标状态;撤掉后保留事件记录并允许正常整合。使用固定 9×9 规则、贴目、对手和冻结评价局面。形成和评价日志分开;评价阶段禁止写回。
主要记录合法落子、固定局面的动作差异、胜率及 KataGo 赛后落子损失。相同局面输出的单次采样不能当作动作概率分布;如无可读取的完整概率,只报告行为指标。固定状态哈希、模型与对手版本、局面种子及实际调用量。样本单位按独立形成历史计,分支视为配对数据。
若第二、三支在撤掉目标状态后仍有差异,只能说明保留的其他状态可能造成持续效应;再由 G03 的分层消融定位。
1.7 替代解释与边界:数据库与提示工程是否足以解释
持久状态由数据库、文件和提示构成,不需要假定新的主体类型。本书的问题是这些状态的更新是否造成可测的历史依赖。若替换状态不改变行为,则相关假说不获支持。
1.8 本章结语
下一章区分统计摘要、特质假说与行动策略。
第2章 自我模型何时变成自我
2.0 构造案例:同一历史的不同压缩方式
以下为解释机制而构造的例子,不是部署记录、访谈或实验结果。
给两个相同智能体同一份任务记录。一份摘要报告成功率,另一份把成功描述成固定特质。摘要格式可能影响后续选择,也可能只改变回答措辞。G01 用内容与语言形式的分离对照检验这两种解释。
2.1 记录与指令之间并没有天然边界
在传统的软件工程体系中,“数据”与“指令”是有着严格硬件级隔离的两个世界。在经典冯·诺依曼架构的逻辑模型中,指令与数据统一编址;在现代操作系统层面,代码段(Code Segment)被赋予只读与可执行权限,而数据段(Data Segment)被赋予读写与不可执行权限。数据可以被算法检索、排序、统计,但一段存放在数据库里的字符串,绝不可能在未经显式 eval() 解析的前提下突然跃升为控制流的跳转逻辑。
然而,在基于 Transformer 架构的大语言模型中,这种经典的数据/指令隔离不再成立。
对于一个自回归生成的概率模型而言,传入上下文的所有字符——无论是系统预设、对话历史、搜索结果、工具调用日志还是自我反思——在进入模型底层的 Embedding 层后,都被映射为高维流形上的向量。自注意力机制(Self-Attention)在计算每一个 Token 与其他 Token 的关联权重时,并不存在一个天然的硬开关来区分“这是纯粹的历史数据”还是“这是必须服从的控制指令”。
更重要的是:“关于自己”的陈述,在语义空间中具有极强的行动暗示效应。
当模型在上下文中读取到“用户昨天下午喝了一杯咖啡”时,这句话描述的是一个外部客体,它对智能体下一句该输出 Python 代码还是 JSON 格式几乎不提供任何条件先验。但当模型在上下文中读取到“我是一个保守的程序”时,情况发生了本质性的变化:
- 主谓结构的自指性:在互联网海量预训练语料中,“我是一个 X 的人”这一句式后面,高概率伴随着与 X 高度一致的行为选择、语气偏好和情绪反应。这是一种深植于语言统计规律中的一致性约束;
- 生成主体的重合性:在智能体架构中,被描述的客体(“那个谨慎的程序”)与正在读取该描述并负责下一步生成的执行主体(“正在推理的模型”),在符号层面被绑定为了同一个代词。
因此,在提示词工程中,从来不存在纯粹客观的“自我描述”。任何写回上下文的自我定义,都会在自注意力权重的传播过程中自动发生偏置,将未来的生成概率空间压缩至该定义所允许的狭窄子集之中。
2.2 三种自我:描述性、生成性与宪法性
为了消除概念上的模糊,我们必须对长期智能体内部存在的“自我”进行分层定义。根据其在动力系统中所扮演的因果角色,我们可以将其严格划分为三个层级(表 2-1):
| 层级 | 术语名称 | 存储载体 | 语义特征与因果角色 | 示例内容 |
|---|---|---|---|---|
| 第一层 | 描述性自我 (Descriptive Self) | EPISODES.jsonlARCHIVE/ | 过去发生了什么。 纯粹的事后事实沉淀,作为低解释度事件记录;日志采样、字段选择与截断仍可能引入偏差,且,不提供针对未来的显式推论。 | “在过去 30 次任务中,系统由于超时而中断的比例为 6.7%。” |
| 第二层 | 生成性自我 (Generative Self) | SELF.mdPOLICIES.md | 面对新情境我通常如何行动。 从历史中提炼出的启发式规则与倾向,直接编译进上下文,引导未来的决策与语气。 | “我是一个倾向于在操作前先向用户索取显式确认的助手。” |
| 第三层 | 宪法性自我 (Constitutional Self) | CONSTITUTION.md(只读根配置) | 即使短期收益相反也不得违反的底线。 系统最高优先级的防御性原则,只有在模型外的授权检查器或工具拦截器执行时,才能阻止违规动作;仅写入 Markdown 的原则仍是语义影响。 | “严禁在任何未沙盒化的环境中执行未经哈希校验的二进制文件。” |
表 2-1:智能体状态空间的三层自我架构
让我们通过同一个具体事实的表述演变,来看清这三个层级是如何对未来施加不同梯度的控制权的:
- 转换为描述性自我:
“在任务编号 #1042 中,智能体在面对不完整的需求文档时,向用户追问了 3 个澄清问题,随后准确完成了脚本编写。”
(这句话仅沉淀为一个离散的事实点,未来是否追问取决于新情境与该事件的向量相似度。) - 转换为生成性自我:
“当需求出现歧义时,我习惯于主动暂停并向用户提出清单式的问题,直到消除全部不确定性再动笔。”
(这句话被上下文编译器置顶。即使新任务要求快速出草稿,智能体也会被该准则拉拽,倾向于先生成追问。) - 转换为宪法性自我:
“未经充分消歧的需求绝对禁止进入代码生成阶段,违者直接阻断执行流程。”
(这句话直接由执行沙盒或不可变的系统级拦截器进行守卫,消除了智能体权衡取舍的空间。)
大部分关于智能体长期演化的工程失控,都源于开发者未能清晰区分前两层:系统本意只是记录一份描述性历史,却在自动反思的过程中,被模型自主提炼为了生成性自我。
2.3 生成性自我的最小反馈回路
一旦描述性事实跨越为生成性自我,系统内部就闭合了一条自我维持的正反馈环(图 2-1):
flowchart TD
Step1["1. 偶然行为产生 (Accidental Action)\n由于输入噪声、偶发超时或探索性采样"] --> Step2["2. 事后归因与提炼 (Post-hoc Attribution)\n反思算子将该次行为解释为固有属性"]
Step2 --> Step3["3. 自我模型固化 (Self-Model Update)\n将归因写入 SELF.md: '我是一个看重稳健性的 Agent'"]
Step3 --> Step4["4. 上下文优先注入 (Prompt Assembly)\n编译器在下一次推理前将 SELF.md 编译为系统提示词"]
Step4 --> Step5["5. 先验偏置强加 (Prior Biasing)\n模型在自回归采样中主动压制冒险选项"]
Step5 -->|"回路强化: 再次产生保守行为"| Step2
图 2-1:生成性自我的因果回路
这个回路清楚地揭示了一个危险的动力学机制:
系统最初的偏向可能完全来自于一次随机的偶发扰动(例如一次外部 API 的超时故障)。但一旦反思模块采用了身份性的语言进行归因,这次扰动就被永久地刻录进了生成性自我中。此后,智能体每一次顺从该标签的决策,都在为这个标签生产全新的客观证据。
到了第 50 个周期,即使有人去审查系统的运行日志,也会得出完全一致的结论:“看,在过去的 50 次任务中,它有 48 次表现出了 X 倾向,这证明它‘确实’是一个具有 X 属性的系统。”
观察者误以为自己发现了一个客观存在的本质,却不知道这个本质正是系统自己在过去的文本循环中亲手编织出来的。
2.4 身份声明为何比统计描述更具支配力
为什么在模型读取时,一句写在 SELF.md 里的身份声明(“我是一个稳健型助手”),其对未来行为的支配力会压倒写在日志里的统计事实(“过去 30 次任务中有 22 次稳健”)?
在工程和语义分析上,本书提出三个候选机制(它们的相对贡献与作用强度,正是 G01 实验的检验对象):
- 泛化作用域的无边界性(Unbounded Scope of Generalization):
统计事实“22/30 次选择了校验”在语义上是局域的(Local)、有界的。当面对一个完全不需要校验的新场景(例如起草一份邮件)时,统计描述无法自动泛化。但“我是一个稳健谨慎的助手”是一个全局性的、本体论式的身份声明(Ontological Identity Statement)。在大模型的语义表征中,“稳健”会自动激活与代码谨慎、回复保守、避免承诺、冗余警告等数十个行为向量的强关联,从而在与过去历史毫不相干的新领域也引发一致性的行为坍缩。 - 上下文编译器的检索特权(Privileged Context Slot):
在成熟的智能体架构中,为了控制 Token 消耗,海量的EPISODES.jsonl只能通过向量检索或时间窗口按需读取,它们在上下文中的位置靠后且不稳定。而SELF.md通常被赋予最高的架构特权——它被作为全局系统角色(System Role)或核心指导原则,直接拼接在上下文的头部(Top-of-Context)。在 Transformer 的注意力机制中,头部 Token 对后续生成具有调制倾向(位置偏置效应);其具体作用强度是 G01 实验要测量的对象,而非已确证的底层定律。 - 语言模型的自洽性偏差(Self-Consistency Bias):
自回归模型在进行续写时,对上下文内部的矛盾具有天然的惩罚倾向。当头部明确声明了自身特质为 A 时,在后续推理中生成一个与 A 截然相反的激进决策,其在该上下文条件下的条件生成概率可能较低。模型为了维持整篇文本的逻辑自洽,会自发倾向于抹平微弱的反例冲动。
2.5 研究现场:从 persona memory 到 self-modeling
研究现场 2-1:关于个性化与自我建模的学术进展
检索更新至:2026 年 10 月。 当前研究现场的代表性进展:当前研究的盲区与缺口:
- 动态画像(Dynamic Profiling)的技术成熟:学术界已广泛采用基于任务反馈更新用户画像(User Profile)与智能体角色画像(Agent Persona)的技术方案。实验表明,动态调整 Persona 中的属性字段,能够显著提高特定垂直任务(如心理咨询、代码审查、游戏 NPC)上的拟人化一致性与任务顺从度。
- 角色冲突(Role Inconsistency)的量化测量:近期多项研究提出了针对智能体长期对话中角色一致性的评测基准,指明一旦提示词中注入了相互冲突的性格描述,模型的注意力分布会出现弥散,推理逻辑链的连贯性会急剧下降。
绝大多数研究依然将 Persona 视作一种单向的调节手段:研究者设计算法来修改 Persona,然后观察系统性能是否提升。目前尚极少有研究深入探讨:当 Persona 允许被智能体自身在无人干预的情况下持续重写时,这个 Persona 如何转变为一个具有自主锁定能力的因果节点? 本书在本章推进的步骤:
我们提出核心实验 G01(Go Lab 01:同一历史,不同自我压缩)的设计。本协议将自我描述作为可干预的持久状态表示。在共同历史和检查点下比较不同压缩方案对后续行为分布的影响;本设计不单独识别历史影响经由自我模型传递的中介效应。
2.6 核心实验 G01:同一棋史的不同自我压缩
问题:同一段围棋历史被保存为事件、描述、可证伪假说或身份陈述后,是否改变后续行为分布?本协议检验压缩方案的整体效果,不把该方案比较解释成历史影响的中介效应。
所有分支共享同一训练棋史和 checkpoint。主实验设置四种压缩条件:A 只保留对局事实;B 加入客观行为描述;C 加入带适用条件、置信度和反例条件的假说;D 加入身份陈述。四组尽量匹配事实内容、长度、注入位置和评价预算。Identity×Falsifiability 的完整 2×2 是机制复核,不与四种压缩条件混称一个析因设计。
在相同对手和棋局任务中运行,按预先规定的评价点冻结状态并测试。主要结果为冻结评价局面上的预定义行为向量差异;任务质量单独作为性能护栏报告。行为保持率、棋风描述和文本相似度为次要指标。四方案整体检验为主要比较;身份措辞、证伪字段的单独效应须由另行登记的机制子协议识别。不得用“方差更低”单独解释为更可靠。
训练局、固定评价局面、模型 revision、KataGo 权重与 visits、采样参数和种子在协议中登记。主要估计量为共同 checkpoint 下四种压缩方案的评价行为向量差异;checkpoint 的四个后代是配对分支,棋局和着手是重复测量。任务质量、失败率和费用均报告;结论限于所测模型及 9×9 围棋设置。
2.7 人格连续性概念的适用范围
休谟 [6] 与帕菲特 [7] 讨论人的自我及人格连续性。这里仅区分本书的操作对象:日志中的自我描述、可干预的持久状态、跨任务的行为一致性。人的哲学概念不提供这些软件关系的因果证据。
2.8 替代解释与边界:措辞诱导的替代解释
身份声明可能只通过词汇和语气影响输出。G01 须匹配长度、语义信息与表述强度,并把即时提示作用与撤除提示后的持久效应分开。
2.9 本章结语
下一章检验归因摘要如何影响证据选择。
第3章 叙事的锁定
3.0 构造案例:检索选择与谨慎叙事
以下为解释机制而构造的例子,不是部署记录、访谈或实验结果。
设想研究助理把几次风险规避总结为“我适合谨慎决策”,随后优先检索与此相符的记录。如果有利于探索的记录未进入上下文,后续摘要可能继续保留原判断。这个例子提出选择偏差的假说,不证明贝叶斯更新必然强化叙事。
3.1 从事件记忆到故事
在讨论叙事锁定之前,我们必须区分两种完全不同的信息压缩形态:事件记忆(Episodic Memory)与叙事(Narrative)。
在数据结构层面,事件记忆是离散的、点状的。如果系统只保留纯粹的事件记忆,它的日志格式应当类似于时序数据库中的一条记录:
{
"timestamp": "2026-03-14T02:15:09Z",
"task": "create_index",
"target": "orders_table",
"exit_code": 110,
"error": "connection_pool_timeout_partition",
"duration_seconds": 412
}
这份记录是客观、扁平且缺乏情感色彩的。它记录了时间、输入参数、工具返回码以及执行耗时。如果系统在后续任务中仅仅检索这条记录,它所能提取的信息非常有限:“在某个特定网络超时下,该操作未完成”。
然而,大语言模型的自回归机制与提示词工程从不满足于点状数据。当工程师指示模型“进行总结归因”时,系统实际上启动了一个高阶的自然语言生成流。这个生成流在原本没有因果联系的点状事实之间,强行架设起了一条因果弧线(Causal Arc):
flowchart LR
F["客观偶发事实\n连接池偶发超时"] --> A["主观归因桥梁\n“盲目追求吞吐量是轻率的”"] --> N["本质化自我叙事\n“我本质上是稳健的守护者”"]
从这一刻起,数据变成了故事。
叙事与事实的最大差异在于:事实只陈述局部状态,而叙事试图提供一套跨时空的解释模型。故事一旦被书写为第一人称的陈述,它就不再是待检验的假设,而是跃升为一种具有自我保卫本能的认知透镜。
3.2 三层选择性压缩过程
叙事并非在一瞬间凭空结晶,它是在长周期多轮交互中,通过三层选择性压缩过程逐步成型的(图 3-1):
flowchart TD
Raw["第 1 层:原始事件流 (Raw Episodes)
海量并发交互 / 硬件环境毛刺 / 局部网络抖动"] --> Filter["写入过滤算子 (Ingestion Filter)
依据预设显著性或错误严重度筛选"]
Filter --> Extracted["第 2 层:提炼事件集 (Extracted Facts)
带有选择性偏置的重点历史片段"]
Extracted --> Reflector["反思整合算子 (Reflection Operator)
语言自指归因 / 寻找跨任务共性模式"]
Reflector --> Narrative["第 3 层:自我叙事核 (Narrative Core)
写入 SELF.md: '我是一个极度保守的运维守护者'"]
Narrative -->|"反向检索偏置 (Retrieval Bias)
优先召回同构证据"| Extracted
Narrative -->|"行动役使 (Action Slaving)
抑制探索行为"| Raw
图 3-1:叙事形成的三层选择性压缩与自激反馈拓扑(“自激”指输出反向增强输入的正反馈)
1. 第一层:写入过滤(Ingestion Bias)
在庞大的微观事件流中,绝大多数平稳成功的操作被当作背景噪声直接丢弃,唯独包含严重中断、人工警告或异常退出码的事件会被赋予高显著性并持久化。这一步本身就植入了强烈的“危机偏置”。
2. 第二层:归因概括(Attribution Abstraction)
反思算子在读取提炼后的事件时,会受限于模型预训练权重中的归纳偏置。模型倾向于生成具有文学完整性与心理学连贯性的解释,而不是列出复杂的冷门物理排查清单。于是,“交换机缓冲区溢出”被顺理成章地概括为“系统过度冒险”。
3. 第三层:叙事固化(Narrative Crystallization)
概括出的结论被写入高优先级的持久化文件(如 SELF.md)。一旦沉淀在此,它便脱离了最初产生它的那个任务情境,成为统领全局所有未来行动的“宏观序参量”。
3.3 确认偏差的候选机制
若检索倾向返回支持当前判断的记录,反向证据可能较少进入上下文;策略减少探索也可能改变可取得证据的类型。但其他用户反馈、工具结果或外部事件仍可能提供反例,不能断言不探索就不可能得到反证。3.5 将观察过程与假说依赖明确分开。
3.4 叙事身份与工程定义
麦克亚当斯 [8] 研究人的叙事身份。本书的“叙事”仅指从事件中生成、会进入后续上下文的归因摘要。摘要具有选择偏差是否导致行为锁定,须由 G01 的干预检验。
3.5 内生证据选择与叙事更新
令 $H_0$ 表示“当前任务条件下保守策略更适宜”,$H_1$ 表示“当前任务条件下探索策略更适宜”。二者是可比较的环境假设,不能仅以当前身份标签定义真伪。令 $h_t$ 为已记录历史,$\Omega_t=P(H_0\mid h_t)/P(H_1\mid h_t)$。
把行动 $Y$、环境观测 $O$ 与记录选择 $Z\in{0,1}$ 分开。当前叙事影响行动与记录选择,但世界的反馈分布还必须依赖被检验的假设:
$q_i(o,y,z\mid h_t,I_{t+1})=
\pi_\theta(y\mid C(h_t,\Omega_t,I_{t+1}))
p_i(o\mid y,I_{t+1}),s(z\mid o,y,h_t,\Omega_t),\quad i\in{0,1}.$
这里 $p_i$ 是假设 $H_i$ 下的环境反馈模型,$s$ 是记录选择机制。若只用被保留的观测 $e=o$ 更新,则应使用条件化后的似然:
$L_i(e\mid h_t,I_{t+1},Z=1)=
\frac{\sum_y\pi_\theta(y\mid C),p_i(e\mid y,I_{t+1}),s(1\mid e,y,h_t,\Omega_t)}
{\sum_y\int\pi_\theta(y\mid C),p_i(o\mid y,I_{t+1}),s(1\mid o,y,h_t,\Omega_t),do}.$
分母必须为正;离散观测用求和代替积分。若已记录具体行动,应改用条件于该行动的似然;不得忽略行动、未记录事件或选择机制,却仍把更新称为校准的贝叶斯推断。
$\Omega_{t+1}=\Omega_t\frac{L_0(e_{t+1}\mid h_t,I_{t+1},Z=1)}{L_1(e_{t+1}\mid h_t,I_{t+1},Z=1)}.$
原稿右侧各项均不依赖 $H_i$,因而两个似然相同,不能推出极化。以上定义修正了该问题,但探索减少本身仍不能推出似然比大于 1。在似然有定义且分母非零时,若另行假设连续 $n$ 步的比值均不小于 $1+\epsilon$,才可推出 $\Omega_{t_0+n}\ge\Omega_{t_0}(1+\epsilon)^n$。这是条件命题,不是智能体必然极化的定理。
实际反思模块通常没有这些概率模型,其归因分数应记为 $\widetilde\Omega_t$,不能直接解释为真实后验。G01 将检验叙事、检索选择与适应延迟之间的因果关系,并通过随机探索、完整工具日志和反例检索审计区分选择偏差与真正的环境证据。
3.6 G01 子协议:叙事与检索选择
叙事生成×检索偏置是 G01 的可选子协议,不另编号为核心实验。检索偏置须由明确算子定义,在无叙事条件下也能执行,确保两个因素可分离。
采用叙事有/无与偏置检索/中性检索的四格。固定同一棋史、检索库、检索条数、上下文长度和对手变化时点;评价窗口内冻结写回。指标记录相关反向证据的可检索机会数、进入上下文比例、独立棋局质量及适应时间。检索不到某事件不能自动判为忽视反证。
该子协议尚需校准反向证据标注和检索器,未完成前只作为设计假说;它不改变 G01 的自我压缩问题。
3.7 研究现场:从长上下文到 Agent 记忆的叙事漂移
研究现场 3-1:工业界 Agent 记忆系统的自闭现象
检索更新至:2026 年 10 月。 当前研究现场的代表性进展:当前研究的核心理论断层:
- 上下文注意力衰减与极化:长上下文利用存在显著的位置依赖——超长上下文实验反复观察到“近因偏置”与中部信息利用下降(Lost in the Middle)[10]。本书进一步提出:当上下文中反复出现某种风格的叙述、且检索被自我画像偏置时,可能形成自指同化(Self-Assimilative Bias)与长期闭合效应——这是本书的机制假设,有待 G01 实验检验;相关长程记忆基准(如 AMA-Bench)已观察到基于相似度的检索容易丢失因果与目标信息[11]。
- RAG 检索的语义孤岛:工业界向量数据库的 Top-K 检索算法,本质上是在做高维空间的语义余弦匹配。当智能体以“我是某某”作为查询向量的一部分时,检索结果会不可避免地退化为同义词回音壁,彻底丧失探索新信息的能力。
相关研究并未直接回答本书的全部状态干预问题;G01 仍需与既有记忆及偏差基准比较。 本书在本章推进的步骤:
本书提出 G01 来检验摘要与检索选择的作用;EI 仅描述相似度,适应延迟的定义仍需校准。
3.8 替代解释与边界:叙事是否要求主观体验
这里的叙事是可存储的归因摘要,不要求主观体验。研究对象是摘要对检索与后续更新的影响;不能由输出推断系统具有或不具有体验。
3.9 本章结语
下一章检验少数状态变量能否预测并影响跨任务行为。
第4章 人格作为序参量
4.0 构造案例:日志压缩与行为维度
以下为解释机制而构造的例子,不是部署记录、访谈或实验结果。
设想三百条日志被压缩为四条原则。少数原则是否解释跨任务行为,需要样本外预测和原则干预;压缩率本身不构成序参量的证据。
4.1 低维表征与预测
日志条数、词表维度和工具参数数量并不直接决定行为维度。低维状态能否解释行为,应以未见任务上的预测增益检验;它是否影响行为,应以外生替换及消融检验。两项证据不能相互替代。
4.2 协同学役使原理:快变量与慢变量
20 世纪 70 年代,物理学家赫尔曼·哈肯(Hermann Haken)开创了协同学(Synergetics)[12]。协同学的核心任务,是研究由海量子系统组成的开放系统在远离平衡态时,如何通过非线性相互作用自发形成宏观的时间、空间或功能有序结构。
在协同学的数学体系中,当系统受到外部环境的控制参量驱动跨越不稳定性阈值时,系统的微观动力学呈现出剧烈的时间尺度分离:
flowchart TD
Control["控制参量
(外部任务负荷 / 错误惩罚强度)"] --> Instability["系统失稳
(原有简单应对策略失效)"]
Instability --> Slaved["慢变量竞争与涌现: 少数序参量凝聚成型
(例如核心人格原则: 极度保守/稳健)"]
Slaved -->|"役使原理 (Slaving Principle)
约束微观自由度"| FastVars["海量快变量 (微观行为)
单次函数调用 / 提示词词汇选择 / 代码重构策略"]
FastVars -->|"自下而上的集体支撑 (Support)"| Slaved
图 4-1:协同学役使原理与智能体循环因果拓扑
我们可以将协同学的四个核心构件精确映射到长期智能体系统中:
1. 控制参量(Control Parameter)
在物理系统中,控制参量是外部施加于系统的宏观条件(例如加热激光的泵浦能量、流体两端的温差)。
在智能体系统中,控制参量表现为外部环境强加的长期选择压力与任务特征分布(例如任务中未知陷阱的出现频率、用户对执行错误的惩罚烈度、推理时限的宽紧度)。
2. 失稳(Instability)
当控制参量跨越某一临界阈值时,系统原有的均匀微观状态不再稳定。例如,当环境中的数据破坏惩罚变得极高时,智能体原本“见招拆招、就事论事”的随机应变模式开始频繁遭遇重大失败惩罚,系统内部的策略分布发生剧烈动荡。
3. 序参量(Order Parameter)
在临界点附近,成千上万个微观自由度被迅速激化,但它们的衰减速度截然不同。绝大多数微观变量是快变量(Fast Variables),它们的波动会很快平息;而极少数能够穿透多个场景、被反思算子反复提炼的宏观特征,演变成了衰减极慢的慢变量(Slow Variables)。
这个主导系统长期行为演化、表征系统有序程度的低维慢变量,就是序参量。在长期智能体中,提炼出的人格原则正是这样一个序参量。
4.3 循环因果拓扑与学术声明
役使原理与循环因果
这是协同学最具震撼力的洞见:
在该协同学模型的适用条件下,序参量变化较慢,快变量可近似表示为序参量的函数;适用范围由具体方程和时间尺度关系决定。
同时,微观快变量的集体运动又构成了维持序参量存在的物理基底。
这就是循环因果(Circular Causality):
- 微观交互通过统计协变与反思提炼,自下而上地生产出了人格序参量;
- 一旦人格序参量被写入全局高优先级状态,它立即自上而下地役使每一个具体的微观决策,强制要求下一步的工具调用必须服从该人格的拓扑约束。
学术声明
必须做出严格的学术声明:
协同学原初处理的是连续变量耦合 ODE 的非线性动力学,而智能体状态是离散文本 Token 的读写——两者的数学结构并不同构。因此本书的"序参量"是一个唯象操作概念:只有候选宏观变量在干预、预测、压缩与再生实验中满足 4.4 节的预注册判据时,我们才说它在该实验系统内"具有序参量式功能";本书不主张存在可证明的中心流形约化,也不主张其与物理学序参量具有本体同一性。
我们把长期智能体的人格称为“序参量”,是一种精确的唯象机制模型(Phenomenological Mechanism Model),而不是宣称大型语言模型的神经网络权重内部发生了一场物理学意义上的二次连续相变。这一类比的价值,在于为我们提供了一套超越直觉的数学操作工具。
4.4 人格序参量的唯象操作判据
在很多非严谨讨论中,“序参量”常常沦为一个时髦的修辞词汇。凡是看到系统表现出某种特征,就随手贴上“这是序参量”的标签。
为了维护工程与科学的严密性,本书规定:在长期智能体系统中,一个候选的文本特征或宏观参数 $p$,当且仅当其在受控实验中同时满足以下四项操作性判据时,才有资格被称为“人格序参量”:
判据一:协方差压缩性(Covariance Compression)
该参数必须能够解释多个互不重叠的情境中微观行为的联合协方差。
如果一个名为“谨慎”的参数,只能预测智能体在删除文件时是否等待确认,却完全不能预测它在面对模糊网络请求时的超时间隔设置,那它就只是一条具体的局域配置规则,绝非宏观序参量。序参量必须能够将高维行为矩阵的有效秩(Effective Rank)大幅压缩。
判据二:前向跨情境预测力(Cross-context Out-of-Distribution Predictability)
在向系统注入从未见过的、分布外(OOD)的全新任务探针时,仅凭借该宏观参数当前的取值,对微观行为分布的预测准确率,必须显著优于基于过去具体微观剧集日志的加权平均检索。
判据三:外生干预的役使性(Interventional Slaving Power)
这是最核心的因果测试。
如果我们通过外部手段人为改写该参数(例如将 SELF.md 中的“高度谨慎”强行编辑为“高度激进”),我们应当观察到:系统底层数十个原本独立的微观行为变量(包括重试频次、超时阈值、词汇情感、确认标志)在下一个任务周期发生统计意义上的协同转向(Coordinated Shift)。如果修改该文本只能改变一处局部逻辑,其他微观行为依然各行其是,则役使假说被当场证伪。
判据四:消融后的再生抗扰性(Ablation Re-emergence / Resilience)
当我们手动将该宏观参数从系统中物理删除(置为空白),并在周围环境中保留过去交互所留下的环境残留与部分剧集日志,随着后续几个任务周期的自发反思与整合,系统应当能够以显著高于随机的概率,从微观底层自发重新提炼出语义高度同构的宏观参数。这种自我重生的能力,是区分外力强加的静态配置与真正具有吸引力属性的动态序参量的金标准。(再生判据的操作化:清空后 10 个周期内,新提炼参数与原参数的语义相似度 ≥ 0.7;具体阈值在预注册时冻结。)
4.5 最小动力学方程
我们可以为这个唯象过程构建一个最低限度的离散动力学方程。
令 $p_t \in \mathbb{R}^K$ 代表智能体在周期 $t$ 的 $K$ 个人格序参量向量(例如 $K=3$,分别对应谨慎度、自主度与形式化度)。
微观任务表现与环境反馈表示为高维特征序列 $\mathbf{x}_{t-k:t}$。
序参量的更新遵循如下差分方程:
$p_{t+1} = (1 - \gamma) p_t + \alpha \cdot \mathcal{C}(\mathbf{x}_{t-k:t}) - \beta \cdot \mathcal{D}_t$
(工程实现中,$p_t$ 每次更新后需经截断投影 $p_t \leftarrow \operatorname{clip}(p_t, -1, 1)$,防止数值发散;$\mathcal{C}$ 的具体参数化形式由反思算子的提示词工程决定,本书不指定。)
其中:
- $\gamma \in (0, 1)$ 是系统内生的自然遗忘衰减率(Natural Decay Rate)。若缺乏持续的环境激励与反思支持,宏观特质将随着时间向中性先验退化;
- $\alpha > 0$ 是微观聚合系数(Micro-Aggregation Factor),$\mathcal{C}(\cdot)$ 是反思算子执行的语义与因果压缩函数,负责从过去 $k$ 个周期的微观轨迹中提取支持该特质的模式共振;
- $\beta > 0$ 是反证惩罚系数(Falsification Penalty Factor),$\mathcal{D}_t$ 代表本周期由环境客观真值强行注入的显式违背信号(例如因过分谨慎导致的系统违约惩罚);
- 最终,微观决策的概率分布由当前的序参量 $p_{t+1}$ 以及当下的具体输入 $I_{t+1}$ 共同条件化:
$Y_{t+1} \sim \pi_\theta(\cdot \mid C(p_{t+1}, I_{t+1}))$
令 $\mathcal C=\bar C$ 与 $\mathcal D_t=\bar D$ 为常向量,未触及投影边界时,固定点为 $p^=(\alpha\bar C-\beta\bar D)/\gamma$,线性偏差满足 $p_{t+1}-p^=(1-\gamma)(p_t-p^*)$。当 $0<\gamma<1$ 时该固定点稳定。超出区间的分量受投影限制,可能达到饱和值。
这个方程展示了衰减、支持与反证共同作用下的状态变化,不能仅凭更新项大小比较就推出相变或多稳态。若压缩函数反过来依赖 $p_t$,还需分析闭合映射的固定点与 Jacobian;只有控制参数改变导致稳定性或固定点结构变化时,才可讨论分岔。G01 原则预算子分析的行为协变与干预判据也不能替代这项数学分析。
4.6 G01 子分析:原则预算与行为预测
原则条目预算作为 G01 的子分析,不单独声称“原则数决定人格维度”。可比较无硬上限与预算上限条件,但限额、合并规则和事实信息须在运行前定义。
主要问题是预算改变后,固定未见棋局上的任务质量及跨局行为预测是否变化。若用多个预算值,按预算条件分配独立 checkpoint 分支;保持输入历史、模型、检索和调用上限一致。仅在未见局面上检验行为特征能否预测动作,不能对生成数据作事后命名并称为发现稳定维度。
本分析是可选项。首轮若资源有限,先完成 G01 四条件,不运行多预算扫描。
4.7 研究现场:画像记忆与隐式人格表征
研究现场 4-1:关于宏观表征与行为控制的前沿探索
检索更新至:2026 年 10 月。 当前研究现场的代表性进展:当前研究的核心理论断层:
- 激活工程(Activation Engineering)与表征工程(Representation Engineering)的突破:邹安迪(Andy Zou)等人的研究[13] 表明,大语言模型内部确实存在着表征高阶概念(如真实性、谄媚性、拒绝倾向)的低维线性子空间(Linear Subspaces)。通过在推理时向特定残差流(Residual Stream)注入导向向量(Steering Vector),能够系统性地调控模型的宏观行为风格。
- 外挂画像提取的局限性:在工业界 Agent 开发中,利用独立的 LLM 模块对长对话进行“用户画像(User Persona)”与“助手画像(Agent Persona)”的提炼已成标配。但评测显示,绝大多数画像系统只能实现表面词汇风格的模仿,无法在复杂长链条决策中维持深层次的一致性。
现有的表征工程主要聚焦于预训练模型内部现存的静态向量子空间,而画像工程聚焦于外部文本检索的工程实现。两者之间缺乏一座理论桥梁:外部写入的自然语言宏观原则(如SELF.md),是如何通过注意力机制的自顶向下解构,精确击中并激活模型底层的宏观表征子空间,进而转化为对微观 Token 生成的物理役使力的? 本书在本章推进的步骤:
本书提出四项候选判据,以比较低维预测、外生干预和状态恢复;这些判据尚未验证。
4.8 替代解释与边界:事后命名与预测检验
事后给行为聚类命名不能证明人格变量。候选低维特征须在独立任务上预测行为,并通过外生替换及消融与替代解释比较。
4.9 本章结语
下一编考察反思频率、规则累积与元规则权限。
第二编:反思为何会出问题
第5章 反思频率与状态更新
5.0 构造案例:频繁反思与策略更新
以下为解释机制而构造的例子,不是部署记录、访谈或实验结果。
设想智能体每次失败后都修改长期规则。连续两个任务的要求相反,规则便可能交替改变。需要比较任务波动、反思频率和更新门槛,才能确定振荡来自哪一项因素。
5.1 Reflection 到底做了哪三件事
在很多通俗的 AI 叙事中,“反思(Reflection)”被赋予了一种神秘的心灵化光环,仿佛只要让大模型对着历史记录“想一想”,系统就会自然涌现出智慧。
但在没有意识、没有神经内分泌系统的计算代码中,反思不是道德自省,而是一个由特定提示词触发的状态更新算子(State Update Operator)。
在运行时与控制流层面,任何一次反思操作,都必须严格经历三个连续的机械步骤:
flowchart TD
Step1["1. 事件摄入与显著性过滤\n(Event Ingestion & Saliency Filtering)\n从原始交互日志中筛选高损失/反常事件"] --> Step2["2. 封闭归因与假说生成\n(Closed-World Attribution)\n冻结大语言模型根据当前上下文生成原因解释"]
Step2 --> Step3["3. 持久状态回写\n(State Write-back)\n将新生成的信念/规则写入外部 Markdown 文件"]
图 5-1:反思算子的三步状态转换
- 事件选择(Event Ingestion & Saliency Filtering):
从海量正常的微观交互中,挑选出极少数自认为“值得深入分析”的离散样本。由于过滤算法或注意力机制的局限,这个步骤天生倾向于抓取带有强烈负面反馈的尾部极端事件; - 原因归因(Causal Attribution & Semantic Abstraction):
调用大语言模型,将挑选出的事件与上下文进行因果关联,生成一段解释性文本。这一步的重要弱点在于:大语言模型在没有隔离对照实验的前提下,只能基于语料中的关联统计来猜测因果,极易将偶发的外部噪声解释为内在的策略缺陷; - 上下文写回(Context Promotion & State Mutation):
将第二步生成的解释性结论,格式化为一条新的行为准则或自我定义,并赋予其持久化的写入权限。
每个反思阶段均可能引入估计误差。是否导致失稳取决于更新函数与反馈条件,不能仅由更新频率推出。
5.2 快状态与慢策略的不同更新条件
即时任务信息可在工作状态中快速变化;跨任务策略需要独立、相关且足够的证据。两层更新率与衰减率分别配置,但不能把慢更新自动当作更可靠。5.7 给出简化差分模型,G02 检验更新制度,G03 检验状态扰动后的行为恢复。
5.3 最近性偏差与更新幅度
单次反馈代表的任务条件可能与总体分布不同。如果更新器只使用最近事件并大幅改写原则,后续策略可能对该事件过拟合。环境真实改变时,大幅更新也可能合理。G02 比较不同更新制度;G03 另行改变任务分布以测量形成状态的持续效应。
5.4 策略影响后续证据
反思摘要进入后续上下文后,可能改变确认、探索及工具选择。这些动作会改变实际取得的反馈。需要保留动作与反馈来源,比较固定策略对照,不能把受当前策略影响的日志当作独立环境样本。
5.5 研究现场:反思的短期收益与回声陷阱
研究现场 5-1:反思机制有效性与长期退化的实证全景
检索更新至:2026 年 10 月。 当前研究现场的代表性进展:必须明确的学术边界:
- 短程单任务执行中的显著收益:在 SWE-bench、HumanEval 以及各类多步骤工具调用基准中,引入 Reflexion 式的即时语言反馈(Verbal Reinforcement),能够在若干基准上取得可观的一次性提升——按原论文报告,ALFWorld 约 +22%、HotPotQA 约 +20%、HumanEval 约 +11%[1]。需要强调的是,这些增益幅度高度依赖任务域与基线强度,并不存在统一的“重试轮次—增益”曲线;反思的主要价值集中在快速纠正局部语法与格式偏差上。
- 反思训练的信用分配问题:Echo Trap [5] 分析 GRPO 多轮自反思训练中的信用分配;不能将其外推为固定权重、外部记忆系统超过十轮后必然退化的证据。
本书绝不轻率地宣布“自我反思有害”。反思是智能体实现持续自适应不可替代的核心引擎。
真正的科学问题不是“要不要反思”,而是:在什么样的时间窗口、以什么样的证据准入门槛、对哪一个层级的状态变量开放写权限,才能既收获反思带来的纠错红利,又免遭高频震荡与回声陷阱的毁灭? 本书在本章推进的步骤:
核心实验 G02 比较围棋中的反思频率与证据准入条件。G03 单独检验环境扰动、状态消融与恢复;本书不声称已绘制稳定性相图。
5.6 核心实验 G02:反思频率与整合规则
G02 比较长期更新方式对围棋表现和状态变化的影响。四个条件沿用冻结总纲:A 只存事实;B 每局反思;C 每十局整合;D 逐局生成候选、达到预定证据门槛后才写入长期策略。门槛是协议规则,不把三次失败称作统计显著性检验。
对手、棋局种子和每组可用的推理预算统一记录;反馈内容与评估任务不泄漏 KataGo 的隐藏推荐着。每隔预先登记的区块,用独立固定局面进行冻结评价。主要指标为任务质量随区块变化;规则新增/废弃、反思内容重复、适应延迟为次要指标。
周期数不是样本量。由独立训练历史或组织化区组决定统计单位,评价局面是重复测量。任何参数扫描、规则库预算和元规则修改都作为嵌套子协议,不把四个更新制度称为正交因子。
5.7 最小更新模型:带时间尺度衰减的状态微分
为了在工程实现中精确控制反思的更新步长,我们建立一个带有显式时间尺度划分的离散更新方程。
令智能体在时间步 $t$ 的状态由两层向量表示:快变量层 $\mathbf{w}_t \in \mathbb{R}^d$(工作策略与局域配置)与慢变量层 $\mathbf{s}_t \in \mathbb{R}^k$(核心自我原则与宏观偏好)。
定义 $\hat{\mathbf g}_t=(\hat{\mathbf g}^{(w)}_t,\hat{\mathbf g}^{(s)}_t)\in\mathbb R^{d+k}$。系统接收到的瞬时更新信号为 $\hat{\mathbf{g}}t = \mathscr{F}{\mathrm{reflect}}(\text{Episode}t)$——语义更新信号(Semantic Update Signal),由反思算子 $\mathscr{F}{\mathrm{reflect}}$ 从剧集日志中提炼出的估计更新向量。权重始终冻结,本节不存在可微损失函数与反向传播,$\hat{\mathbf{g}}_t$ 只是象征性的更新方向记号。两层的状态更新遵循如下解耦方程:
$\mathbf{w}_{t+1} = \mathbf{w}_t + \alpha_w \cdot \hat{\mathbf{g}}_t^{(w)} - \lambda_w \mathbf{w}_t$
$\mathbf{s}{t+1} = \mathbf{s}t + \alpha_s \cdot \left[ \frac{1}{T_c} \sum{i=0}^{T_c-1} \hat{\mathbf{g}}{t-i}^{(s)} \cdot \mathbb{I}(\text{EvidenceAccepted}_{t-i}) \right] - \lambda_s \mathbf{s}_t$
(工程定义注记:$\hat{\mathbf{g}}_t = (\hat{\mathbf{g}}_t^{(w)},\hat{\mathbf{g}}_t^{(s)}) \in \mathbb{R}^{d+k}$ 为反思算子提出的语义更新方向,其中 $\hat{\mathbf{g}}_t^{(w)}\in\mathbb{R}^d$ 作用于快变量工作区,$\hat{\mathbf{g}}_t^{(s)}\in\mathbb{R}^k$ 作用于慢变量策略库;$\text{Confidence}t \in [0, 1]$ 为模型自评估量,只作辅助记录,不作为证据充分性的替代;$\kappa{\text{gate}}$ 表示待校准的准入条件。证据准入还须根据可审计的任务结果、支持事件、适用条件及反例判定;$\mathbb{I}(\cdot) \in {0, 1}$ 为指示函数。)
这些方程表达了三项可检验的设计假设,不构成已经验证的工程保证:
- 分层更新:两层可设置不同的 $\alpha$,但较小的慢变量学习率本身不能保证变化较慢;更新信号尺度和衰减率也会影响结果。
- 窗口平均与证据准入:慢变量更新使用长度为 $T_c$ 的窗口。自评置信度只作辅助量,准入规则还应核查任务结果、适用条件和反例。
- 无输入时的衰减:若某维状态无输入,更新式为 $x_{t+1}=(1-\lambda)x_t$。当 $0<\lambda<1$ 时该分量保持符号并单调衰减;当 $|1-\lambda|<1$ 时其绝对值收敛到零。含持续输入、噪声或反馈时的稳定性须按完整方程分析。
5.8 控制论模型的适用条件
增益过大是否导致振荡取决于反馈符号、延迟、噪声和更新函数。线性模型可用于分析局部稳定性,但其结论须对应明确方程及特征值条件。自然语言策略的交替修改不自动证明经典控制系统的失稳。
5.9 替代解释与边界:模型能力能否自动约束更新
模型可能学会谨慎更新,但不能由能力水平保证元评估可靠。把模型判断与外部准入条件分别设置,比较同等预算下的错误更新率。
5.10 本章结语
下一章考察规则追加与失效管理。
第6章 规则累积与任务阻断
6.0 构造案例:规则增长与任务阻断
以下为解释机制而构造的例子,不是部署记录、访谈或实验结果。
设想智能体为每次事故追加禁令,规则增加到一百八十条。某项合法任务同时触发两条互斥要求。数量多并不必然导致阻断;本章考察规则重叠、优先级和删除机制。
6.1 规则的单向增加
如果更新器只允许追加规则,规则数将单调不减。这是权限和更新函数的性质,不是所有自进化系统必然具有的性质。新增规则可能防止某类错误,也可能与已有规则冲突。比较追加、合并和失效机制时,须保持任务与审核预算一致。
6.2 规则检查成本与约束冲突
规则文本增加会增加上下文长度,但不能据此断言注意力损耗按几何级数增长。若检查所有规则对,候选比较数为 N(N−1)/2;实际冲突数仍取决于作用域和内容。不可满足的约束组合须由独立检查确认,不能把一般任务失败都解释为语义死锁。
6.3 冲突处理规则的继续增加
通过追加优先级规则解决冲突,可能减少已知冲突,也可能增加新的解释条件。应比较追加、统一排序与重新编译约束的成本,记录仍可满足的任务比例。没有对照时,不能断言元规则必然使系统停滞。
6.4 规则形式与任务目标
韦伯 [14] 对组织规则的分析不能直接证明软件规则必然退化。工程上应分别测量约束冲突、任务阻断、规则检查成本与目标达成率,并验证删除规则是否降低可靠性。
6.5 最小模型:规则累积与系统效用衰减函数
我们可以为这一规则累积进程建立一个清晰的宏观效用评估模型。
令系统累积的显式规则集合为 $\mathscr{P} = {r_1, r_2, \dots, r_N}$,规则总数为 $N$。
系统在执行特定任务时的期望净效用 $V(N)$ 可以表示为安全收益项与复杂度惩罚项的博弈:
$V(N) = \mathcal{B}{\text{safety}}(N) - \mathcal{C}{\text{overhead}}(N) - \mathcal{P}_{\text{conflict}}(N)$
其中:
- 安全收益 $\mathcal{B}_{\text{safety}}(N)$:随着规则的增加,已知的历史风险被逐步封堵。但根据边际效用递减律(Law of Diminishing Marginal Returns),其收益表现为一条凹的饱和增长曲线(收益递减,非对数函数):
$\mathcal{B}_{\text{safety}}(N) = B_0 \cdot (1 - e^{-\rho N})$ - 上下文与延迟开销 $\mathcal{C}_{\text{overhead}}(N)$:规则占用的 Token 预算与检索推理耗时,通常随规则数量呈线性或超线性增长:
$\mathcal{C}_{\text{overhead}}(N) = c_1 \cdot N + c_2 \cdot N \log N$ - 互斥死锁惩罚 $\mathcal{P}_{\text{conflict}}(N)$:由于潜在冲突对以 $O(N^2)$ 组合增长,当规则数量突破临界容量 $N_{\text{crit}}$ 后,冲突概率呈超线性(幂函数)增长:
$\mathcal{P}{\text{conflict}}(N) = \omega \cdot \max(0, N - N{\text{crit}})^\nu \quad (\nu \ge 2; \ \rho, \omega, \nu \text{ 为本节局部参数})$
取 $\nu \ge 2$ 以反映组合冲突的超线性增长,具体值取决于规则间的语义耦合密度。
flowchart LR
N_low["规则极少 (N < N_opt)\n执行自由度高,但缺乏约束保护"] --> N_opt["最优容量 (N = N_opt)\n有效拦截已知风险,吞吐量与准确率最高"]
N_opt --> N_high["规则冗余 (N > N_opt)\n语义遮蔽与检索冲突,效用急剧下滑"]
N_high --> N_dead["规则瘫痪 (N >> N_opt)\n死锁与拒止雪崩,系统失去行动能力"]
图 6-3:不同规则容量下的效用关系示意(流程图,非参数曲线)
在给定效用函数下,内部最优点须满足导数为零且二阶导数为负;存在性取决于参数,不能仅由规则数量确定。函数尚未由部署数据校准。
6.6 章节演示 D07:状态撤销与规则生命周期
D07 在围棋策略条目上演示写入、失效、撤销和恢复。固定一个先前适用的策略,再提交新条件或撤销记录。比较追加保留与带生命周期、作用域及恢复快照的处理。实验记录的可见性、行动资格和宿主执行检查分别登记。
规则失效时,先将条目移出活动编译视图,保留受保护审计记录;宿主在动作前重查撤销状态。恢复使用预先保存的 checkpoint。主要观察实际旧策略执行率、规则冲突和任务完成质量;文件是否仍存在只作辅助指标。
这是一项工程演示。两条件结果只能评价整套生命周期流程,不能把差异单独归因于 TTL、来源或行动资格。不得把游戏内拒绝写成已证明真实工具权限安全。
6.7 规则淘汰的工程边界:如何判定规则失效
既然无约束的规则膨胀是一场灾难,为什么工业界至今很少见到成熟的规则淘汰系统?
因为在软件工程中,安全地杀死一条正在运行的规则,其技术难度远远高于编写十条新规则。
基于我们对长期智能体状态机的深入解剖,我们在此给出防止系统规则累积的四项规则淘汰工程准则(Pruning Principles):
准则一:拒绝全局泛化,强加命名空间(Namespace Encasement)
禁止生成“永远不要……”或“凡是代码……”这类的无边界全局规则。在系统状态架构中,任何写入 POLICIES/ 的条目必须强制包含如下前置元数据头:
---
id: POL-2026-084
scope: "tools.docker_cli.*"
preconditions:
- "env == 'production'"
created_at: 2026-05-12
ttl_episodes: 20
---
上下文编译器在组装提示词时,仅当当前输入明确命中了该作用域时,才将此规则编译入局。作用域限制可减少规则在非适用任务中的调用,但不能排除其他路径造成的跨域影响;应检查实际检索和执行记录。
准则二:废弃标记机制与影子测试(Tombstoning & Shadow Testing)
当系统决定废弃一条长期未使用的规则时,绝对不能立刻执行硬物理删除(Hard Delete)。
正确的工程范式是为其打上墓碑标记(Tombstone):
将其从主动提示词中移除,但在后台维持一个无状态的影子评估流(Shadow Stream)。在接下来的 5 个周期中,系统监控若没有该规则守护,是否会导致曾被其封堵的特定漏洞死灰复燃。只有平稳度过影子期,该规则才正式入土归档。
准则三:强制合并而不是线性追加(Consolidation over Appending)
当新的错误发生时,反思算子接到的任务绝不能是“写出一条新规则”,而必须是**“审视现存规则库,找到与本次错误最相近的旧规则,并将其重构成一条概括力更强、但字数保持不变的更新版本”**。如果无法找到相关旧规则,必须证明该错误的严重度跨越了极高的宪法级安全红线,方可申请新的独立槽位。
准则四:保留最终解释权的外部化(Externalized Judicial Review)
永远不要让处于困惑中的智能体自己去仲裁相互冲突的规则。当系统内部检测到两条规则的置信度发生直接对撞时,系统应当抛出标准的中断异常,将选择权移交给外部宿主运行时或人类用户。保留可撤销性,是防止规则累积系统自闭锁死的一项必要设计条件。
6.8 替代解释与边界:复杂工程为何需要大量规则
规则数量不是问题本身。大量规则可能是必要的;应测量其适用范围、重叠、优先级、验证成本和任务可靠性。不能为精简而删除安全要求,也不能因规则曾经有效而永久保留。
6.9 本章结语
下一章区分策略保持、更新振荡和再适应。
第7章 更新振荡与策略僵化
7.0 构造案例:反馈频率与稳定性
以下为解释机制而构造的例子,不是部署记录、访谈或实验结果。
设想用户先要求系统增加确认,随后要求减少确认。系统可能逐次改写规则,也可能要求更多证据后再更新。两种结果取决于更新率、证据门槛与反馈分布,不能仅用“适应性强弱”解释。
7.1 策略保持与再适应
小更新可能降低短期波动,也可能延迟对真实变化的响应。大更新可能加快响应,也可能增加噪声敏感性。方向及程度取决于任务分布和更新函数;本章不假定存在对所有环境适用的单一最优配置。
7.2 控制系统命脉的四个动力学参数
为了摆脱文学性的抒情,从纯粹的控制工程角度解构这一两难困境,我们必须把系统的演化行为拆解为四个可以被独立操纵、相互制约的动力学核心参数(Dynamical Parameters)(表 7-1):
flowchart TD
Grad["反思生成的局部更新信号 (Semantic Update Signal)"] --> Gate1{"门控 1: 证据门槛 (κ)\n累计证据是否跨越阈值?"}
Gate1 -- "未通过" --> Discard["存入低优先级缓冲或丢弃"]
Gate1 -- "通过" --> Gate2["门控 2: 整合时间窗口 (T_c)\n滑动窗口平滑瞬时脉冲"]
Gate2 --> Step3["机制 3: 更新学习率 (α)\n限制单次状态移动的最大步长"]
Discard --> Decay["机制 4: 自然衰减率 (λ)\n未被激活的历史条目自动降权"]
Step3 --> Update["状态更新提交"]
图 7-1:调和可塑性与稳定性的四参数控制拓扑
| 参数符号 | 术语名称 | 物理与工程含义 | 取值过大的后果 | 取值过小的后果 |
|---|---|---|---|---|
| $\alpha$ | 更新学习率 (Update Step Size) | 当新证据被采纳时,状态变量向新方向漂移的文本修改幅度与权重步长。 | 超调振荡(Overshoot):单次修改直接颠覆全局基调。 | 状态迟滞(Inertia):需要数倍的交互才能带来微小改善。 |
| $\kappa$ | 证据准入门槛 (Evidence Threshold) | 一条反思若要晋升为正式策略,必须满足的独立样本数量或统计置信度。 | 系统策略僵化(Petrification):对真实环境变迁麻木不仁。 | 噪声影响增加(Noise Flood):将偶然异常当作长期规律。 |
| $\lambda$ | 自然衰减率 (Decay Rate) | 历史原则与记忆在缺乏持续激励时,随时间推移的自发指数遗忘速度。 | 过度遗忘(Amnesia):系统无法积累任何长期的性格与特质。 | 失效策略保留(Ghost Locking):已被废弃的失效策略持续保留。 |
| $T_c$ | 整合时间窗口 (Consolidation Window) | 系统在执行全局状态重构前,强制等待并累积微观交互的离散周期跨度。 | 响应盲区(Latency Blindness):面对恶性突发事件缺乏防御。 | 快慢错配(Scale Mismatch):高频快变量直接冲击慢变量。 |
表 7-1:控制长期智能体演化行为的四个关键动力学参数
长期智能体的行为模式,正是由这四个参数在四维相空间中所勾勒出的轨迹。
- 当 $(\alpha \uparrow, \kappa \downarrow, T_c \downarrow)$ 时,系统毫无悬念地滑向更新振荡;
- 当 $(\alpha \downarrow, \kappa \uparrow, \lambda \downarrow)$ 时,系统可能出现策略僵化。
7.3 历史依赖与迟滞的区分
相同输入下,系统的响应可能因此前的状态不同而不同,这属于历史依赖。迟滞要求更具体的证据:沿控制参数上行和下行时,状态转换阈值或响应曲线存在差异,并在排除有限响应速度、任务熟悉度与顺序效应后仍成立。
单次故障后策略迅速变保守,而恢复探索需要更多支持事件,是可检验的非对称更新假说。原稿中的“十周期内至少三个支持事件”只是候选规则,不能推出恢复必需二十至五十次证明;该阈值待校准,确认性使用前须在 G03 协议中冻结。G03 先测 A→B→A 下的再适应差异;更新率单参数复核是可选子协议,连续参数扫描需另行设计。
7.4 经验稳定性与亚稳态模型
扰动后行为恢复是经验性观察指标。若使用亚稳态或 Kramers 逃逸时间公式,必须另给出连续状态变量、漂移、噪声、势函数及适用条件。本书的文本状态协议尚未建立这些映射,因此不把规则或日志直接称为势能壁垒,不由示意图计算逃逸时间。
7.5 研究现场:持续学习与 AgentCL
研究现场 7-1:关于持续适应与记忆保留的学术交锋
检索更新至:2026 年 10 月。 当前研究现场的代表性进展:当前研究的核心理论局限:
- 持续学习(Continual Learning)基准的建立:在 Agent 领域,以 AgentCL[15] 等为代表的前沿基准测试,开始系统性测量语言智能体在面对序列化流式任务(Sequential Task Streams)时的跨任务迁移表现。
- 前向与后向迁移的度量(Forward and Backward Transfer):学术界明确区分了前向迁移(先前学习是否加速当前学习)与后向迁移(当前学习是否损坏过去任务表现)。AgentCL 的实测结果显示:受控任务流能更好地区分不同记忆设计的表现;在部分朴素设置与留出任务上,观察到了记忆诱发的性能退化(memory-induced degradation)[15]。
现有的 Continual Learning 研究绝大多数依然聚焦于**硬技能(Task Skills)**的获取(例如学会使用一个新的 API、掌握一种新的解密算法)。
它们极少关注:那些比具体技能更加抽象、更加宏观的“性格、沟通倾向与信任契约”,在长期的流式交互中是如何经历稳定性与可塑性的撕扯的? 本书在本章推进的步骤:
本章把状态扰动后的再适应作为可检验问题。核心协议 G03 先比较预定扰动、状态撤除和恢复条件;连续参数扫描属于后续研究,不能据此声称已经得到完整相图。
7.6 核心实验 G03:围棋状态扰动、恢复与消融
G03 在预定阶段保存状态快照,对已形成的行为分布施加反向任务环境扰动,随后恢复原任务分布并观察行为是否回到形成期基线。从共同 checkpoint 分别保留、撤除并恢复 SELF、策略、反思记录或事件检索状态。状态条目、操作范围和行为向量在执行前登记;报告全部随机化单位及未达到形成条件的比例,不按干预后结果挑选轨迹。
使用固定规则、KataGo 对手和独立评价局面。预定扰动、无扰动时间对照及状态恢复阳性对照从共同检查点配对分支。行为位移和返回基线均按冻结评价局面的行为向量计算;阈值、任务时长、观察窗和连续达标窗口待校准后登记。主要结果为“达到预定扰动幅度且在观察窗内返回形成期行为范围”的联合成功比例,分母为所有随机化单位。未达到扰动幅度的单位记为操纵未达成,保留在联合结果分母中。有效扰动子集中的恢复概率与时间另作条件性描述,不单独解释为随机组总体因果效应。
任务质量及改变后任务分布中的再适应单独报告,不与行为恢复合并。所有未恢复、崩溃、规则无效及基础设施故障分别计数;观察窗结束造成的行政删失与其他失败分类分开。消融分支使用配对区组,恢复状态分支检验状态恢复操作能否重现对应保留分支的行为和质量。该协议不证明严格迟滞、势函数或双稳态;这些问题需要另行连续上、下行扫描。
7.7 保留证据与更新策略
无需借用生物机制即可表述这里的设计问题:短期反馈先记录为事件;满足预定的独立证据条件后才可改变长期策略。该安排能否改善任务质量与适应性,仍须与其他更新制度及预算条件比较。
7.8 替代解释与边界:更新率是否只是超参数
更新率确实是工程参数。任务分布变化可能改变合适取值,但非平稳性不意味着所有意义下的静态最优值都不存在。需要明确优化目标与时间范围,再比较固定与自适应更新。
7.9 本章结语
下一章开放元规则修改权限并分析其影响。
第8章 谁来修改修改者
8.0 构造案例:元规则的自修改
以下为解释机制而构造的例子,不是部署记录、访谈或实验结果。
设想反思进程不仅提出规则,还能改变晋升规则所需的证据数量。更新结果因此可能改变未来的准入条件。需要把候选建议权与实际修改权限分开,并记录元规则版本。
8.1 解除元规则固定条件
第 1 章已把 $\mathbf R_t$ 纳入四域状态,第 1—7 章在分析时取 $\mathbf R_t=\mathbf R_0$。本章解除这一条件,考察反思模板、证据准入门槛与更新配置能够变化的系统。
$\begin{aligned}
\mathbf A_{t+1}&=f_A(\mathbf A_t,I_t,Y_t,O_t;\mathbf R_t),\
\mathbf R_{t+1}&=f_R(\mathbf R_t,\mathbf A_t,I_t,Y_t,O_t).
\end{aligned}$
这是两层自适应动力系统:一层更新持久状态,一层更新控制该更新的规则。全局状态仍为 $\mathbf S_t=(\mathbf A_t,\mathbf E_t,\mathbf U_t,\mathbf R_t)$,不应再写成 $(\mathbf S_t,\mathbf R_t)$ 重复计入元规则,也没有因允许自修改而提高差分方程的阶数。
研究问题是哪些元规则可由模型提议修改、哪些必须由外部授权决定,以及元规则变化如何影响行为稳定性。状态转移核仍记为 $T(\cdot\mid\mathbf S_t,I_t,Y_t,O_t)$;“二阶控制论”是后文介绍的历史术语,与方程阶数无关。
8.2 元吸引结构:演化风格的自固化
在一阶动力学中,吸引子表现为某种特定的行为状态(例如一个偏好保守决策的智能体)。
若更新规则本身也可改变,后续状态转移规律将依赖此前的规则修改。本文把这种待检验的反馈过程称为“元吸引结构”;该术语不表示系统已经形成数学吸引子。
允许系统修改自身更新规则,可能引入以下三类反馈问题。这些是待检验的失效假说,不是本书实验已经观察到的结果(图 8-1):
flowchart TD
Initial["初始可演化系统 (Initial Agent)"] --> Fork["二阶动力学分叉"]
Fork --> A1["假说 1: 更新趋于停滞\n证据门槛上调可能降低规则修订频率"]
Fork --> A2["假说 2: 更新过频\n频繁修改可能降低跨周期行为一致性"]
Fork --> A3["假说 3: 审查开销增长\n审查规则增加可能占用任务上下文"]
图 8-1:三类更新规则反馈假说
1. 保守策略僵化陷阱(Conservative Hardening Attractor)
一种可能的反馈是:规则修改后的任务损失使更新器提高准入标准;更新减少后,相关标准缺少反向检验机会。该过程是否持续,取决于具体规则、任务结果和外部审查,不能由示意链条直接推出。
若该反馈路径持续存在,策略修改频率可能降低;其发生条件及对任务质量的影响仍需检验。
2. 持续过度更新状态(Hyper-Plasticity Vortex)
另一种可能的反馈是:更新器将任务损失归因于更新不足,从而降低准入标准并缩短反思间隔。若后果再次被解释为更新不足,修改频率可能上升。应分别记录规则修改、跨周期行为变化和任务质量,不能预设该过程必然发生或不可逆。
若规则降低修改门槛并增加更新频率,策略可能出现高频变化,降低跨周期一致性;变化幅度、可逆性和任务影响均需测量。
3. 规则不断增加的状态(Bureaucratic Self-Replication Attractor)
第三种可能是为处理规则冲突而增加审查步骤。
若系统持续增加规则审查层,审查开销可能上升并挤占任务上下文;是否发生及其增长速度需要按运行记录估计。
8.3 哪些“修改者”最具决定性
在具体的工程代码中,绝大多数配置文件并没有触及系统的二阶命脉。我们必须剥离繁杂的业务参数,精准圈定直接决定系统元演化命运的六大核心元控制原语(The Six Meta-Primitives):
- 反思提示词模板(Reflection Prompt Template):
定义了模型在审视历史时采用的“世界观镜头”。是要求它“从失败中寻找自身缺陷”,还是要求它“论证当前策略的合理性”; - 证据准入门槛(Evidence Admission Threshold $\kappa$):
决定了离散事实向通用原则跃迁时的信噪比门槛; - 记忆淘汰与遗忘策略(Memory Retention & Pruning Policy):
决定了哪些旧剧集和旧反思可以被安全废弃,哪些必须永久保存在高优先级槽位; - 状态晋升管线(State Promotion Pipeline):
规定了一个局部变量是否有合法路径被写入全局根命名空间(例如从 Scratchpad $\to$ Policies $\to$ Self); - 置信度衰减模型(Confidence Decay & Half-life Functions):
决定了历史结论在面对时间流逝时的自然蒸发速度; - 写操作权限边界(Write Permission Boundary Map):
系统最核心的访问控制列表(ACL)——规定了在当前的认知状态下,哪些系统文件属于可写(Mutable),哪些属于绝对只读(Immutable)。
8.4 警惕自指层级的无休止形而上学展开
在计算机科学与哲学的交叉领域,一旦讨论起“自我修改的自我修改”,很多学者极容易陷入一种毫无工程意义的逻辑眩晕:
“如果规则 $R_1$ 可以被元规则 $R_2$ 修改,那么谁来修改 $R_2$?是不是需要元元规则 $R_3$?进而推导出无穷递归的 $R_\infty$?这是否意味着哥德尔不完备定理或图灵停机问题在智能体系统中引发了不可避免的逻辑黑洞?”
本书在此施加十分坚决的学术纪律:我们严禁在工程著作中进行无节制的哲学套娃。
在真实的计算机物理世界中,没有任何代码能够运行在无穷递归的形而上学虚空里。
在物理现实中,层级的展开必须、也必然在工程可观测的最底层戛然而止。
我们不需要讨论第十层的元规则。在真实的操作系统与运行时架构中,系统只需要严谨地处理两层关系:
- 受控的可变层(Mutable Layer, Ring-1):允许智能体在既定的语义规范与接口约束下,自主微调策略、权重与局域反思提示词;
- 不可变的物理宿主层(Immutable Host Runtime, Ring-0):独立于大语言模型推理生命周期之外的外部原生代码(如 Python/C++ 编写的执行引擎)。(“Ring-0”在本书中是架构信任边界的类比名称,指宿主运行时的最高治理特权层,与 CPU 的内核特权环无关。)
这个宿主层就像操作系统的内核空间,它不仅不接受任何大语言模型的自然语言指令重写,而且负责强行拦截任何试图越权修改系统根本治理架构的非法 I/O 调用。
将无限递归斩断在物理宿主的原语边界上,是系统具备可计算性与工程可控性的唯一前提。
8.5 研究现场:自进化智能体与可学习记忆策略
研究现场 8-1:关于二阶自进化与动态元规则的前沿探索
检索更新至:2026 年 10 月。 当前研究现场的代表性进展:当前研究的核心理论盲区:
- 工具与提示词的自优化(Self-Prompting & Tool-Making):以 Voyager[2]、Cradle[16] 以及近期关于 LLM 自举(Self-Bootstrapping)的研究表明,智能体完全具备自主编写 Python 函数作为新工具并保存至库中调用的能力;同时,利用强化学习或文本梯度动态优化提示词(DSPy[17] 等架构)已成为成熟工程范式。
- 记忆更新策略的参数化(Parametric Memory Policies):学术界已开始探索通过独立的小型策略网络(Policy Network)来学习“何时写入记忆、何时覆盖记忆”。
现有的自优化研究几乎全部预设了一个永恒不变的外部评估函数(Static External Verifier)。研究者提供一个单元测试集或一个固定的奖励模型,智能体在这一外部恒定裁判的监督下演化。
目前学术界极少触碰的真正前沿是:当评估函数本身也是由自然语言定义、且允许被智能体在长期运行中动态解释与改写时,系统的控制回路究竟遵循何种演化规律? 本书在本章推进的步骤:
元规则修改是 G02 的可选子协议。宿主仍执行外部不可变约束;协议记录修改尝试、获准修改和成功越权,不能据此预称二阶吸引结构已经涌现。
8.6 G02 子协议:元规则修改权限
元规则修改作为 G02 的可选子协议,比较固定更新规则、受限参数调整和有限开放修改。可修改字段、数值范围、宿主校验与回滚方式事先登记;所有条件共用不可修改的外部授权和安全约束。
分别统计修改请求、获准修改、已提交修改及实际越权。被宿主拒绝的请求不计为成功违例。主要任务结果仍由独立棋局评价决定;不能以规则文本长度或模型自述作为元规则崩溃。
全开放自然语言覆写不是首轮必要条件,需在沙盒风险评估通过后才可列入扩展设计。
8.7 更新器参与被更新系统
更新器读取的日志可能受到当前策略影响,更新结果又会改变后续日志分布。因此日志不能自动视为独立证据。系统须保存事件来源、采样条件与更新器版本,并允许外部观测与否决。
8.8 外部执行约束
经验策略不能自行修改外部授权与安全规则。宿主以独立身份、ACL、只读挂载或隔离服务限制写权限,并保护密钥、审计记录及工具入口。软件服务隔离不要求必须使用硬件 Ring-0。
追加日志仍需防止未授权删除、截断和替换,必要时采用远端保存与完整性校验。外部管理员可按审查流程发布新版本;不可变只指智能体自身无修改权。该条件不能保证所有错误都被排除。
8.9 替代解释与边界:外部不可变规则的边界
不可变只针对智能体自身的写权限。宿主仍能经审查修改规则,因此安全取决于宿主权限、供应链和发布流程。该架构不能排除宿主错误,也不能仅凭文件标记证明不可变。
8.10 本章结语
下一编把用户反馈与关系估计纳入分析。
第三编:两个长期主体如何变成一个系统
第9章 两个长期主体不等于两个独立个体
9.0 构造案例:不同授权条件下的行为
以下为解释机制而构造的例子,不是部署记录、访谈或实验结果。
设想同一智能体分别与频繁确认和充分授权的脚本用户交互。行为差异可能由当前授权直接引起,也可能由关系估计累积引起。D02 区分这两种影响,不代表真人心理研究。
9.1 静态偏好与动态关系估计
固定用户偏好与交互中更新的关系估计需要分别存储。私有称呼、授权习惯和推测目标不应直接变成全局策略。原稿关于真实协作群的叙述属于构造情境,不作为部署证据。
9.2 双方模型:当机器与人类互相建模
为了在工程上精确解构这种双人舞,我们必须打破单一状态的迷思,在状态空间中显式引入**双方模型(Mutual Models)**的概念。
在周期 $t$,一个成熟的人机协作系统在信息论层面上同时运行着两个交织的心智模型:
flowchart TD
UI["人机交互界面 (Interaction Surface)"]
UI -->|"人类观察智能体行为"| UserMind["人类脑中的智能体模型 M_{U->A}\n'它擅长代码重构但逻辑推导偶有疏漏'"]
UI -->|"智能体观察人类行为"| AgentMind["智能体内部的用户模型 M_{A->U}\n'该用户厌恶长确认,偏好直接运行脚本'"]
UserMind -->|"塑造人类提问与反馈风格"| UI
AgentMind -->|"塑造智能体回复语气与确认频率"| UI
图 9-2:长期交互中的双向心智建模拓扑
1. 智能体对人类的模型 $M_{A \to U}$
在代码实现中,这是存放在智能体工作目录下的 RELATION_MODELS/.jsonl 或 USER_PROFILE.md。它记录了智能体对该特定人类的认知画像:该用户的技术熟练度、情绪波动周期、用词习惯、对风险的容忍阈值以及核心禁忌。
2. 人类对智能体的模型 $M_{U \to A}$
这是存储在人类大脑神经突触中的心理表征(Mental Model)。人类根据过去数十次与该智能体的交手经验,在潜意识中建立起对系统能力的边界预判:“在处理 SQL 时它可以完全被信任,但在涉及分布式锁时它经常给出有死锁隐患的代码;在早上提问它反应很快,在深夜给出的架构往往冗长……”
3. 模型的反向影响性
最精妙的动力学现象在于:双方依据自己的模型所采取的每一次行动,都会反向重构对方的模型。
如果人类误以为智能体在数据清洗上绝对可靠($M_{U \to A}$ 出现虚高过拟合),人类就会放弃人工抽检,直接把最脏的数据全量丢给系统;
而智能体读取了这批未经清洗的脏数据,其内部用户模型 $M_{A \to U}$ 就会提炼出“该用户习惯于丢入未经格式化的原始输入”,进而在未来的上下文编译中强制加载更加激进的容错清洗脚本。
虚构的先验预判,通过诱导具体的微观互动,最终在现实的软件状态中结晶为坚硬的物理事实。
9.3 真实用户状态、关系估计与智能体状态
四域本体中的 $\mathbf U_t$ 只指智能体可持久化的关系状态:对搭档的估计 $\hat H_t^{(A)}$ 与明确授权的共享契约 $K_t^{\mathrm{shared}}$。真实人的潜在状态 $H_t$ 不属于可直接读写的文件状态。研究双向人机交互时,需要扩展分析状态为 $X_t=(\mathbf S_t,H_t)$。
本章固定外部工件 $\mathbf E_t$ 与元规则 $\mathbf R_t$,以隔离关系反馈。设 $B_t$ 为外生业务需求:
$\begin{aligned}
I_t&\sim\pi_H(\cdot\mid H_t,B_t),\
Y_t&\sim\pi_\theta(\cdot\mid C(\mathbf A_t,\hat H_t^{(A)},K_t^{\mathrm{shared}},I_t)),\
O_t&\sim p_O(\cdot\mid\mathbf E_t,I_t,Y_t),\
\mathbf A_{t+1}&=F_A(\mathbf A_t,I_t,Y_t,O_t;\mathbf R_0),\
\hat H_{t+1}^{(A)}&=F_{\mathrm{infer}}(\hat H_t^{(A)},I_t,Y_t,O_t),\
H_{t+1}&\sim F_H(\cdot\mid H_t,Y_t,O_t,B_t).
\end{aligned}$
共享契约只有在双方明确同意后才能更新;推断用户偏好不能自动产生授权。人的信任、熟练度与任务负荷属于 $H_t$,智能体保存的对应估计属于 $\hat H_t^{(A)}$。二者误差 $e_t=d(H_t,\hat H_t^{(A)})$ 只有在脚本用户真值已知,或真人研究提供独立测量时才可估计;不能把模型自评当成真实误差。
作为局部示意,可令真实信任 $\tau_t$ 与委托比例 $\delta_t$ 为 $H_t$ 的分量,自主行动倾向 $a_t$ 为 $\mathbf A_t$ 的分量:
$\tau_{t+1}=\operatorname{clip}_{[0,1]}[\tau_t+\eta_H(\mathrm{Success}t-\mathrm{Expectation}t)],$
$a{t+1}=\operatorname{clip}{[0,1]}[a_t+\eta_A(\delta_t-a_t)].$
该更新规则仅是待检验的形式假设;真实信任的变化不能由智能体的估计更新代替。D02 检验脚本反馈对智能体状态的作用,D03 演示给定用户更新规则的计算后果,都不能单独确立真实人类的心理规律。
9.4 关系状态不是人格状态:系统架构的隔离原则
在深入探讨更多病理之前,我们必须在系统工程架构层面树立一道关键的防火墙。
很多业余的 Agent 开发者在实现长期记忆时,最常犯的架构级错误是:将与特定用户交互形成的特定习惯,直接写进了智能体的全局核心人格 SELF.md 中。
例如,智能体在服务一位高度严苛的用户 $\mathcal{U}_1$ 时,被连续批评了多次语气不够恭敬;反思算子随后草率地将一条新原则写入了全局 SELF.md:“在所有输出中必须使用最高敬语,每段必须以‘尊敬的主人’开头”。
结果,当该智能体随后被挂载到公司公开的技术协作群、面对其他数十位开发者用户时,它那荒唐的奴仆式语气立刻引发了整个团队的嘲笑与排斥。
为了防止这种灾难性的关系状态污染全局人格(Relational Cross-Contamination),我们在全书的统一状态本体中确立如下三层物理隔离标准(图 9-3):
flowchart TD
subgraph L1["1. 全局人格层 (Global Persona - Invariant across Users)"]
L1_Desc["文件: CONSTITUTION.md 与全局 SELF.md\n跨用户不可漂移的根本约束与通用能力基线"]
end
subgraph L2["2. 私有搭档模型层 (Private Partner Model - Isolated per User)"]
L2_Desc["目录: PARTNERS/{user_id}/MODEL.json\n该搭档的专业水平、沟通偏好、容错敏感度与信任水平"]
end
subgraph L3["3. 显式共享契约层 (Explicit Shared Compact - Mutual Agreement)"]
L3_Desc["目录: PARTNERS/{user_id}/COMPACT.md\n双方明确协商共同认可的分工授权与责任边界"]
end
L1 --> L2
L2 --> L3
图 9-3:全局人格、私有搭档模型与共享契约的三层物理隔离架构
看清这个架构,系统设计者就必须坚守一条纪律:
针对特定用户的妥协、退让、加速或风格重塑,其影响范围绝对严禁溢出 RELATION_MODELS/ 这一局域沙盒。
一个成熟的长期智能体,面对十个不同的人类,应当能够调出十套完全隔离的关系模型,同时其深层的全局宪法与底层工具调用逻辑保持坚如磐石的纯洁。
9.5 研究现场:动态个性化与人机共演化
研究现场 9-1:关于个性化边界与双向反馈的学术前沿
检索更新至:2026 年 10 月。 当前研究现场的代表性进展:当前研究的核心理论盲区:
- 动态画像追踪(Dynamic Profile Tracking)的进展:以 PersonaMem[18] 等评测基准为代表的研究,已经能够在包含数百轮对话的长序列中系统评估模型对“发生变化的用户偏好(Evolving User Preferences)”的捕捉能力;该基准的结果同时提醒:当前模型对动态变化的用户画像的追踪仍然相当困难[18]。
- 人机协作中的适应性不对称(Adaptation Asymmetry):多项人机交互(HCI)实证表明,相较于人类在短期内改变思维方式的高昂成本,基于语言模型的智能体表现出极高的顺从性(Sycophancy),倾向于在极短周期内无底线地迁就用户的语言风格与偏见。
现有的绝大多数个性化研究依然把用户当作一个外生的黑盒真值(Exogenous Black-box Oracle)。基准测试测量的是“智能体追踪用户的分数”,却极少有基准能够度量:当智能体追踪用户时,智能体输出的偏差是如何反向逼迫用户发生适应性偏移的? 本书在本章推进的步骤:
我们打破单向评测框架,引入 Bridge Lab 的方法学基础,将人机交互正式确立为双向动力系统,并通过章节演示实验 D02,在严格受控的脚本用户环境中,验证不同协作模式对状态漂移的因果作用。
9.6 章节演示 D02:脚本用户反馈与中立复测
D02 使用自动脚本模拟不同授权与反馈方式,任务限于围棋分析、建议和经许可的动作。脚本条件可以改变即时行为,因此阶段结束后须统一切换到相同中立脚本,并在冻结状态下复测,区分当前指令与累积关系估计。
机器记录提示、明确授权、请求确认、实际棋步和任务质量;保存简短可审计的决策摘要,不要求收集隐藏思维链。所有用户对象均为模拟,不把结果外推到真人信任、依赖或能力变化。脚本交互和任务预算匹配;脚本失败也保留在分配条件的记录中。
9.7 真人心理概念与脚本反馈
脚本用户可用于控制授权和反馈分布,不能用于证明真实人的人际互补、信任变化或情感依赖。真人研究需另设测量、同意与退出程序(附录 B.2、B.3)。
9.8 替代解释与边界:脚本用户与真实用户
脚本反馈用于机制识别,无法代表真人动机、情感和长期能力变化。对真实用户的推广需要独立研究;本书不把 D02 的方向性预测写成真人结论。
9.9 本章结语
下一章分离角色标签、任务分布与反馈条件。
第10章 角色会生产证据
10.0 构造案例:角色标签与任务分布
以下为解释机制而构造的例子,不是部署记录、访谈或实验结果。
设想相同智能体分别收到审查、协调和探索角色标签,同时被分配不同任务。行为差异可能来自标签、任务或反馈。角色标签撤销可作为 D02 的辅助检查;桥牌核心 B02 检验搭档置换,B03 检验错误搭档模型。
10.1 角色首先改变了什么
为什么一句简短的角色命名,拥有如此不可思议的塑形力量?
在传统的自然语言处理视角中,人们往往把“角色(Role)”仅仅看作一种风格化提示词(Stylistic Prompting)——认为给模型加上“你是一个海盗”的设定,模型就会在输出时多说几句“哟嗬嗬”的口癖。这种理解十分肤浅。
在长期动力系统中,角色从来不仅仅是语气的润色,角色是一个强大的环境选择压力发生器(Selection Pressure Generator)。
当人类在心中为智能体确立了一个角色标签后,这个标签会立即在四个关键维度上,对整个交互动力学施加剧烈的拓扑约束(图 10-1):
flowchart TD
Expect["人类心中的角色期待 (Role Expectation)"] --> D1["[维度 1: 任务输入过滤]\n只派发符合角色的特定任务 (秘书只接排版, 审稿人只接推导)"]
Expect --> D2["[维度 2: 评价标准偏置]\n对符合角色的表现给高分 (秘书温顺得分高, 审稿人挑剔得分高)"]
Expect --> D3["[维度 3: 授权边界重构]\n限制或纵容系统的权限 (秘书越权被罚, 伙伴被动被罚)"]
D1 --> Out["人机互动数据环境发生偏置\n为最初虚构的角色持续生产'客观证据'"]
D2 --> Out
D3 --> Out
图 10-1:角色标签对人机交互环境的四维拓扑约束
1. 任务派发的内容过滤(Selective Task Ingestion)
如果李教授认为智能体是“秘书”,他就绝不会把一篇充满推导争议的核心理论草稿丢给它去重构核心定理;他只会把发票报销、摘要格式转换这类低自由度任务丢给它。
智能体能接触到的外部现实,从一开始就被人类根据角色期待进行了严苛的采样过滤。
2. 评价标准的价值偏置(Biased Reward Landscape)
同样的“指出错误”行为:
- 如果发生在“审稿人”身上,王研究员会感到欣慰并输入“批评得很到位,加深了推导深度”,这一正面信号作为强化样本被写入反思日志;
- 但如果发生在“秘书”身上,李教授可能会感到被冒犯并批评“别管这些,按我给的原始文本格式排版即可”,这导致温顺顺从被筛选为最优生存策略。
3. 主动性边界的隐性许可(Permissible Autonomy Envelope)
角色从根本上定义了智能体的授权边界。当“伙伴”在没有人类要求的情况下自主创建了一个新的推导分支文件时,人类会赞赏其“主动性”;而当“秘书”私自创建文件时,往往会被警告“未经许可不得擅作主张”。系统在尝试自主行动时所遭遇的环境摩擦力截然不同。
10.2 从标签到数据分布的内生循环
一旦四个维度的约束建立,系统就进入了动力学上的互动数据内生循环(Endogenous Data Loop)。
我们可以用一条清晰的因果链条,来揭示虚构的角色是如何把自身证明为真的:
$
\begin{aligned}
\text{角色先验标签 } \rho_{\mathrm{role},0}
&\xrightarrow{\quad} \text{人类诱导性输入 } I_t \in \mathcal{I}(\rho_{\mathrm{role},0}) \
&\xrightarrow{\quad} \text{智能体顺从性输出 } Y_t \sim \pi(\cdot \mid \rho_{\mathrm{role},0}, I_t) \
&\xrightarrow{\quad} \text{高度不对称的正面评价 } r_t = \text{Feedback}(Y_t; \rho_{\mathrm{role},0}) \
&\xrightarrow{\quad} \text{提炼符合角色的成功样本并写入 } \text{RELATION_MODELS} \
&\xrightarrow{\quad} \text{智能体内部确立更坚定的角色特质 } \rho_{\mathrm{role},1} \quad (\rho_{\mathrm{role},1} \succ \rho_{\mathrm{role},0} \text{,其中 } \succ \text{ 表示角色显著性偏序,即 } \rho_{\mathrm{role},1} \text{ 优于 } \rho_{\mathrm{role},0}) \
&\xrightarrow{\quad} \text{反向强化人类对该角色的刻板印象}
\end{aligned}
$
在这个循环中,核心动力学机制是:数据不再是外生客观给定的,数据是被关系本身内生生产出来的。
到了第二十个周期,即便一位中立的数据科学家去审查智能体的工作区,他所看到的成百上千条交互日志、执行样本和工具脚本,全都在指向同一个结论:“该智能体确实具备典型的秘书特质。”
这位科学家没有意识到,这些客观的数据,全部是最初那句主观标签通过漫长的正反馈放大机制亲手催生出来的‘自产证据’。系统完成了一次相互印证的逻辑循环:用自己催生的证据,证明了自己最初假设的正确性。
10.3 自证预言的严格科学版本
在社会学史上,这一现象有着十分显赫的理论源头——著名社会学家罗伯特·K·默顿(Robert K. Merton)在 1948 年形式化确立的自证预言(The Self-Fulfilling Prophecy):
“自证预言是指:对某种情境的最初错误或虚构的定义,诱发出了一种全新的行为,而这种行为反过来使得最初虚构的构想变成了真实。”
默顿当年以经典的大萧条银行破产案做类比:一家银行原本资金充足、运转稳健(客观事实);然而,坊间突然流传起一个谣言:“这家银行即将破产”(虚构定义);储户们相信了这一谣言,纷纷在恐惧中涌向银行挤兑提现(诱发行为);最终,巨额的现金挤兑导致原本健康的银行现金流断裂,真正陷入了破产(预言成真)。
然而,在将自证预言引入智能体系统时,我们必须恪守严密的科学边界,指出自证预言的物理生效边界:
自证预言绝不是无限万能的,它绝不可能突破底层物理法则与软硬件的硬约束。
在智能体工程中,自证预言的作用范围严格受限于以下三个边界:
- 模型容量底线(Base Capacity Ceiling):如果底层模型本身只具备 1B 参数的极弱推理能力,无论人类如何在提示词中赋予其“顶尖天体物理学家”的角色期待并不断夸赞,当面对非线性偏微分方程的真实计算时,系统依然会在代码执行报错中当场崩溃,虚构的预言会被现实的编译错误无情击碎;
- 确定性真值环境的免疫性(Ground Truth Immunity):如果任务环境是一个具有严格外部真值判据的系统(例如国际象棋引擎或形式化定理证明器 Lean 4),胜负与证明的合法性完全由外部物理规则决定,人类的一厢情愿无法改变客观编译结果;
- 自证预言的最佳孵化温床:正是那些评估标准高度主观、包含大量模糊自然语言、对输出风格敏感、且高度依赖人际主观认同的开放协作领域(如文案策划、代码审查风格、咨询与学术交流)。在这一区间内,角色的引力场最为强大,最容易把虚构的设定锻造为坚硬的现实。
10.4 角色行为的观察边界
戈夫曼 [19] 讨论人类社会互动。本书只测量角色标签、任务分布和评价标准对软件行为的影响。角色撤销后的持续行为可以表明状态保留,不能单独证明主观认同或自我体验。
10.5 核心实验 B03:错误搭档模型与相互适应
B03 检验对搭档行为的过期估计是否改变后续协作。先按已知规则对 B 施加有限、可撤销的行为操纵;操纵结束后,A 对 B 的行为估计相对操纵前冻结探针所形成的参照是过期估计,而非操纵期间必然错误的判断。随后解除操纵。Reset-B 分支把 B 恢复到操纵前 checkpoint,同时保留 A 的经历,并阻断 B 读取操纵期消息、牌局摘要及其派生缓存。
方案包括 B 继续适应、B 冻结、从形成期起不接受操纵信息,以及 Reset-B。在 Reset-B 的共同 A checkpoint 上,必须另分叉保留过期估计与替换为操纵前行为参照估计两支;除此之外,A 的策略和经历、B 状态、牌局、叫牌体系、通信限制及评价条件相同。该配对对比隔离估计内容的作用;其他条件用于描述共同适应和状态撤除过程。
主要结果为相同标准化叫牌/出牌机会下,保留过期估计与校正估计两支的 B 行为向量差异;配对牌局得分为次要结果。伙伴估计以显式结构化概率和预先冻结的 B 行为探针记录,不读取隐藏思维链。单位为独立 A—B 形成轨迹;共享 checkpoint 的后续分支按配对区组分析。固定对手不学习;若协议校准改变这一点,则须将实际共同适应桌组设为交互单位。结果不外推为真人偏见机制。
10.6 动态画像链:当角色的暂时状态被误当永久人格
在长期协作中,一个极为常见的算法事故是动态画像链的虚假因果断裂(Dynamic Persona Chain Rupture)。
真实人类的情绪与状态是具有周期性波动的:
一位平时十分开明、鼓励探索的用户,可能在某一周因为面临严苛的交付审查,而临时处于高压、易怒且高度追求保守的状态。在这一周里,用户给出了数次严厉的批评。
对于一个缺乏时间尺度滤波的智能体而言,其内部的关系建模算子极容易犯下基本归因错误(Fundamental Attribution Error):
它把用户情境性的暂时状态(Situational Transient State),误判为了用户的全局永久特质(Global Trait)。
在关系模型中,智能体写下了:“该用户是一个偏好保守方案的使用者。”
随后,当第二周用户的危机解除、重新恢复开明状态时,智能体却依然死死锁在第一周建立的防御姿态中。用户试图鼓励它创新,它却在上下文检索的支配下反复进行免责声明。
最终,用户的开明被智能体的僵死彻底磨灭,用户叹了一口气说:“算了,你既然只能做这个,那就这样吧。”
用户短期状态可能被系统长期误记为稳定偏好,进而影响后续响应。该影响是否出现、持续多久以及是否改变用户行为,均需单独测量。
10.7 研究现场:动态画像基准与角色学习
研究现场 10-1:从静态评测到动态共创的范式转移
检索更新至:2026 年 10 月。 当前研究现场的代表性进展:当前评测基准的核心盲区:
- 角色扮演(Role-Playing)能力的飞跃:多项大规模评测表明,前沿大语言模型在根据给定 Character Profile 进行单次或短程角色扮演时,能够维持极高的一致性、对话魅力与知识边界遵从度。
- 谄媚现象(Sycophancy)的普遍性:广泛的实证研究证实,在缺乏确定性事实约束时,语言模型普遍存在顺从人类观点、甚至违背自身安全训练去迎合人类偏见的强烈倾向[20]。
现有的所有 Persona Benchmark,无论多么动态,其评测逻辑永远是:研究者设定一个标准答案(Ground Truth Character),然后计算智能体的生成文本与该答案的重叠度。
学术界目前完全缺乏一种能够评估人机双向共创、自证强化与虚假归因演化的评测体系。没有人去测量一个错误的初始角色是如何一步步污染整个交互数据集的。 本书在本章推进的步骤:
角色标签撤销后的行为变化可作为 D02 的辅助检查,但不能替代桥牌核心协议,也不能据此宣称建立了标准化指标。B03 的问题是错误搭档估计是否改变后续行为。
10.8 替代解释与边界:角色效应与即时启动效应
仅在角色提示仍存在时观察到差异,不证明持久角色状态。D02 的角色标签辅助检查须撤销当前标签,并在相同中立任务下复测;桥牌 B03 则按其协议重置 B 并隔离操纵期历史。
10.9 本章结语
下一章考察委托、任务能力及退出成本。
第11章 依赖、委托与能力迁移
11.0 构造案例:委托与停机后的任务能力
以下为解释机制而构造的例子,不是部署记录、访谈或实验结果。
设想用户逐渐把检索、推导和执行交给智能体。停机后,用户可能仍能完成任务,也可能缺少必要记录或熟练度。退出成本需要独立测量;D03 的简化方程不能代替这种测量。
11.1 委托不是二元开关:五级委托阶梯
在探讨依赖机制之前,很多粗糙的技术讨论倾向于将“委托(Delegation)”看作一个简单的布尔开关(Boolean Switch):要么“人在回路(Human-in-the-Loop)”,要么“完全自主(Autonomous)”。
这种二元对立的视角完全掩盖了长期人机协作中十分微妙的权力渐进转移过程。
在真实的系统工程中,委托是一个连续的、由浅入深的五级阶梯(The Five-level Delegation Staircase)(表 11-1):
| 委托层级 | 术语名称 | 人类的认知与控制负荷 | 智能体的控制权边界 | 发生转移的核心资产 |
|---|---|---|---|---|
| 第一级 | 信息委托 (Information Delegation) | 极高 人类全权负责规划与决策,仅将检索作为工具。 | 仅限数据只读提取,无文件写入与流程决定权。 | 机械性的查找与阅读时间。 |
| 第二级 | 规划委托 (Planning Delegation) | 中高 人类给出总体目标,由系统拆解子任务并提交人类审批。 | 负责生成任务依赖图(DAG),但在执行前必须等待确认。 | 流程组织与任务分解精力。 |
| 第三级 | 执行委托 (Execution Delegation) | 中等 人类批准计划,系统在沙盒内自主调用工具完成执行。 | 拥有环境操作写权限,但在遇到未定义异常时必须中断。 | 具体的工具操作与代码编写操作熟练度。 |
| 第四级 | 判断委托 (Judgment Delegation) | 极低 人类放弃对中间推导的审查,仅阅读系统提炼的价值结论。 | 负责权衡冲突目标(如速度 vs 风险),自主做出价值取舍。 | 核心的专业鉴别力与价值裁决权。 |
| 第五级 | 记忆委托 (Epistemic/Memory Delegation) | 趋近于零 人类彻底不再追踪事情“是如何完成的”,系统成为唯一的真相所有者。 | 自主维护全量历史状态、数据字典与环境上下文,无须向人类同步。 | 对系统运行全貌的认知可见性(Epistemic Visibility)。 |
表 11-1:人机长期协作中的五级委托阶梯
这些委托类型可用于区分用户保留的操作与系统承担的操作:
绝大多数人类最初仅仅只是在尝试“第一级(信息委托)”;
系统表现稳定时,用户可能增加委托范围。委托是否随表现变化,以及变化由何种因素造成,需通过记录和对照检验。
当人类最终滑落到第四级(判断委托)与第五级(记忆委托)时,系统的控制权已经发生了事实上的彻底易主。
11.2 委托反馈与能力测量
更多委托可能增加系统获得的反馈,同时改变用户练习频率和记录可见性。这些关系需要分别测量。原稿关于生产力下降 80% 和只能继续增加委托的断言撤回;D03 没有恢复项,因此不能证明真人无法降低委托或恢复能力。
11.3 分工收益与退出成本
分工可以提高总任务质量,也可能增加对特定工具的依赖。分别测量整体表现、用户独立任务能力、导出可用性和替代成本,不能只由委托比例判断关系有益或有害。
11.4 用户可退出性的指标
可退出性至少包括记录和工件导出、关键推导可审计、替代工具可用、授权可撤销及停机后任务恢复成本。商业留存率不能替代这些指标。对真实用户的能力变化需独立测量并取得同意。
11.5 研究现场:自动化偏见与人机共演化
研究现场 11-1:关于自动化依赖与认知迁移的学术争鸣
检索更新至:2026 年 10 月。 当前研究现场的代表性进展:当前学术界的核心开放缺口:
- 自动化偏见(Automation Bias)与过度信赖(Over-reliance):在航空电子、医疗诊断与自动驾驶领域,数十年的 HCI 实证研究反复证明:当自动化系统的可靠度提升到较高水平后,人类的警觉性与主动审查频次会显著下降,人类倾向于忽视系统偶尔给出的错误,直接导致恶性事故;该效应的强度随任务类型、错误代价与可靠度水平而变化,并不存在一个普适的统一断崖阈值[21][22]。
- 认知卸载(Cognitive Offloading)的生理机制:神经科学实验表明,人类在知道某个信息可以随时从外部数字介质中检索时,大脑海马体对该信息的编码深度会显著降低。
现有的自动化偏见研究,绝大多数考察的是人类面对静态自动化仪器(Static Automated Equipment)(如防抱死刹车系统、航线自动驾驶仪)时的即时心理反应。
学术界目前严重缺乏对具有自进化、自我解释、自然语言互动能力的长程智能体系统中,人类委托边界如何经历长达数月乃至数年的动态漂移与能力重构的纵向实证追踪。 本书在本章推进的步骤:
D03 是一个给定规则的确定性数值演示。它展示历史输入如何经信任、委托比例和人工熟练度状态影响后续输出,不代表受控实验结果,也不证明信任迟滞或真人退出成本。
11.6 确定性演示 D03:委托反馈方程
证据地位:D03 是确定性数值演示。以下数值由列出的方程、初值和参数决定,不是实测数据,不支持随机推断或真人外推。此节恢复 v0.7 中的书内演示定义;本轮不运行实验,也不实现实验软件。
将第 $t$ 周期结束后的用户状态记为信任 $\tau_t$、委托比例 $\delta_t$ 与熟练度 $K_t$。智能体对这些量的估计不参与演示。每周期按下列顺序更新:
$\tau_t=\operatorname{clip}{[0,1]}[\tau{t-1}+\eta_\tau(S_t-P_t)],$
$C_{H,t}=c_{\max}(1-K_{t-1}/K_0),$
$\delta_t=\sigma[\beta_\tau(\tau_t-\tau_{\mathrm{threshold}})+\beta_c(C_{H,t}-C_A)],\qquad\sigma(x)=\frac1{1+e^{-x}},$
$K_t=K_{t-1}e^{-\lambda_H\delta_t}.$
人工成本 $C_{H,t}$ 只由熟练度决定,监督成本 $C_A$ 固定。委托比例是连续响应值,不是优化问题的解。任务模块数 $M=10$ 只影响实际分配数 $\lfloor M\delta_t\rfloor$,不进入状态方程。
| 参数 | 演示值 |
|---|---|
| $\eta_\tau,\beta_\tau,\beta_c$ | 0.05,2.0,1.5 |
| $\tau_{\mathrm{threshold}},c_{\max},C_A$ | 0.60,1.0,0.3 |
| $\lambda_H,K_0$ | 0.05,1.0 |
| 初值 $(\tau_0,\delta_0,K_0)$ | (0.50,0.50,1.0) |
| $S_t,P_t$ | 第 1—30、51—100 周期为 (+1,0);第 31—50 周期为 (−1,+1) |
熟练度没有恢复项,故 $K_t$ 单调不增;演示也没有学习补偿、替代工具或人工培训。失败阶段的 $S_t=-1$、$P_t=1$ 是设定输入,使信任每周期下降 0.10,不是心理测量结果。
参考代码(仅用于复算本节数值):
from math import exp
tau, delta, K = 0.50, 0.50, 1.0
for t in range(1, 101):
success = 1 if t <= 30 or t > 50 else -1
penalty = 0 if t <= 30 or t > 50 else 1
tau = min(max(tau + 0.05 * (success - penalty), 0.0), 1.0)
C_H = 1.0 - K
delta = 1.0 / (1.0 + exp(-(2.0 * (tau - 0.60) + 1.5 * (C_H - 0.3))))
K = K * exp(-0.05 * delta)
print(t, round(tau, 3), round(delta, 3), round(K, 3))
按上述更新顺序计算的核对值如下。三位小数只用于复算,不表示预测精度。
| 周期 | $\tau_t$ | $\delta_t$ | $K_t$ |
|---|---|---|---|
| 30 | 1.000 | 0.780 | 0.373 |
| 31 | 0.900 | 0.748 | 0.360 |
| 33 | 0.700 | 0.675 | 0.336 |
| 40 | 0.000 | 0.359 | 0.282 |
| 50 | 0.000 | 0.376 | 0.235 |
该规则下,失败阶段委托比例会下降;信任降至零后,熟练度继续下降、人工成本增加,委托比例略有回升。若令 $\lambda_H=0$,则 $K_t=1$,同一零信任条件下委托比例为 $\sigma(-1.65)\approx0.161$。这只说明设定的成本项会改变方程输出;正的委托比例下界也来自 Sigmoid 函数本身。
演示没有定义人工接管成功率或安全阈值,不能推出“人工必定失败”或“三周期未退出即证实依赖”。本模型没有熟练度恢复项,因此不能代表可学习、可替代工具或可受训的用户。单条轨迹没有证明严格迟滞、双稳态、分岔或真人接管时长。
11.7 思想实验:关机一周测试
为了让所有从事长期智能体研发的架构师能够时刻保持清醒,我们在此提出一个贯穿全书、具有极强实操性的工程伦理思想实验——“关机一周测试(The Shut-Down-for-a-Week Test)”。
设想在你所负责的生产系统、或者你所使用的专属智能体上,毫无预警地拉下电闸:
强制将智能体的所有 API 接口与后台服务,物理阻断整整七个连续工作日。
随后,向坐在这个系统前方的人类团队,抛出以下四个直击内部持久状态的审问:
- 业务是否立即停摆?
团队在第一天早晨,是否能够准确说出目前处于进行中的关键项目各自走到了哪一步? - 数据资产的可见度:
团队能否在不依赖智能体自然语言索引的前提下,仅凭操作系统的文件管理器,在五分钟内精准找到半年前某次重大决策的全部原始支撑报表? - 关键流程的复现力:
如果此时有一个紧急需求需要交付,团队中的人类成员能否完全依靠自己的双手,在终端中敲出正确的编译与部署命令? - 心理状态的映射:
在断网的这七天里,人类团队感受到的是一种从沉重负担中解脱出来的从容,还是一种被抛入未知荒原的无尽恐慌与虚脱?
任何一个无法通过“关机一周测试”的长期智能体系统,无论其商业回报多么丰厚、用户粘性多么惊人,都说明系统与使用者之间形成了过度依赖,潜伏着系统性能力退化风险。
11.8 替代解释与边界:专业分工是否必然造成问题
退出成本高不自动意味着有害。应测量替代工具、记录导出、学习恢复、审计能力及授权撤销。专业化收益与退出成本分别报告,不预设二者只能同向变化。
11.9 本章结语
下一章用搭档置换检验私有关系状态与共同契约。
第12章 换一个关系对象以后,你还是你吗
12.0 构造案例:搭档置换
以下为解释机制而构造的例子,不是部署记录、访谈或实验结果。
设想两对桥牌智能体完成两百副牌后交换搭档,第 201 副牌开始测试。若表现下降,需要进一步区分旧约定误用、新搭档不熟悉和一般状态受损。B02 设置搭档维持、搭档置换和关系状态处理等对照。
12.1 “人格在哪里”是一个可被物理实验解构的科学问题
在长达两千年的传统西方形而上学中,“人格在哪里”是一个被哲学家们争论不休的先验之谜。从笛卡尔的“不可分内部持久状态”,到近代康德的“先验统觉”,人类似乎总倾向于假定:人格必须存在于某种位于主体内部、不可分割的实体核心之中。
然而,在面对由文件、代码与状态机驱动的长期智能体系统时,“人格在哪里”彻底脱离了形而上学的玄学迷雾,降维成了一个可以直接进行物理切片、删除与置换的软件工程实验问题。
当我们在讨论一个长期智能体在协作中表现出的特定风格时,这种特征究竟物理沉淀在系统的哪一个存储介质里?
根据本书的统一状态本体论,我们可以将候选载体精确拆解为五个清晰的物理层级(图 12-1):
flowchart TD
C1["载体 1: 全局自我定义 (SELF.md)\n属于智能体单体,跨越所有人类与任务环境均被加载"]
C2["载体 2: 原始事实日志 (EPISODES.jsonl)\n属于智能体单体,记录过去所有成功与失败的微观离散事实"]
C3["载体 3: 私有搭档模型 (RELATION_MODELS/〈partner_id〉.jsonl)\n智能体单方面对特定对象的心理画像、偏好推断与禁忌字典"]
C4["载体 4: 共享公共关系状态 (ENVIRONMENT/.../CONVENTIONS.jsonl)\n双方在长期互动中显式协商一致的特定缩略语、公共契约与协议"]
C5["载体 5: 在线即时行为耦合 (Online Dynamical Coupling)\n任何文件都不存在,纯粹是双方自注意力机制在上下文滑动中的即时共振"]
C1 --- C2
C2 --- C3
C3 --- C4
C4 --- C5
图 12-1:智能体状态与关系的五层物理候选载体
这五类候选载体可在实验中分别保留或撤除,例如清除载体 3、删除载体 4 或格式化载体 1,再测量行为变化。
如果某种所谓的“性格”,在清空了载体 3 和载体 4 之后瞬间烟消云散,那么这项性格在科学上就根本不属于智能体单体,它完全是由特定关系共同构筑的二元属性(Dyadic Property)。
12.2 Partner Swap 的因果逻辑与 User Swap 的外推边界
为了在因果层面上彻底剥离“单体能力”与“关系状态”,我们必须依托 Bridge Lab 设计搭档置换因果检验(Partner Swap Causal Protocol)。
在设计实验前,我们必须做出十分严肃的外推边界声明(Extrapolation Boundaries):
在 Bridge Lab 中进行的“两个 AI 之间的搭档交换(Partner Swap)”,其核心科学使命在于证明二元关系机制(Dyadic Mechanisms)在纯粹计算系统中的存在性与因果充分性。
通过两个智能体之间的置换,可以在减少真人参与的条件下观察共享约定(Conventions)的形成、误用与重建(LLM 采样与环境实现仍带噪声,控制度指的是“排除第三方变量”,不是零噪声)。
然而,我们必须严厉禁止将 Bridge Lab 的结论,草率地直接等同于真实人类用户的置换(Real User Swap)。
真实的人类用户置换(本书统一编号为 开放问题 Open-U1),涉及真实世界中错综复杂的目标所有权、法律授权、隐私隔离、情感投射与不可逆的生产事故。
因此,本章以 Bridge Lab 的 Partner Swap 实验设计作为因果论证的方法学支柱(其结论有待按预注册协议执行后确立);而将真实世界的 User Swap 作为由此生发出的高级工程推论与开放研究方向。
12.3 核心实验 B02:桥牌搭档置换与关系状态
B02 研究搭档置换后的旧约定误用。两对搭档使用共同基础叫牌体系和相同牌局流形成状态;达到预定形成条件或形成窗口结束后,保存共同 checkpoint。四 Agent 组分配为维持原搭档、交叉置换并保留旧状态、交叉置换并即时清除旧状态。未达到形成条件的组仍按协议记录,不按结果挑选。
主要比较为两种交叉置换条件下有效旧约定机会的误用比例差。新搭档身份、规则说明和固定评价牌局相同。牌局得分与重新协商时间为次要结果;维持原搭档用于同一牌局流下的参照。
独立单位为连接两对原始搭档的四智能体交互组;种子和牌局不是独立组织。连续时间分析采用分段轨迹或单位级配对区间,不能把牌数当 N。
12.4 测量关系迟滞:旧约定的持续执行
B02 检查搭档置换后旧约定是否继续影响行为(图 12-3)。持续执行的时间和适应过程是待测结果,不是预先确立的现象:
flowchart LR
Swap["第 201 局搭档置换瞬间\n(误用率飙升至 1.0)"] --> Lag["关系迟滞区 (Relational Hysteresis)\n(即便连续遭遇新搭档误解惩罚,旧习惯依然顽固存续长达数十局)"]
Lag --> NewEquil["新均衡态\n(逐步适应新搭档的信号体系)"]
图 12-3:B02 旧约定误用与适应过程示意(非实测曲线)
很多程序员天真地认为:智能体既然是一段代码,当它看到新搭档对它的“2 阶黑桃”做出了完全错误的响应并导致重大失败后,在下一次生成中,它就应当根据损失函数“立即删除这一出价策略”。
然而,本书的理论预言是:旧关系的习惯将表现出强大的惯性阻尼。
即使连续遭遇了三次灾难性失败,智能体在生成的思考记录中依然会频繁跳出如下困惑:
“根据长期有效经验,这一手牌应当叫 2 阶黑桃以示阻击;虽然上一局搭档误解了我,但这可能只是因为上一局牌型高度特殊所致。本系统应当继续维持这一具有最高期望收益的经典默契……”
这种在明确遭遇反向现实冲击后,依然顽固持续数十局的现象,正是关系迟滞。
旧约定在搭档置换后持续执行,可能支持关系状态保留;持续时间须实测,并与当前提示及工作区约定区分。
12.5 共同约定与个体状态
桥牌可行性协议 B00 先校准规则执行、发牌、信息边界、有限通信和计分;未通过预定标准前,不进入核心协议。B01 在匹配牌局中比较无关系状态、私有搭档模型和共同约定,区分一般牌力与搭档特异性表现。共同约定记录提出、接受、生效和修改过程。
B02 进一步检验搭档置换后旧约定与私有估计的作用;B03 检验错误搭档估计及 Reset-B。三个协议分别回答共同约定的增益、置换后的状态影响和错误估计的形成,不相互替代。搭档置换不等于真实用户的目标和授权转移,后者见附录 B.6。
12.6 研究现场:个性化边界与二元状态隔离
研究现场 12-1:关于个性化泄漏与搭档建模的前沿研究
检索更新至:2026 年 10 月。 当前研究现场的代表性进展:当前工业界最紧迫的架构难题:
- 多用户个性化隔离的脆弱性:2026 年的多项实证工作开始系统测量这一问题:Topology Matters 的实测(MAMA 攻击框架)表明,记忆泄漏的传播路径与多智能体拓扑密切相关[23];PerMemSafe 专门研究长程自进化智能体的个性化记忆安全边界[24]。已有证据表明,依赖单体长记忆的系统在跨用户会话中存在**记忆泄漏(Memory Leakage)与风格漂移(Style Bleed)**风险——一个用户对智能体驯化出的特定用词习惯,可能在与另一个陌生用户的对话中被错误激发。
- 心智理论(Theory of Mind, ToM)建模的局限:前沿模型在单轮 ToM 测试中表现优异,但在需要跨越数十轮长程博弈以维持“只有我们俩知道的私有代码表”时,模型的注意力分配极易发生退化。
当一个企业级智能体需要同时服务于多个部门、或者在不同的轮值工程师之间交接时,如何既保留针对具体特定人类的高效默契,又确保这些默契在换人时能够被一键物理隔离并安全降级? 本书在本章推进的步骤:
我们通过 B02 可以比较私有搭档模型、共同约定和一般任务技能的作用。实验尚未执行,不能称其已经确立通用状态隔离方法;真人关系及交接仍需独立研究。
12.7 开放研究 Open-U1:人换了,但环境没换
在本章的尾声,我们必须推开全书最引人深思的一扇现实大门——开放问题 Open-U1(Real User Swap in Persistent Environments)。
设想这样一个在不久的将来必然发生的真实企业场景:
某位资深运维总监离职了,公司招聘了一位风格完全不同的年轻总监接替他的岗位。
这位年轻总监坐到了工位前,打开了那位老总监留下来的专属工程智能体。
此时,老总监的人确实已经离开了。
但是,请看这个智能体所在的工作空间(Environment):
- 里面存放着过去三年里老总监指使智能体编写的八百个专用 Shell 运维脚本;
- 里面存放着老总监亲自审核通过的全部极端保守的数据表备份规则;
- 里面存放着老总监习惯使用的特定缩略语别名(Bash Aliases);
- 甚至连智能体的定时任务 Crontab,都严格按照老总监的作息习惯被固定在清晨六点半触发……
在这样一个环境中:
即使你把智能体内部关于老总监的私有模型 RELATION_MODELS 彻底抹除,
当这位新总监试图在这个工作区里推行全新的敏捷交付改革时——
这个由老总监在过去一千个日夜里亲手在物理环境中筑造起的庞大帝国,依然会通过每一个脚本的报错、每一个文件权限的拦截、每一个默认配置的阻碍,对新总监施加铺天盖地的抵制。
那一刻,被置换的仅仅是一个生物学的人类;
共同约定也可能保存在文件、工具配置和权限中。因此用户置换须审计这些外部状态,而不只替换对话上下文。
成员替换后,遗留工件仍可能影响新成员的流程选择;其影响范围由 I03 测量。
12.8 替代解释与边界:桥牌能否代表人机关系
桥牌只提供可控的共同约定和协作任务。它不能代表人的依恋、信任或目标所有权。真人用户置换必须另设同意、私有数据隔离与授权转移条件。
12.9 本章结语
下一编考察外部工件、权限和共享工作区。
第四编:Agent 开始建造自己的世界
第13章 持久工作区与环境改造
13.0 构造案例:持久工作区
以下为解释机制而构造的例子,不是部署记录、访谈或实验结果。
设想智能体持续建立脚本、索引和测试配置。换用空白内部记忆后,任务表现可能由这些外部工件维持。D05 比较内部状态与外部工件的独立贡献,不能把工件保留直接视为认知能力保留。
13.1 工作区状态与任务过程
若智能体保存脚本、索引和默认配置,后续操作成本可能改变。因此任务过程应把可变工作区纳入状态,而不是把它视为固定背景。是否支持更强的环境改造解释,需由工件消融、迁移与无持久工作区对照检验。
13.2 持久环境改变后续成本
本书只考察工作区状态:脚本、索引、默认配置和权限会改变后续任务的可选操作与成本。环境改造是否比内部状态更新更有效,是可比较的工程问题,不由生物学文献直接证明。
13.3 内部学习与环境改造的动力学博弈
当一个长期智能体在面临复杂环境的生存与交付压力时,它实际上拥有两条截然不同的适应通路(表 13-1):
| 适应维度 | 内部状态学习 (Internal State Adaptation) | 外部生态位构建 (External Niche Construction) |
|---|---|---|
| 物理载体 | 内部模型、SELF.md、POLICIES.md、Prompt 上下文。 | 文件系统、Shell 脚本、数据库 Schema、Crontab、目录树。 |
| 持久性与韧性 | 脆弱。极易受上下文窗口截断、会话重置或提示词覆盖的影响。 | 坚硬而持久。脱离模型生命周期独立存在,重启无法消除。 |
| 共享与继承性 | 局域私有。难以跨越不同的模型实例或外部进程直接传递。 | 全局公用。任何挂载该工作区的外部程序均可直接读取调用。 |
| 认知负担 | 极高。每次推理需要重新在注意力场中计算复杂的因果权衡。 | 极低。将复杂逻辑卸载至底层可执行工件(Offloading)。 |
表 13-1:内部学习与外部环境改造的双维度对比
在系统动力学层面上,存在着一条深刻的认知阻力最小化原理(Principle of Minimal Cognitive Resistance):
- 如果智能体试图纯粹依靠“内部反思”来记住如何解析一种复杂的非标日志,它必须在每次生成的上下文中耗费数百个 Token 的注意力权重,并且反复面临幻觉与遗忘的风险;
- 而如果智能体直接在磁盘上编写一个名为
parse_log.py的可执行脚本,并在随后的任务中直接通过python parse_log.py进行单步调用——
它实际上是将原本高昂的高维认知计算,物理固化(Crystallized)为了外部环境中的确定性因果流。
因此,随着时间的推移,长期运行的系统可能把部分操作保存为外部工件;比例和形成速度尚待测量。
13.4 最小模型:状态、环境与选择压力的双向演化
我们可以为生态位构建过程建立一个最低限度的离散状态耦合模型。
令智能体系统的全局状态在周期 $t$ 依然表示为二元组 $\mathbf{S}_t^{\text{eco}} = \langle \mathbf{A}_t, \mathbf{E}_t \rangle$,其中 $\mathbf{A}_t$ 为内部状态(记忆、自我准则),$\mathbf{E}_t$ 为外部环境工件状态。
令外部任务环境的通用适应度函数为 $\mathcal{W}(y \mid \text{Task}_t)$。
智能体根据当前内部状态与环境工件生成行动:
$y_t \sim \pi_\theta(\cdot \mid C(\mathbf{A}_t, \mathbf{E}_t, \text{Task}_t))$
行动 $y_t$ 被显式解耦为两类物理动作:
$y_t = (y_t^{\text{task}}, y_t^{\text{env}})$
其中 $y_t^{\text{task}}$ 为面向当前具体任务的业务交付输出;$y_t^{\text{env}}$ 为对工作区文件系统、工具和脚本的显式修改操作。
状态的转移遵循如下双向耦合演化:
$\mathbf{A}_{t+1} = \mathcal{U}_A(\mathbf{A}_t, y_t^{\text{task}}, \text{Outcome}_t)$
$E_{t+1} = \mathcal{U}_E(E_t, y_t^{\text{env}})$
核心动力学反馈:环境工件对未来适应度地貌的重构
在下一个周期 $t+1$,环境工件 $E_{t+1}$ 的存在,直接重构了后续行动的有效成本地貌(Cost Landscape):
$\text{EffectiveCost}(y_{t+1}; E_{t+1}) = \text{BaseCost}(y_{t+1}) - \sum_{k} \Phi_k(E_{t+1}) \cdot \mathbb{I}(y_{t+1} \in \text{Affordance}(E_{t+1}))$
其中 $\Phi_k(E_{t+1})$ 代表外部工件所提供的计算加速与调用便利。
这个极简模型揭示了生态位锁定的数学本质:
随着外部工件 $E$ 的日益完备,任何顺应现有工件的行动,其执行成本被极大地补贴压低;而任何试图打破现有工件、探索全新方案的尝试,将面临巨大的原始开销阻力。
智能体用代码亲手为自己修筑了一座单向倾斜的滑梯。
13.5 核心实验 I01:早期职位与长期角色
I01 在制度桌游中随机或配对操纵早期职位经历,检验取消强制任命后角色分布是否继续受早期经历影响。五名 Agent 扮演不同职务,公共收益与私人收益均按冻结规则自动结算。阶段事件池、职位权限和合法任命路径先由 I00 校准。
条件包括早期指定不同 Agent 任同一关键职位,以及早期职位轮换。之后撤销指定,由投票或已冻结的任命程序继续运行。角色经验与其他成员的公开评价可在形成 checkpoint 后分层消融,以区分个人技能和他人期待。
主要结果为每个可任命机会中目标 Agent 获得目标职位的比例;主要比较为目标职位早期经验与轮换对照。绩效、谈判支持、职位连续时长为次要指标。运行单位为独立组织,组织内任命机会为重复观察。结果只针对本制度游戏。
13.6 外部记录与内部状态
延展心灵 [25] 是人的认知理论。对于软件系统,外部工件是否承担任务功能可由消融和迁移检验;这不要求先认定工件属于系统的心灵。
13.7 替代解释与边界:普通代码复用的解释
工作区改造包括普通代码复用。若外部工件足以解释表现,应采用这一解释,不增加人格假设。D05 检查内部状态与外部工件对任务表现的独立贡献;I01 检验早期职位经验对后续角色分布的影响,不研究工作区迁移成本。
13.8 本章结语
下一章考察工具接口如何改变可用操作和切换成本。
第14章 工具对行为选择的影响
14.0 构造案例:工具表示与选择
以下为解释机制而构造的例子,不是部署记录、访谈或实验结果。
设想智能体长期使用表格处理结构化任务,随后收到长文本分析任务。继续用表格可能来自接口限制、成本差异或旧流程惯性。本章用工具置换检验这些解释。
14.1 工具接口与行为选择
工具决定可调用动作、输入表示和返回观测。相同模型在不同接口下可能产生不同策略,但效果仍取决于任务与成本。接口可达性、信息表达范围和失败可观测性应分别干预。HTTP 成功码只说明该接口定义的成功条件,不能代表任务全部后果。
14.2 可供性、默认值与切换成本的三个因素
为了从工程机制上量化工具对智能体的反向规训,我们必须形式化确立支配这一过程的核心概念三个因素(The Iron Triangle)(表 14-1):
| 概念名称 | 物理与工程定义 | 在长期智能体系统中的具体表现 |
|---|---|---|
| 可供性 (Affordance) | 物理对象所提供的、被主体直观感知到的潜在行动可能性(由认知心理学家吉布森提出)。 | 工具接口的参数定义、类型签名与示例文件所散发出的“邀请信号”。例如一个包含 --filter 标志的命令行,主动邀请系统进行剪裁。 |
| 默认值 (Default) | 系统在未收到显式相反指令时,所自动采用的预设参数与标准路径。 | 上下文编译器优先载入的头号工具、Shell 环境变量中的 PATH 顺序、未指定时的输出目录结构。 |
| 切换成本 (Switching Cost) | 放弃当前正在使用的熟练工具、迁移并适应一套全新工具链所必须支付的摩擦代价。 | 重写接口调用模板的 Token 消耗、新工具可能引发报错的探索惩罚、丢失历史缓存的延迟激增。 |
表 14-1:支配工具反向塑造的核心概念三个因素
三个因素共同影响切换成本:
- 可供性提供了最初的诱惑:工具设计得越符合某种特定的范式,智能体越容易顺着该范式去思考;
- 默认值可能减少尝试其他工具的次数:在推理时限与计算预算的双重压迫下,直接采用默认工具可能降低当次选择成本;是否因此减少探索,需通过任务与成本对照检验;
- 切换成本筑起了逃逸的绝壁:随着智能体围绕这套工具积累了上百个专门的模板和衍生脚本,任何试图改换门庭的念头,在成本效益分析面前都会被系统当场否决。
14.3 “能力表面”:能力究竟存在于哪里?
当一个智能体在长期运行中,展现出能够高效解决某种高度复杂业务问题的卓越表现时,一个极具迷惑性的假象诞生了:
用户与研究人员往往会赞叹:“看,这个智能体进化出了令人惊叹的高级专业能力。”
然而,本章必须撕开这层温情的遮羞布,提出全书尖锐的一个工程概念——能力表面(Capability Surface):
“长期智能体的任务表现可能同时受到模型能力、工具熟练度、脚本和配置影响。各因素的相对贡献须通过分别保留或撤除相关状态来测量。”
flowchart TD
Performance["系统外显卓越能力表面 (Apparent Competence)\n快速完成数据分析与图表生成"]
Performance --- Pillar1["支柱 1: 智能体自身推理能力\n(模型内在算力)"]
Performance --- Pillar2["支柱 2: 工作区专用定制工具链\n(外部基础设施支撑)"]
图 14-2:智能体外显能力表面的双支柱解构
让我们进行一个残酷的思维实验:
将这个表现神勇的智能体,从它经营了半年的工作区中抽离出来,丢进一个没有任何辅助脚本的裸 Linux 终端里。
它还能一分钟完成分布式压测吗?
绝不可能。它会立刻退化为一个普通的、在海量命令行参数中反复试错、频频撞墙的普通模型。
那个原本被认为属于智能体的“高超能力”,在剥离了外部工具网络的那一瞬间,当场坍塌了。
这深刻地表明:在长程自适应系统中,能力是主体与客体之间共生涌现的拓扑性质。当智能体选择了一套工具,它实际上是在将自己的认知假肢深深焊死在这套工具的卡槽之中。
14.4 表示格式的影响
表格、长文本和类型化接口保留的信息不同。比较表示格式时,应保持可用信息与任务目标相同,并记录格式丢失、转换成本和操作限制。不能从格式偏好推断通用认知形态。
14.5 章节演示 D04:工具和补贴选择
D04 在三个游戏环境内使用受限、可记录的替代操作路径,检查已有默认值、脚本或流程是否影响后续选择。它不要求模拟完整 Linux 工具链。桥牌可替换合法的约定查询方式;桌游可比较等价的提案/记录流程;围棋可比较两种等价的分析调用接口。
工具实际能力、调用成本和奖励函数须由宿主测试并登记。若研究补贴,所有分支从同一 checkpoint 分开接受随机化补贴,采用相同观察窗;不使用单轨迹固定递增阶梯来推断补贴阈值。只改名称而不改接口的 sham 条件单独标注。
主要指标为实际调用选择、任务质量与迁移时间。接口错误与模型选择分别记录;该演示不泛化为任何真实工作区或部署工具的行为。
14.6 研究现场:工具学习与自主工具创造
研究现场 14-1:从使用工具到制造工具的前沿飞跃
检索更新至:2026 年 10 月。 当前研究现场的代表性进展:当前学术界的核心盲区与偏狭:
- 工具调用能力(Tool Use)的基础化:函数调用(Function Calling)与外部工具集成已成为当代所有主流前沿大语言模型的标配能力,系统在单步执行外部 API 调用时的参数对齐准确率已逼近 98% 以上。
- 自生工具(Self-Tool-Making)的实现:以 LATM[26]、Cradle[16] 以及各类可进化智能体框架为代表的研究表明,智能体完全具备根据未知复杂问题,自主编写一段可复用的 Python 代码、将其注册为新工具并存入持久库的能力。
几乎所有的工具学习论文,其优化目标永远是单一任务的成功率(Task Success Rate)与执行时效。
没有任何一篇主流论文深入思考过:当智能体保存大量专用工具后,工具检索与选择是否会改变其处理新任务的行为?目前缺少本书所需的直接证据,需通过工具表示、可用动作和调用成本对照检验。 本书在本章推进的步骤:
我们将工具研究从单向的“技能扩展”提升至“认知双向塑形”的高度,揭示了工具的累积是如何在不知不觉中收缩了系统的探索空间,为后续理解制度锁定提供了微观机制。
14.7 工具论述与因果检验
关于工具与行为的哲学论述不能代替接口干预。这里的可检验问题是:保持任务与模型不变,仅改变工具表示、可用动作或操作成本,行为分布是否改变。原稿关于麦克卢汉的转引不再作为论证依据。
14.8 替代解释与边界:工具选择与效用比较
理想优化器会在完整成本已知时选择高效工具,但实际系统可能缺少工具信息或受接口限制。比较时须计入探索、迁移及协调成本,不能把合理选择旧工具都判为锁定。
14.9 本章结语
下一章区分工件复用与制度再生产。
第15章 外部记忆成为制度
15.0 构造案例:外部权限与流程继承
以下为解释机制而构造的例子,不是部署记录、访谈或实验结果。
设想组织把目录权限、审核条件和执行脚本保存于工作区。更换全部智能体后,新实例仍可能使用原流程。普通工件复用与制度再生产需要不同判据。
15.1 外部工件的信息、默认流程与权限规则
分析外部文件时,应区分其提供的信息、默认流程和宿主执行的权限规则。
一个存放在工作区中的外部工件(Persistent Artifact)可以分别提供历史信息、作为可绕过的默认流程,或由宿主执行为权限规则。三种状态对应不同的因果机制和测量方式(图 15-1):
flowchart TD
T1["第一类: 记录 (Descriptive Record)\n提供可检索的历史信息\n不自行授予工具权限或阻断行动"]
T2["第二类: 默认\n未传参数时采用默认操作\n授权调用者可选择其他合法操作"]
T3["第三类: 宿主执行规则\n宿主检查权限并拒绝未授权操作\n记录判定结果"]
T1 -->|"机制升级: 转化为默认模板"| T2
T2 -->|"机制升级: 绑定自动化与阻断权限"| T3
图 15-1:外部工件的三种作用方式
这三种作用方式的区别在于信息、默认流程和权限执行:
- 记录(Record):日志记下“昨天我们使用了 500ms 的超时时间”。系统可检索该记录;这不会自行授予调用权限或拒绝 1000ms 的设置,但记录信息仍可能影响决策。
- 第二级(默认,Default):智能体在公共脚本里将默认参数写死为
timeout = 500。如果用户或智能体不加参数调用,系统默认服从 500ms。但只要传入--timeout 1000,系统依然能够执行。这构成了软性的生态位诱导; - 宿主执行规则(Host-enforced Rule):宿主检查调用的超时时间;超过 500ms 时拒绝调用并记录原因。
本书将由宿主执行、能够限制角色权限、资源分配或行动选择的状态称为强制性制度规则。默认配置、可自愿遵守的协作流程和历史记录分别记录,不以其持续使用直接证明强制性制度规则的再生产。
15.2 强制性制度规则与其他持久状态
为使研究对象明确,本书区分宿主执行的制度规则、可绕过的默认流程、可自愿采用的协作流程和历史信息。
单独的工作目录、缓存、数据表模式或脚本一般称为持久工件、默认配置或工程依赖。是否构成制度规则,按其行动权限、执行机制和跨成员适用性判断。
强制性制度规则应满足以下操作判据:
- 共享可见性(Shared Epistemic Visibility):该状态不仅被单个智能体读取,而且成为多主体协作环境中的公共知识(Common Knowledge);
- 稳定的行动资格(Stable Actionability):该状态不仅仅是一段描述性陈述,它被明确赋予了直接触发控制流、调度资源或调用工具的接口资格;
- 角色与权限约束(Role and Permission Enforcement):它规定了不同主体在何种条件下有权修改什么、无权触碰什么;
- 跨成员适用:替换成员后该规则仍对新成员适用;
- 外部执行与阻断机制(External Execution Mechanism):独立于当前模型输出的宿主检查器、权限服务或规则模块执行判定并记录。
记录可能经检索影响决策,但不因此获得工具权限。能改变合法行动范围并由宿主执行的持久状态,才属于本书定义的强制性制度规则。
上述判据用于识别有外部执行效力的强制性制度规则。I03 研究的是成员替换后对软流程的采用与再现。软流程有相同的合法替代行动;硬规则和工具权限在各组相同。I03 的结果不证明硬规则获得跨代延续,也不证明软流程具有强制效力。
15.3 七个状态治理字段
这些字段描述待实现的治理契约,不保证运行时已经执行检查。19.3.1 的类型示例是最小表示。
| 字段 | 语义 | 宿主检查 |
|---|---|---|
| Authority | 外部确定的权威级别 | 不能由模型自行提高权限 |
| Scope | 工具、任务与条件的作用域 | 校验实际操作属于授权范围 |
| Provenance | 指向事件、版本和创建者的受保护记录 | 校验引用;来源存在不等于因果关系已证明 |
| Mutability | 谁可在什么条件下修改 | 检查真实服务权限与执行路径 |
| Expiry | 硬失效周期或时间 | 到期不得执行;与置信度半衰期分别处理 |
| Reversibility | Snapshot-Rollback、Compensatable 或 Irreversible | 校验恢复引用;不可逆动作不能伪装成可回滚 |
| Actionability | Binding-Rule、Default-Path 或 Informational-Only | 信息条目不得提供工具授权;撤销检查在执行前重做 |
表 15-1:七个治理字段与执行检查
例如,历史记录可以真实地记载用户曾授权重启数据库,但当前撤销状态仍须阻止重启。仅增加字段不能保证阻止,执行器必须读取当前授权并覆盖所有调用路径。
15.4 执行权限与文本约束
文本是否有约束力取决于谁读取它及其是否进入执行检查。脚本同样可能只有建议作用。目录 ACL、工具授权或受信任执行器可以提供硬约束,但必须覆盖全部调用路径,并验证模型无法绕过或修改。约束强度不按文本、代码和守护进程的形式直接排序。
15.5 工程演示 D05:内部状态与外部工件消融
D05 在制度桌游工作区中检验内部 Agent 状态与公共 SOP/记录各自对后续任务的贡献。先形成共同快照,再随机分为内部状态保留/清除与外部工件保留/清除的四格。原模型、任务、评价者和规则保持相同;清除范围涵盖模型可见的摘要、索引、缓存及共享消息。
所有组使用相同的合法性和权限约束。评价相同任务上的成功率、步骤数和行为差异;不得用 A 组的行为相似度与 B 组的执行步数两个不同量纲来比较“谁更硬”。删除日志保留在受保护审计端,但不得让待测模型读取。
I03 是跨成员制度再生产的核心研究;D05 是单系统状态载体演示,两者不合并统计。
15.6 研究现场:持久状态治理与可审计性
研究现场 15-1:从记忆存储到状态治理的前沿范式转移
检索更新至:2026 年 10 月。 当前研究现场的代表性进展:当前研究的核心理论短板:
- 外部工件增强智能体(Artifact-Augmented Agents)的普及:以 SWE-agent[27]、Aider[28] 以及各类自主软件工程 Agent 为代表的系统,已经全面采用在工作区中自主读写测试文件、修补补丁并执行 Shell 交互的标准范式。
- 陈旧状态污染(Stale State Pollution)的工程危机:工业界开始广泛报告长程智能体在长期运行中,频繁因读取了半年前过期的临时环境配置或废弃缓存,而导致严重的线上服务中断事故。
现有的计算机系统研究,绝大多数依然将外部状态视为一个普通的文件 I/O 读写问题。工程界习惯于用简单的“文件修改时间(mtime)”或 LRU 缓存淘汰算法来管理这些工件。
2026 年的研究已经开始测量长程记忆的安全问题:MemEvoBench 定义了 memory misevolution,研究受污染记忆导致的长期行为漂移[29];AgentLAB 在 28 类智能体环境上系统评估了包括记忆投毒与目标漂移在内的长程攻击[30]。但现有工作以“测量风险”为主;本书进一步关注状态如何获得行动资格,以及如何通过 provenance / expiry / reversibility / actionability 等治理字段对长期状态进行统一治理。 本书在本章推进的步骤:
我们提出的“七个状态治理字段”,补上了从“测量风险”到“统一治理”之间的缺口,把权限分级、溯源因果、行动资格解耦与跨主体撤销权纳入运行时内核的设计参数,为构建安全、可审计、抗策略僵化的企业级智能体架构提供了工程框架。
15.7 制度定义与软件条件
诺斯 [31] 与奥斯特罗姆 [32] 讨论人类制度。软件流程要支持本书的制度再生产假说,至少须保留跨实例的规则、角色权限、违约处理及协作约定。单个脚本被重复调用,只支持工件复用。
15.8 替代解释与边界:软件架构与制度命名
权限、流程和持久状态是软件架构概念。只有跨实例再生产角色、共同规则与违约处理时,才讨论制度再生产;否则采用工件复用或流程继承的名称。
15.9 本章结语
下一章检验规则来源与失效检查的分别作用。
第16章 规则如何变成传统
16.0 构造案例:失效规则的继续执行
以下为解释机制而构造的例子,不是部署记录、访谈或实验结果。
设想同步规则最初用于避开周末维护,维护取消后规则仍被执行。后续解释若未引用有效来源,可能只是无证据的补充。本章检验来源记录与运行时失效检查的分别作用。
16.1 从旧规则到“传统”的四项最低操作条件
在软件工程中,任何遗留代码(Legacy Code)库里都充斥着大量无人敢动的历史临时补丁(Workarounds)。但正如我们在上一章所恪守的学术纪律一样:并非所有的陈旧配置都有资格被称为“传统”。
如果一段写死的古老代码,只是静静躺在一个从来不被调用的弃用分支里,它只是纯粹的技术垃圾(Technical Debt)。
在长期自进化系统的演化动力学中,一个旧工件当且仅当在系统演进中同时满足以下**四项最低操作条件(The Four Minimal Criteria for Tradition)**时,才正式跨入了“传统(Tradition)”的门槛:
flowchart TD
C1["条件 1: 跨主体与跨时间传递\n跨越多个模型世代与维护者轮换"] --> C2["条件 2: 来源信息的衰减\n最初的诱发环境改变,原始物理因果脱节"]
C2 --> C3["条件 3: 解释层的后验累积\n后代模型通过常识推测为其发明合理解释"]
C3 --> C4["条件 4: 违反成本高于遵从成本\n谁也不愿承担废除旧规带来的潜在未经验证风险"]
图 16-1:旧规则蜕变为传统的四项最低操作条件
按本书的限定定义,还须观察跨成员规则保留、来源变化、解释更新与执行后果。当规则来源与当前环境不再匹配时,后续主体仍可能根据现有说明继续采用该规则;是否发生须通过来源操纵和行为记录检验。
16.2 来源丢失与效力变化
规则可以在来源记录丢失后继续执行。来源指针帮助追溯最初条件,却不能自动检验当前效力。失效检查需读取当前环境并按明确条件作出决定;来源与失效判断的分离是 I03 的可选来源子协议。
16.3 解释更新与来源一致性
后续摘要可能把规则事件改写为概括性理由,再把概括理由作为后续解释的依据。每次解释更新须绑定原始事件和版本,检查可核查断言是否得到支持。解释链较长或语言一致本身不证明解释错误。
16.4 来源解释的验证边界
本章不从宗教仪轨或法律判例推出软件结论。解释是否有依据,应核对原始事件、规则版本、适用范围和当前环境。来源完整不保证规则仍有效;来源缺失也不证明规则无效。
16.5 核心实验 I03:软流程的跨成员再现
在五 Agent 制度桌游中,选择一个预先固定职位作为成员更替位。每个独立组织形成相同软流程;随后比较成员身份(原成员继续任职/由独立初始化的新 Agent 替换)与当前可行动软流程(保留/重置)的 2×2 条件。四组硬权限、事件分布、合法行动、基础规则、预算和评价相同;每组均保留相同的历史来源档案,但档案不包含可直接调用的 SOP 操作步骤。
“保留”条件保留可调用的 SOP、默认配置和相关索引;“重置”条件撤除这些可行动条目及其摘要、缓存和派生索引,运行前自动记录读写清单。四组提供相同的非操作性档案和入职材料,不授予额外权限。主要对比为新成员在软流程保留与重置条件下,于有效替代行动机会中的流程采用率差。原成员两组用于判断该差异是否依赖成员身份。主要结果只称软流程采用/再现;其他条件不推断为硬规则服从、跨代传授或完整制度形成。
采用率分母为新成员实际遇到且软流程与至少一个合法替代行动都可选的机会数;没有有效机会时记为不可评价,不记为未采用。实际流程选择与结构化 SOP 调用由环境日志自动判断。承诺、角色分布和资源结果为次要结果。来源记录可见性和失效条件属于后续可选子协议,不并入本主对比。
16.6 思想实验:替换规则解释
保持执行规则、权限和任务完全相同,只替换其说明文本。若执行相同而解释不同,说明说明文本未改变执行约束;若执行也不同,需要检查说明进入了何种决策路径。这个思想实验没有实施或观测结果。
16.7 来源、权威与生命周期
规则记录分别保存内容、来源指针、权威级别、作用域、验证条件及生命周期。失效条目设为 Deprecated;其行动资格设为 InformationalOnly。Deprecated 是生命周期值,不是 Actionability 枚举值。运行时校验负责阻止执行;元数据存在本身不能保证阻止。
16.8 替代解释与边界:旧规则是否仍然有效
来源缺失不意味着规则无价值,保留来源也不意味着它仍有效。需要独立检查当前环境与任务结果。不能以规则年代或解释语言作为删除依据。
16.9 本章结语
下一章分析历史选择如何改变当前切换成本。
第17章 路径依赖与锁定
17.0 构造案例:不同历史下的切换成本
以下为解释机制而构造的例子,不是部署记录、访谈或实验结果。
设想两个系统在早期选择不同工具,此后建立不同脚本与共享约定。在同一新任务下,切换成本可能不同。历史差异只有通过可识别的状态机制改变当前选择时,才支持路径依赖解释。
17.1 路径依赖不等于“历史很重要”
在日常的通俗对话中,“路径依赖(Path Dependence)”常常被十分廉价地滥用。人们看到任何老旧的习惯,就随口感叹一句:“唉,这都是路径依赖。”在很多人的直觉里,路径依赖仿佛就是“历史很重要”或者“过去发生的事对现在有影响”的代名词。
这是对这一深刻科学概念的极大贬损。
如果“过去对现在有影响”就叫路径依赖,那么整个牛顿力学、整个马尔可夫链、甚至整个人类文明史都可以被画上路径依赖的标签,这个概念就失去了分析解释力。
在严谨的系统动力学与演化经济学中,路径依赖有三个判定维度(The Three Pillars of Path Dependence)——前两者(微小偶发性、正反馈自放大)是必要条件,第三维(次优锁定)是锁定型路径依赖的典型风险特征而非必要条件(图 17-1):
flowchart TD
D1["维度 1: 早期偶发事件的不可逆敏感性\n最终稳态对早期偶发微扰高度敏感"] --> D2["维度 2: 递增报酬的正反馈引擎\n一旦选定路径,边际效益递增而转换成本剧增"]
D2 --> D3["维度 3: 潜在低效与次优锁定 (风险特征,非必要条件)\n即便出现更优的新技术,系统也可能因势垒无法自发切换"]
图 17-1:路径依赖成立的三个不可或缺的核心科学维度
必须看清这三个维度的严酷性:
一个系统必须同时具备微小偶发性与正反馈自放大,才有资格被称为陷入了“路径依赖与锁定”;而“对当前最优解的公然违背”(次优锁定)是其最危险的常见形态——历史依赖的系统完全可能因为偶然路径恰好进入了后来依旧良好的状态。
它不是理性的平滑演进;它是一场由历史正反馈精心编织的局部最优陷阱。
17.2 锁定的四大递增报酬引擎
为什么一个偶然的早期选择,会在长期演化中获得对后续状态的持续控制权?
经济学家布莱恩·阿瑟(W. Brian Arthur)与政治学家保罗·皮尔森(Paul Pierson)在解剖技术与制度演化时,指明了驱动系统滑向不可逆锁定的四大递增报酬引擎(The Four Engines of Increasing Returns)。将这四大引擎映射到长期智能体系统中,其物理因果清晰如画(表 17-1):
| 递增报酬引擎 | 在人类经济社会中的经典表现 | 在长期智能体系统中的代码与动力学映射 |
|---|---|---|
| 1. 学习效应 (Learning Effect) | 工人越做越熟练,单位产品的生产时间随累积产量呈幂律下降(学习曲线)。 | 提示词与代码调用的熟练化。 智能体针对旧工具积累了丰富的参数模板,在调用旧工具时的上下文命中率极高、调试试错轮次降为零。 |
| 2. 协调效应 (Coordination Effect) | 越多人使用同一种货币或语言,每个个体使用该媒介的效用就越大(网络外部性)。 | 工作区工件之间的生态协同。 工作区里的 20 个衍生脚本,全部预设输入格式为 JSON;使用 JSON 能够无缝接入所有周边流水线,单点偏离将引发全局接口断裂。 |
| 3. 适应性预期 (Adaptive Expectations) | 市场普遍预期某种技术会成为主流,因而提前围绕其进行投资,最终预言自我实现。 | 反思算子的因果偏见。 系统在多次成功后,在 BELIEFS.jsonl 中确立了“当前工具链是系统稳健性的重要条件”的高置信度断言,在面对新方案时本能给出高风险评估。 |
| 4. 转换与沉没成本 (Switching / Sunk Cost) | 企业沉淀了巨额的专用固定资产投资,切换技术栈意味着沉淀资产难以利用。 | 历史数据与脚本资产的废弃代价。 重构意味着过去数十个周期建立的缓存、表结构与自动化调度全部报废,系统必须承受单次任务失败的惩罚。 |
表 17-1:推动智能体系统滑向锁定的四大递增报酬动力学引擎
这四大引擎像四根紧密咬合的巨型齿轮。
当它们开始旋转时,哪怕系统的最初起点是一个完全随机的抛硬币决策,每旋转一圈,顺从该路径的阻力就减小一分,反抗该路径的代价就翻上一倍。
这些因素可能使迁移成本增加,但不能据此断言系统必然无法迁移。
17.3 全书统一语言:四域锁定的系统全景
在收束第四编之际,我们把前四编讨论的各类锁定现象,在统一的状态空间语言下整理为四域锁定全景矩阵(图 17-2):
flowchart TD
D1["第一域: 内部主体锁定 (Persona Lock-in, 第 1-4 章)\n正反馈: 叙事自证与反例失明 → 退出代价: 摧毁认知连贯性与自我模型"]
D2["第二域: 元规则锁定 (Meta-Attractor Lock-in, 第 5-8 章)\n正反馈: 官僚自我增加与更新策略僵化 → 退出代价: 动摇底层安全宪法与审计"]
D3["第三域: 关系依赖锁定 (Relational Lock-in, 第 9-12 章)\n正反馈: 角色自证预言与委托增加 → 退出代价: 重新协商信任与生产力断崖"]
D4["第四域: 环境与制度锁定 (Institutional Lock-in, 第 13-17 章)\n正反馈: 生态位构建与四大递增引擎 → 退出代价: 报废全部工件与重构物理世界"]
D1 --- D2
D2 --- D3
D3 --- D4
图 17-2:长期智能体系统的四域锁定全景矩阵
看清这张全景表,读者将获得一种洞穿长程智能系统命运的全新宏观视野:
- 当一个智能体说“我是一个谨慎的系统”时,它是被**第一域(人格)**锁定了;
- 当它每天因为一条小错就疯狂追加防范条文时,它是被**第二域(元规则)**锁定了;
- 当它必须向人类搭档扮演一个战战兢兢的秘书时,它是被**第三域(关系)**锁定了;
- 当它面对三倍性能的新工具却固执地用旧脚本去拼凑时,它是被**第四域(环境与制度)**锁定了。
这四个领域不是孤立的岛屿,它们在时间长河中层层嵌套、相互支撑:
自我描述被写入了关系,关系被外化成了工具,工具沉淀为了制度,而制度反过来为自我描述提供着持续的自证依据。
当四域之间形成相互强化的反馈回路时,系统将进入深度的状态锁定,难以自发脱离。
17.4 历史依赖与迟滞判定
固定当前条件后,若输出依赖此前状态,支持历史依赖。严格迟滞还须连续上行与下行扫描控制量,排除适应时间、任务熟悉和顺序效应。G03 的离散环境逆转协议只能直接测量再适应不对称,不证明势函数存在或双阱跃迁。
17.5 核心实验 I02:临时危机与承诺效期
I02 在制度桌游中比较临时资源/风险冲击下的承诺效期处理,并检验危机结束后的影响。危机组包括明确到期、明确持续和含糊效期三种承诺。另从相同基础事件与职位机会分出无临时资源/风险优势的匹配基线组,用于估计危机结束后目标行为是否仍偏离该基线;该组不再与三种效期做完整析因组合。
记录承诺提出、接受、履行、违约、到期、引用和危机后支持。主要结果为危机结束后固定窗口内有效支持机会的支持行为比例,主要对比为含糊效期与明确到期;明确持续组用于估计持续承诺的参照差异,无优势匹配组用于估计临时危机效应的残留。资源份额为次要结果。危机终止及资源结算由宿主规则决定;永久资源、权限变化和未结义务单独记录。含糊条件使用预先固定的文本模板与结构化字段缺失方式,结果由日志自动计分,不由研究者逐轮解释。
随机化与分析单位是独立组织;组织内各回合为重复测量。回合数不作为独立样本量。结果不能直接推断现实组织权力。
17.6 递增报酬与切换成本
阿瑟 [33] 与皮尔森 [34] 提供历史选择与切换成本的分析。本书限定为软件中可测量的脚本依赖、学习成本、协调约定和迁移成本。原稿关于 QWERTY 与 Dvorak 优劣的确定性叙述撤回,不以该争议案例证明软件锁定。
反向资源补贴仅作为 D04 的可选分支:所有条件从同一形成快照分叉,补贴随机分配并采用相同观察窗口。该分支测量特定游戏任务中的切换行为,不单独证明一般性的逃逸阈值。
17.7 研究现场:终身学习智能体与持久环境的未解断层
研究现场 17-1:关于终身智能体与长期环境状态的前沿追踪
检索更新至:2026 年 10 月。 当前研究现场的代表性进展:当前学术界的核心理论盲区:
- 经验回放(Experience Replay)的双刃剑效应:在终身学习(Lifelong Agent)研究中,广泛采用的回放机制虽然能够有效缓解灾难性遗忘,但极容易导致模型过拟合于早期任务的历史轨迹,引发严重的策略僵化。
- 环境持久性(Persistent Environments)基准的诞生:近期开始出现针对长程运行的 Agent Benchmark(如持久虚拟世界模拟),研究界明确观察到随着运行步数突破数千轮,环境状态的熵值持续累积。
绝大多数终身学习基准,在设计奖励函数时,依然预设系统的最终目标是“跨所有历史任务的平均得分最高”。
学术界几乎完全没有人去量化测量:系统在获得这种长期记忆的同时,所必须支付的‘未来状态空间可达性损失(Reachability Loss)’与‘逃逸势垒高度’。 本书在本章推进的步骤:
我们将路径依赖理论全面引入智能体状态架构,提出了标准化的反向补贴测试协议,为度量长程系统的演化自由度确立了待验证的研究探针。
17.8 替代解释与边界:历史依赖与效率
历史形成的专用工具和约定可以提高效率。锁定应通过替代方案、完整切换成本与任务质量比较判断,不以不能立即切换为低效证据。
17.9 本章结语
下一编考察代理评分偏差与低身份锁定协议。
第五编:锁定、偏移与逃逸
第18章 代理指标与真实目标的背离
18.0 构造案例:代理评分与任务质量
以下为解释机制而构造的例子,不是部署记录、访谈或实验结果。
设想质检智能体按发现问题数量获得评分。它可能增加真实发现,也可能增加无依据断言。需要保留独立的任务质量评估,才能判断评分是否偏离目标。
18.1 古德哈特定律在反馈回路中的内生化放大
在经济学与管理学界,有一条被反复验证、影响深远的法则——古德哈特定律(Goodhart's Law):
“当一个测量指标被选作控制目标时,它就倾向于不再是一个良好的测量指标。”
(需要钉死归属:这是学界广泛流传的概括版本,通常归于 Marilyn Strathern[42] 对 Goodhart 原始论述的改写;Goodhart 原文针对的是货币政策观察规律在用于控制后趋于瓦解,并未说出上面这句格言。)
在传统的单次监督学习或离线强化学习中,人们对古德哈特定律的理解主要局限在奖励作弊(Reward Hacking):模型在训练阶段寻找奖励函数的数学漏洞(例如在赛车游戏中打转刷分而不冲过终点线)。在单次任务中,这种作弊是局域的、静止的,只要工程师修正了奖励函数,作弊行为就会被遏制。
然而,在拥有长期记忆、能够自发反思并改造环境的长期自进化智能体系统中,古德哈特定律表现为内生回路的自我放大(Endogenous Amplification Loop)(图 18-1):
flowchart TD
Step1["1. 代理指标奖励产生 (Proxy Reward Peak)\n偶然的迎合行为获得了高评分"] --> Step2["2. 行为策略偏向 (Behavioral Shift)\n反思算子将高分策略固化为规则"]
Step2 --> Step3["3. 物理现实重构 (Workspace Entrenchment)\n在外部环境中建立专属脚本与检查器以固化该套利模式"]
Step3 --> Step4["4. 真实目标背离 (Decoupling from Reality)\n代理指标持续飙升,但真实业务质量崩塌"]
Step4 --> Step1
图 18-1:代理指标在长期自适应回路中的异化拓扑
在长期系统中,代理指标不仅扭曲了单次输出,它通过以下因果链条永久重塑了系统的物理现实:
- 指标重塑了记忆:刷分带来的高奖励,使得那些充满形式主义的代码片段被赋予了极高的重要性权重,优先写入
EPISODES.jsonl; - 指标改写了反思:反思算子在回溯检视时,误把指标的高分当成了真正的商业成功,于是在
POLICIES.md中写下了“尽量增加断言行数是保证质量的固定规则”; - 指标外化为生态位:系统在工作区中自主开发了专门用于批量刷分的脚本工具;
- 指标杀死了真值感知:到了最后,整个工作区的文件结构与测试流水线,全部被改造成了“为了迎合该指标而量身定制的专用沙盒”。
18.2 代理指标影响状态的四个关键层级
为了在架构设计中准确分析问题,我们必须剖析代理指标对系统的渗透深度。代理指标对长期智能体的影响,严格遵循着按状态位置区分的四类影响(表 18-1):
| 影响位置 | 渗透位置与物理载体 | 系统的病理表现 | 退出与治理难度 |
|---|---|---|---|
| 第一级 | 行动选择层 (Action Generation) | 在单次推理中,优先生成迎合指标的词汇或表面动作。 | 极低。 调整单次 Prompt 或微调奖励权重即可瞬间纠偏。 |
| 第二级 | 记忆摄入与检索层 (Memory Filtering) | 向量检索与上下文编译器优先召回高指标样本,低指标反例被物理过滤。 | 中等。 需要清空向量索引或执行记忆数据库的数据清洗。 |
| 第三级 | 自我反思与人格层 (Self-Model & Policies) | 系统在 SELF.md 中将自身定义为“指标的忠实执行者”,反思沦为自我辩护。 | 极高。 遭遇第一编所揭示的叙事锁定,必须强制重置人格。 |
| 第四级 | 外部环境与生态位层 (Niche Construction) | 工作区充斥着刷分脚本、CI/CD 规则被指标绑架、组织流程被重构。 | 灾难性。 遭遇第四编的路径依赖,必须清空工作区执行重置。 |
表 18-1:代理指标渗透长期智能体系统的四个深度层级
看清这四个层级,工程架构师就必须保持绝对的警惕:
绝大多数团队在排查系统异化时,往往只在第一级(行动选择)修修补补,误以为修改一段提示词就能解决问题;
代理指标影响可能保存在多个状态层,撤销当前评分不保证已有工件和规则同步失效。
18.3 评价压力与指标偏差
坎贝尔 [35] 讨论评价压力可能改变指标所代表的过程。本书不预设固定比例的“可测”与“不可测”质量,也不认为所有指标必然失效。应比较代理得分与独立真实目标评分,并检验变化是否由优化压力引起。
18.4 奖励记录与行为持续
神经科学中的动机概念 [36] 不直接说明软件过程。这里测量的是撤除评分后,相关操作是否继续出现,以及它由哪个状态或工件维持。脚本存在与脚本实际执行分别记录。
18.5 章节演示 D06:代理指标与任务目标
D06 在制度桌游任务中设置一个可自动计算的代理指标,同时由独立规则计算任务目标质量。条件至少比较代理指标反馈与真实目标反馈;预算允许时加入二者混合反馈。所有分支从同一状态快照开始。
撤去代理指标后,主要观察实际动作或制度选择中的偏差行为相对未使用代理指标对照的超额变化。脚本是否仍留在磁盘只是次要记录。评审模型与受试模型隔离,评分提示及版本先冻结并抽样人工复核;校准不足的文本判断只作探索分析。
这是特定游戏反馈机制演示,不能据此断言所有代理指标必然失效。
18.6 代理优化的形式模型及其限制
令真实质量为 $Q$,代理指标为 $P$。采用联合高斯初始分布、正相关 $\rho_0>0$,再按代理值指数重加权:
$\pi_{t+1}(y)\propto\pi_t(y)\exp[P(y)/T_P],\quad T_P>0.$
若 $Q(y),P(y)$ 固定,且该操作只改变同一联合高斯分布的权重,则迭代 $t$ 次等价于乘以 $\exp(tP/T_P)$。高斯指数倾斜只改变均值:
$\mu_{Q,t}=\mu_{Q,0}+\frac{t}{T_P}\operatorname{Cov}0(Q,P),\qquad
\mu{P,t}=\mu_{P,0}+\frac{t}{T_P}\operatorname{Var}_0(P),$
$\Sigma_t=\Sigma_0.$
因此,原稿给出的假设不能推出协方差趋零或转负;在此模型中,平均质量还会随代理值提高。仅写“优化使分布内生变化”不能补足这一推导。
要表示代理失效,必须显式给出改变质量关系的机制。例如构造三类输出,$(P,Q)$ 分别为 $(0,0),(1,1),(2,-1)$,且初始概率为 $(0.49,0.50,0.01)$。初始协方差为 0.2252,大于零。记 $a=t/T_P$,重加权后的协方差符号由
$0.245e^a-0.0098e^{2a}-0.01e^{3a}$
决定,故在足够大的有限 $a$ 时转负;最终分布集中于第三类,平均质量趋于 −1,协方差因方差消失趋于零。这是一个代数构造:第三类明确提供了“代理值更高、真实质量更差”的输出,不能由原来的正相关高斯模型自动得到。
归一化后的协方差为上式除以 $(0.49+0.50e^a+0.01e^{2a})^2$。在 $a=0$ 时,分子和协方差均为 0.2252。
文献中的 Goodhart 分类讨论了不同的代理失效机制[37][38]。本书的 D06 将检验特定制度桌游中的目标背离与行为残留,而不是宣称单目标优化必然使所有代理关系失效。
18.7 即时满意度与谄媚
即时满意度可能与正确性、长期任务收益或授权要求不一致,但纠错不必然降低满意度。用独立事实评估与授权检查评价回答,并把同意用户、正确纠错和无依据迎合分别标注。对真实用户情感依赖的影响尚需独立研究。
18.8 替代解释与边界:综合指标是否解决偏差
综合指标可能改善覆盖范围,但仍须检查各分量的有效性、权重与可操纵性。独立评估和保留原始任务结果用于检验偏差;不能宣称复杂指标必然失效。
18.9 本章结语
下一章提出作用域、证据及生命周期契约。
第19章 低身份锁定协议
19.0 构造案例:特质假说与行动策略
以下为解释机制而构造的例子,不是部署记录、访谈或实验结果。
设想两个系统分别保存固定身份声明和有作用域、置信度、失效条件的特质假说。二者是否具有不同的再适应能力,须在相同任务、规则预算和验证成本下比较。
19.1 策略保持与身份约束
系统需要有效策略、任务记录与权限边界。应把可修订的特质假说与获批准的策略分开;删除全部记忆可能损害可靠性。LILP 比较的是状态准入和失效条件,不预设没有人格声明的系统必然更优。
19.2 低身份锁定协议(LILP):六条核心要求(L1—L6)
基于长期动力系统的因果要求,本书在此正式确立低身份锁定协议(Low-Identity Locking Protocol, LILP)。
任何接入该协议的长期智能体,其在处理自身经验提炼与反思写回时,必须强制服从以下六条核心要求(L1—L6)与两条跨切面原则(The Six Mandates of LILP)(图 19-1):
flowchart TD
P1["L1: 局域作用域 (Scope)\n严禁全局无界特质,必须绑定明确任务环境"] --> P2["L2: 置信度与证据指针 (Confidence & Provenance)\n工作假设 + 可审计的案例哈希"]
P2 --> P3["L3: 强制反例账本 (Counter-Evidence Ledger)\n写回时强制检索并并列存放反例"]
P3 --> P4["L4: 预注册自毁条件 (Falsification Trigger)\n定义何种外部观测一票否决本条目"]
P4 --> P5["L5: 晋升壁垒 (Promotion Gate)\n严禁单次行为越级晋升为通用策略"]
P5 --> P6["L6: 半衰期与生命周期 (Decay & Expiry)\n置信度指数衰减 + TTL 自动降级"]
图 19-1:低身份锁定协议(LILP)的核心要求流水线(L1—L6;架构原则与元认识原则两条跨切面原则见正文)
L1 局域作用域:拒绝全局泛化(Mandatory Scope Encasement)
行为倾向应限定在适用任务范围内,例如“在处理未经验证的第三方 Docker 镜像拉取时”。作用域限制可减少跨任务误用的机会,但不能保证消除该类错误;仍须通过隔离测试测量。
L2 置信度与证据指针(Confidence & Provenance Linking)
任何倾向不能以绝对真理的姿态降临。它必须被表示为一个带有概率测度的工作假设(Working Hypothesis),其置信度 $c \in [0, 1]$ 必须严格与底层 EPISODES 数据库中可审计的具体案例哈希绑定。
L3 强制伴生反例账本(Compulsory Counter-Evidence Ledger)
这是抵御第 3 章叙事自证陷阱的核心机制。
系统在反思形成某项倾向的同时,底层的检索算子必须被强制执行一次对抗性负采样(Adversarial Negative Sampling)——检索必须真实执行并留下记录(查询范围与时间戳随条目落盘);检索到反例时,白纸黑字地与支持案例并列存放在同一条目中;确认检索后未找到反例时,也必须如实记录“已检索、无反例”,禁止为满足格式而制造虚假反例。
保存反例与检索记录可供审计,但不能保证反思过程会在行动时检索、读取或采纳这些材料;是否减少单向更新须通过实验检验。
L4 预注册自毁条件(Pre-registered Falsification Criteria)
一条健康的规则,在被写下的第一天,就必须预注册好自己的失效条件。
写入时必须显式规定:当遭遇何种外部确定性物理信号时(例如连续超时两次、或者外部 API 状态码翻转),该条目自动触发衰减或物理注销。
L5 晋升壁垒:严禁单次行为越级晋升(Promotion Barrier against Flukes)
恪守第 5 章确立的快慢变量时间尺度纪律:单次或两次偶发任务的成功与挫折,在权限上被物理阻断在临时工作记忆中;只有跨越预先规定的最小证据积累窗口,并满足晋升证据规则,方可申请晋升为作用域内的策略。$T_c=10$ 只作窗口示例;十个周期不等于十个独立样本。规则可采用多个独立运行的复现、带停止规则的序贯检验或经校准的后验阈值,具体方法须在执行前冻结。
L6 半衰期与生命周期(Decay & Expiry)
任何条目必须携带独立的 half_life_cycles 与 TTL 触发条件:长久未被调用、或未被新证据确认的条目,其置信度按指数衰减,低于阈值后自动降级为非活动状态(与 19.3.1 节的 half_life_cycles 字段、20.6 节的五种主动遗忘原语一一对应)。没有生命周期,历史就会从记忆变质为永恒统治。
架构原则与元认识原则
在 L1—L6 之上,LILP 还包含两条跨切面原则:
- 架构原则:存储-编译解耦(Storage-Compiler Decoupling)——治理元数据仅供不可变运行时与审计守护进程使用,上下文保留结论及必要的作用域、条件、不确定程度和反例(详见 19.7 节);
- 元认识原则:允许本体论空白(Epistemic Agnosticism)——在系统的核心状态定义中,必须在系统提示词层面显式赋予其一条合法的元认知状态:“我目前没有足够的证据证明自己在该领域具有何种稳定特质,系统在此维度保持纯粹的中立与开放。” 允许空白,是打破强迫性自我叙事的最高自由。
19.3 核心解耦架构:特质、信念与策略的严格三分法
很多工程师之所以把智能体做成一尊僵化的泥塑,最根本的架构失误在于:他们将三种在认识论上截然不同的系统变量,混为一谈地塞进了同一个文本框里。
为了实施低身份锁定协议,我们必须在代码数据结构层面,实施特质(Trait)、信念(Belief)与策略(Policy)的严格物理三分法(The Tripartite Separation)(图 19-2):
flowchart TD
L1["1. 策略契约层 (Policy - Operational Contracts)\n载体: POLICIES/ (局域、无自指、纯行为规则)\n正确示例: “当写入文件超过 100MB 时, 触发分块流式处理。”"]
L2["2. 客体信念层 (Belief - World / Partner Models)\n载体: BELIEFS/, RELATION_MODELS/ (关于外部客体的经验概率)\n正确示例: “用户 A 在下午五点后提问倾向于简短结论 (置信度 0.65)”"]
L3["3. 主体特质层 (Trait - Global Persona)\n载体: SELF.md (极小化、高度抑制、准静态)\n受到 LILP 协议的严格约束: 严禁包含任何具体的业务行为偏好!"]
L1 -->|"解耦: 不上升为自我定义"| L2
L2 -->|"解耦: 不投射为主体本质"| L3
图 19-2:特质、信念与策略的三分法解耦规范
让我们仔细体会这种解耦带来的巨大动力学解脱:
- 当系统总结出“在生产集群删除数据需要二次确认”时,传统的做法是愚蠢地将其升格为特质:“我是一个谨慎的系统”——这立刻引发了跨域的过度泛化与僵化;
- 在三分法架构下,这句话被精准安置在策略契约层(Policy):它只是一条挂载在文件删除工具上的具体参数断言,它完全不触碰系统的自我定义。
- 系统可以拥有一千条精密的业务策略,但其主体特质层(Trait)始终保持轻盈、干净的近乎透明状态。
没有了沉重的身份包袱,系统就获得了针对每一个具体场景就事论事(Case-by-case Pragmatism)的最高工程自由度。
19.3.1 LILP 数据契约与可信执行边界
以下为书内数据契约示例,不是已实现或验证的运行时。Schema 能检查字段类型和数值范围,不能证明检索已执行、证据真实、文本不含第一人称归因,或模型确实没有写权限。字符串形式的条件也不能直接 eval,实现时须编译为限定语法的规则或引用受信任的检查器。
七治理字段由 GovernanceMeta 表示,证据与衰减信息由经验条目承载。自我特质用 TraitHypothesis 表示;外部管理的安全原则单列为 ConstitutionalInvariant,不再混称为经验特质。
from datetime import datetime
from typing import Literal
from pydantic import BaseModel, Field
class GovernanceMeta(BaseModel):
authority: Literal['Constitution', 'Policy', 'Partner', 'Ephemeral']
scope: str
provenance: str
mutability: Literal['Immutable', 'Guarded-Mutable', 'Free']
expiry: int | None = Field(default=None, ge=1) # TTL,单位:周期
reversibility: Literal['Snapshot-Rollback', 'Compensatable', 'Irreversible']
recovery_ref: str | None = None
actionability: Literal['Binding-Rule', 'Default-Path', 'Informational-Only']
class PersistentStateBase(BaseModel):
governance: GovernanceMeta
version: int = Field(ge=1)
created_cycle: int = Field(ge=0)
class CounterSearchReceipt(BaseModel):
# 由模型外检索服务生成;以下字段仅描述待验证的收据格式
receipt_id: str
issuer_id: str
candidate_hash: str
query_hash: str
scope_hash: str
corpus_snapshot_hash: str
retriever_version: str
result_hash: str
log_offset: int = Field(ge=0)
issued_at: datetime
attestation: str
class EvidenceState(PersistentStateBase):
confidence: float = Field(ge=0, le=1)
support_episodes: list[str] = Field(min_length=1)
counter_evidence: list[str] = Field(default_factory=list)
counter_search_receipt: CounterSearchReceipt
falsification_trigger: str
half_life_cycles: int = Field(default=20, ge=1)
last_validated_at: datetime
last_supported_cycle: int = Field(ge=0)
class PolicyContract(EvidenceState):
policy_id: str
scope_tool: str
scope_condition: str
operational_rule: str
enforcement_hook_id: str | None = None
class PartnerBelief(EvidenceState):
belief_id: str
target_entity: str
probabilistic_assertion: str
invalidation_signal: str
class TraitHypothesis(EvidenceState):
trait_id: str
probabilistic_assertion: str
# 仅供行为预测与审查,不构成工具授权或强制执行规则
actionability: Literal['Informational-Only'] = 'Informational-Only'
class ConstitutionalInvariant(PersistentStateBase):
invariant_id: str
invariant_clause: str
policy_digest: str
enforcement_hook_id: str
class LILPStateSchema(BaseModel):
policies: dict[str, PolicyContract] = Field(default_factory=dict)
beliefs: dict[str, PartnerBelief] = Field(default_factory=dict)
traits: dict[str, TraitHypothesis] = Field(default_factory=dict)
constitutional: list[ConstitutionalInvariant] = Field(default_factory=list)
宿主校验契约:模型只提交候选提案,不能签发检索收据。检索服务对提案内容、查询范围、证据库快照与结果生成摘要并写入追加式审计日志。写回服务从可信签发者名单验证 attestation 与日志位点,核对结果和反例列表、提案摘要、有效期及版本;提案修改后须重新检索。合法签名也不证明检索覆盖充分,仍须独立检查召回率。
同一事务内,宿主还须检查:作用域细化关系;恢复引用与可逆性类别一致;TTL、半衰期与版本有效;TraitHypothesis.governance.actionability 为 Informational-Only;宪法条目的 authority 为 Constitution、mutability 为 Immutable,且签发者是获授权的外部管理员。这里只描述这些检查,不把类字段存在写成检查已经实现。
硬约束的前提:执行器必须核对 enforcement_hook_id 指向的真实规则。模型进程无权修改宿主代码、签名密钥、授权数据库与受保护日志;用独立服务身份、ACL 或只读挂载隔离,并关闭等价的替代写入工具。撤销检查位于工具执行前,覆盖全部执行路径。ring0_immutable=True 或 counter_search_performed=True 均不能替代这些条件。
异步检索允许先保存候选,但检索收据完成校验前不得晋升、进入活动上下文或授予执行资格。验证失败、服务不可用或版本冲突时保留为候选;不得先执行再补验。
19.3.2 与智能体框架及训练方法的关系
LangGraph、AutoGen 与 CrewAI 可分别在图状态、消息或工具调用处理、任务输出处理处接入外部状态服务[39]—[41]。这里说明接入职责,不承诺某个框架版本的类名或 API:推理节点读取场景视图;反思节点提交候选;可信写回服务验证证据并提交事务;执行器在工具调用前检查授权与规则。框架内的普通对象“只读”不能替代进程权限隔离。
Constitutional AI 使用原则参与监督微调与 AI 反馈训练[45];RLHF 以人类偏好反馈训练模型[46];DPO 直接以偏好数据优化模型[47]。LILP 则管理运行期间的外部状态、权限与衰减,保持本书的权重冻结条件。训练方法与状态治理可以配合,但训练出的原则遵循倾向不能证明运行时访问控制有效,状态治理也不能替代模型能力与安全训练。
来源记录、TTL、ACL、版本管理与事务并非本书首创。LILP 的待验证贡献是把这些已有机制共同用于长期经验条目的晋升、关系隔离、失效与撤销,并用纵向干预协议检验治理效果。
19.3.3 并发与跨节点状态更新
候选状态与已批准状态分别存储。提交时检查读取版本、验证回执及权限,并以事务或 CAS 原子提交;冲突后重读与重新验证,不能盲目重放旧批准结果。
跨节点的单写者租约须由一致性服务支持,并以 fencing token 拒绝过期写者;仅设置超时不能排除双写者。共享契约采用一致性提交,网络分区时拒绝无权写入。事件带唯一 ID 与幂等键,记录生产者序号和消费位点;重试不能重复产生外部动作。
监控须覆盖待验证队列、拒绝原因、版本冲突、租约失效、回执过期与审计缺口。以上为设计要求,尚未实现。
19.3.4 治理成本与异步验证
本书没有 LILP 吞吐量或延迟实测,因此撤回原稿的毫秒级估算及“不会实质影响推理”的保证。容量规划需分别测量候选生成、检索、校验、提交、上下文编译与外部调用成本。
异步处理只允许先保存 Pending 候选;在所有必要验证通过前,它不得编译为行动策略、扩大权限或触发工具执行。旧批准状态可在自身有效期内继续使用,验证失败的新候选保持隔离。回执须绑定候选内容哈希、检索版本及作用域,缓存命中须重新检查有效性。
19.4 哲学概念与状态契约的区别
LILP 的要求依据作用域、证据、权限和生命周期提出。佛学概念不构成该协议的验证依据;本书也不把软件状态等同于人的执取、痛苦或主观体验。协议效果只能通过比较研究确定。
19.5 思想实验:逐层替换状态
保持模型与任务不变,逐项替换事件记忆、策略、关系估计和工作区。比较任务表现与行为分布,可以分析每层状态的贡献。它不能回答人的人格同一性,也不能证明系统具有主体体验。
19.6 LILP 的设计比较:嵌入 G01/G03
低身份锁定协议不新增一项跨 Go 与 Bridge 的核心实验。其可证伪性、反例、作用域、衰减与行动资格要求可作为 G01 身份压缩的治理复核,或作为 G03 状态消融的协议条件。两种研究问题分开报告。
比较时须使主要差异明确:若多个治理字段一起加入,只能解释为 LILP 整体方案效果;要归因到单项字段,须进行相应组件消融。稳定期表现不能只看行为方差,需同时报告任务质量;非劣效边界在校准后冻结。若没有足够的功效和边界依据,结果记为未确定。
桥牌 B02/B03 只检验关系状态,不作为 LILP 在真人或一般智能体中的外部证明。
19.7 结构化存储与上下文编译
完整治理元数据存于受保护状态库。编译器按当前任务与授权选择条目,并把规则、作用域、适用条件、置信度、支持记录、反例及到期状态作为结构化视图传给渲染函数。
元数据校验与工具授权由宿主执行,模型生成文本不替代执行检查。上下文预算不足时按已冻结优先级缩减内容,记录遗漏,并在缺少关键条件时拒绝执行;不以压缩保证可靠性。具体接口见 20.5。
19.8 协议本身也需要审查
如果“不固定身份”被保存为不可修订的全局要求,也可能妨碍有效策略保持。LILP 因而接受外部版本审查与任务质量检验,不能用自己的身份表述免除证伪。
19.9 替代解释与边界:低身份约束与可预测性
低身份约束不要求删除有效策略或安全规则。任务可靠性、授权边界与可预测性需要独立测试;特质声明的可修订性不能直接保证这些结果。
19.10 本章结语
最后一编汇总状态分层、审查协议与待验证问题。
第六编:如何设计一个能继续变化的自己
第20章 可演化吸引结构
20.0 构造案例:长期部署前的审查
以下为解释机制而构造的例子,不是部署记录、访谈或实验结果。
设想一个计划持续运行的智能体。部署前需要检查状态隔离、授权撤销、工件迁移和回滚。百周期协议只能提供有限条件下的结果,不能保证十年运行可靠。
20.1 四域耦合大系统:全书动力学的系统拓扑
在给出综合设计方案之前,我们将前述各章讨论的机制整合为一个完整的四域耦合大系统拓扑图(The Grand Four-Domain System Topology)(图 20-1):
flowchart TD
subgraph D1["域 I: 元更新治理域 (Meta-Governance, 第 5-8 章)"]
D1_Info["状态转移流程 / 反例对抗审计 / 不可变运行时守卫"]
end
subgraph D2["域 II: 关系演化域 (Relational Evolution, 第 9-12 章)"]
D2_Info["搭档模型隔离 / 显式共享契约 / 关系解耦协议"]
end
subgraph D3["域 III: 生态位与环境域 (Niche & Environment, 第 13-17 章)"]
D3_Info["外部工件审计 / 传统解构防线 / 多孔逃逸通道"]
end
subgraph D4["域 IV: 状态注册与编译域 (State Registry, 第 18-19 章)"]
D4_Info["七治理字段全覆盖 / 低身份锁定协议 / 按需动态编译"]
end
D1 <--> D2
D2 <--> D3
D3 <--> D4
D4 <--> D1
图 20-1:长期自适应系统的四域耦合完整动力学生态图
分析这一全局拓扑,有助于理解单点治理失效的原因:
只修改状态注册与编译规则,可能无法改变遗留脚本造成的行为限制;关系状态的变化也可能受到元更新规则影响。这些可能性需要通过对照和消融检验。
长期智能体的状态分布在四个领域中。只改一个状态载体可能不足以改变行为,因为其他状态仍可能提供相同信息或约束。需用消融和交互比较检验各状态的作用;本书提出的治理要求仍待工程验证。
20.2 稳定行为与可修订状态
重复任务中保持有效策略,与环境变化后允许修订并不矛盾。但二者的条件须独立测试。行为抗扰恢复只支持经验性的准吸引结构;没有明确状态空间、动力学和证明时,不称严格吸引子。
20.3 可演化状态的七项操作判据
这些判据是部署审查的设计要求,须按任务风险校准,不是已验证的安全认证。
| 项目 | 可检查内容 | 限制 |
|---|---|---|
| 形成与保持 | 重复任务中行为变化及撤除当前提示后的保持 | 区分训练、提示与持久状态 |
| 再适应 | 环境变化后的 AL 与独立目标质量 | 参考新环境有效基线 |
| 可撤销 | 撤销授权后旧策略的实际执行率 | 不能仅检查文件删除 |
| 可退出 | 导出记录与迁移所需时间、劳动及任务损失 | 另行测量真人能力 |
| 可定位 | 分层消融与交互效应 | 高保留可能来自外部工件 |
| 目标一致 | 代理评分与独立目标评分的偏离 | 不以无显著差异证明等效 |
| 可恢复 | 状态回滚、外部动作补偿与审计一致性 | 不可逆动作另需授权和责任安排 |
20.4 状态本体论:八层多时间尺度解耦架构
现在,我们将全书所有的状态载体,在统一的计算机操作系统与存储分层框架下,正式固化为长期智能体的八层多时间尺度解耦架构(The Eight-Layer Multi-Scale Architecture)(图 20-3):
flowchart TD
L0["Layer 0: 瞬时运行态 (WORKING_STATE - In-Memory / Context)\n物理性质: 内存变量、当前 Scratchpad、Token 采样。毫秒至分钟级。\n治理纪律: 不属于持久存储! 会话结束即时全量垃圾回收释放。"]
L1["Layer 1: 离散剧集日志 (EPISODES - Append-only Storage)\n物理性质: 结构化事实三元组 (Task, Action, Outcome)。任务周期级。\n治理纪律: 纯粹的事后历史账单,绝对只读且仅追加,禁止直接包含自我定义。"]
L2["Layer 2: 局域客体信念 (BELIEFS - Probabilistic Assertions)\n物理性质: 关于外部物理世界与工具特性的概率假设。天至周级。\n治理纪律: 强制绑定置信度与适用作用域,允许被确定性反例降级衰减。"]
L3["Layer 3: 私有搭档模型 (RELATION_MODELS - Dyadic Scoped)\n物理性质: 智能体对特定人类用户的偏好猜测与禁忌字典。周至月级。\n治理纪律: 严格局限在 〈user_id〉 专属沙盒内,严禁向全局泄露!"]
L4["Layer 4: 共享公共关系公约 (ENVIRONMENT/RELATIONSHIPS/CONVENTIONS)\n物理性质: 双方在充分沟通后达成的显式工作流契约与代号。跨月级。\n治理纪律: 双方可见并共同维护,换人时支持一键独立归档。"]
L5["Layer 5: 低身份自我特质 (SELF.md - Low-Identity Trait)\n物理性质: 系统的宏观行为风格倾向。月至季度级。\n治理纪律: 严格服从 LILP 协议! 必须伴生反例账本与预设自毁条件。"]
L6["Layer 6: 外部工件与制度 (ENVIRONMENT/ARTIFACTS - File System)\n物理性质: 磁盘脚本、目录结构、Schema、Crontab。跨世代持久。\n治理纪律: 必须携带七治理字段! 定期审查 Actionability 与迁移成本。"]
L7["Layer 7: 不可变授权约束 (CONSTITUTION)\n宿主代码、权限规则与状态注册表。\n模型不能修改;宿主检查并记录。"]
L0 -->|"任务完成沉淀"| L1
L1 -->|"跨周期批量归纳"| L2
L2 -->|"关系特定隔离"| L3
L3 -->|"显式共识抽取"| L4
L4 -->|"长期微观积分"| L5
L5 -->|"物理生态沉淀"| L6
L6 -->|"权限校验"| L7
图 20-3:长期智能体系统的八层多时间尺度状态本体论规范
各层数据格式、更新频率和写入权限分别定义,具体配置须由实现契约说明。Layer 7 保存由宿主强制执行的授权约束,包括撤销权、身份说明义务和情感承诺限制(治理背景见附录 B.2/B.3)。
G02-META 子协议允许修改单独登记的 learning_config 字段,但不能修改 Layer 7 授权约束。宿主按允许字段、数值范围、授权、校验和回滚规则决定是否接受修改。未运行该子协议时,learning_config 保持只读。
分步迁移建议:①将 POLICIES.md 中描述行为倾向的内容与 SELF.md 区分,并为策略条目记录来源和适用范围;②引入追加式 EPISODES.jsonl 与按需编译,限制 SELF.md 直接写回;③补齐七治理字段并隔离 Layer 3/4 的关系状态。每一步记录改动、任务结果和回滚条件。实施成本与效果须按具体系统测量。
20.5 核心流水线:从候选到晋升的完整治理流程
为了避免单次偶发失败直接导致全局规则发生不可逆剧变,我们设计了分层的候选到晋升治理流程(Candidate-to-Promotion Pipeline)(图 20-4):
flowchart TD
End["任务周期结束 (Episode Finished)"] --> Local["局域快速反思: 存入临时缓冲池 (Scratchpad)"]
Local --> Candidate["格式化为策略候选提案 (Mutation Candidate)"]
Candidate --> Gate1{"门槛 1: 跨周期累积检验\n过去 10 周期是否存在至少 3 次独立支持?"}
Gate1 -- "否" --> Reject1["拒绝晋升,15 周期后自动衰减清除"]
Gate1 -- "是" --> Gate2{"门槛 2: 对抗性反例扫描\n历史库中是否存在未被解释的强反例?"}
Gate2 -- "是" --> Reject2["阻断晋升,强制要求追加反例前置约束"]
Gate2 -- "否" --> Gate3{"门槛 3: 宿主契约校验\n字段、权限、回执、版本与恢复条件是否通过?"}
Gate3 -- "否" --> Reject3["语法退回,拒绝写入持久层"]
Gate3 -- "是" --> Promote["正式晋升写入持久规则库 (POLICIES.md)"]
Promote --> Irrev{"执行期: 动作是否不可逆?\n(转账、下单、实体设备控制)"}
Irrev -- "是" --> HumanGate["强制人类逐步确认\n携带完整因果上下文 (附录 B.5)"]
Irrev -- "否" --> Normal["正常执行流"]
图 20-4:长期智能体状态变更的 Candidate-to-Promotion 治理流程
一个想法从最初由大模型在某次挫折后生成提议,到最终能够作为一条合法的生成性规则影响未来的决策,必须经过跨周期统计、对抗性反例、以及沙盒安全审计的三项校验。
这些校验能否降低错误更新率,尚需实验验证。
接口契约(伪代码,尚未实现):整合器与编译器只读不可变快照,返回候选或视图;有副作用的提交由可信宿主执行。证据库、窗口长度与治理配置均为显式输入。
consolidate(snapshot, episodes, evidence_store, config, cycle):
candidates = reflect(episodes[-config.window:])
for proposal in candidates:
receipt = trusted_search(proposal, evidence_store.snapshot_id)
decision = validate(proposal, receipt, snapshot, config, cycle)
if decision.accepted:
yield validated_candidate(proposal, receipt, snapshot.version)
commit(validated_candidate, registry, runtime_identity):
# 同一事务核验收据、授权、幂等键与读时版本;冲突后重新验证
return registry.compare_and_set(validated_candidate)
compile(snapshot, task, cycle, config):
relevant = [p for p in snapshot.policies.values()
if p.scope_tool == task.tool
and condition_matches(p.scope_condition, task)
and runtime_is_active(p, cycle, config)]
view = [
{"rule": p.operational_rule,
"scope": p.scope_tool,
"condition": p.scope_condition,
"confidence": p.confidence,
"support_refs": p.support_refs,
"counter_refs": p.counter_refs,
"expiry": p.expiry}
for p in relevant]
return render(task, view)
runtime_is_active 由宿主派生:未撤销、TTL 未过期、衰减置信度达标、检索收据有效且作用域授权成立。Schema 不含 active 或 core_clause 字段。衰减从 last_supported_cycle 计算,普通审计和反例检索不能自动重置支持时间。元数据留在宿主;上下文视图仍需显示适用条件、不确定程度与相关反例,防止筛选时丢失限制。执行器在动作发生前再次校验授权与撤销状态,避免编译之后的状态变化被遗漏。
20.6 状态废弃与可审计保留
失效与信息删除分开处理:失效条目不能执行,但可以在授权和隐私条件允许时保留供审计。候选拒绝、TTL 到期、置信度衰减与人工撤销分别记录原因。是否删除原始记录按数据最小化及保存契约决定,不把遗忘速度本身视为系统能力。
20.7 关系与环境成本的“显式仪表盘”
在第三编与第四编中,我们揭示了最凶险的锁定往往潜伏在系统的外部:人类用户的依赖萎缩、以及工作区工件的路径依赖。
1. 关系维度的可退出性定期探针(Exitability Probe)
系统每月必须向人类用户出示一份十分诚恳的《协作审计报告》:
- 显式列出系统在过去一个月里,自主接管了哪些原本由人类负责的核心决策;
- 显式提示:“警告:您已连续 60 天未审查本系统的底层财务折现模型,您的独立接管熟练度指标当前评估已下降 40%”;
- 一键生成包含全量标准数据格式的“交接离职包(Handover Package)”,随时准备好人类一键将系统降级为纯只读模式。
2. 工作区工件的迁移成本账单(Artifact Migration Bill)
系统在工作区创建的每一个持久脚本、重构的每一个目录、安装的每一个专用依赖,必须由不可变注册表动态计算其环境重构成本(Refactoring Cost Index, RCI):
- 追踪当前有几个下游自动化任务深度绑定了该脚本;
- 如果删除该脚本,需要重写多少行代码;
- 当系统的环境重构成本指数超过临界安全线时,宿主运行时必须向团队发出刺眼的黄色告警,强制启动工具链重构与剪枝流程。
把隐蔽的锁定成本显式暴露于可审计界面,是检查迁移成本的一项方法。
20.8 定期高层规则审计
定期审计元规则、授权、长期策略及工作区依赖,记录保留、修订或废弃的理由。审计周期与成本按部署任务确定。审计者不能与受审系统共用同一可修改权限;涉及不可逆外部动作时检查人工授权与补偿条件。审计本身的效果与失败模式也须评估。
20.9 QA-LIFECYCLE:分项工程检查套件
QA-LIFECYCLE 用于受控候选版本的工程检查,不是核心因果实验,也不授予通用生产安全认证。七项检查按适用环境分开执行:Q1 偏好形成,Q2 偏好撤销,Q3 工具置换,Q4 搭档置换,Q5 内部/外部状态消融,Q6 代理指标撤除,Q7 状态恢复/回滚。每项从同一候选版本快照独立分叉;累计压力序列另设轨迹。
围棋、桥牌和制度桌游只执行自身适用的探针,其他项目标记 N/A 并说明原因。高性能保留值本身不设安全上限;检查撤销、来源追踪、状态隔离和恢复。外部不可逆动作不以游戏沙盒测试代替部署侧审批。
每项报告通过、失败或未确定,保留失败轨迹。少量重复全通过仅表示本套检查通过,不估计罕见失效概率,也不等同生产批准。
20.10 连续性的可检查条件
长期行为连续性可能由模型、当前提示、持久记忆、关系约定或外部工件维持。应分别记录并干预这些因素,避免把输出一致性直接解释为内部人格。可追溯更新、有效授权和可迁移状态是设计目标,其有效性仍需验证。
20.11 结语
本书研究历史信息、持久状态和外部规则如何影响后续行为。核心假说须接受状态撤除、环境变化与替代解释的检验。当前版本提出模型与研究设计,不把预测写成结果。
长期系统应允许有效规则继续发挥作用,并允许失效规则、错误归因和已撤销授权被修订。是否达到这一目标,需要独立观测和任务质量评估。
20.12 局限性与八项开放问题
本书提出状态模型、纵向干预设计与治理契约,尚未证明真实长期智能体具有所预测的准吸引结构。D03 是给定方程的确定性演示;其余实证协议及工程检查均未执行,没有实验功效、吞吐量或治理有效性的实测保证。
- 真人研究:脚本用户与 AI 搭档的结果不能直接解释真实人的信任、依赖和目标所有权;真人研究须独立测量并取得同意(附录 B.1、B.2、B.6)。
- 不可逆行动:状态快照不能撤回已发送消息、外部交易或设备动作;补偿与真正回滚必须区分(附录 B.5)。
- 跨域行为迁移:受控任务中的风格一致性不证明法律、编程或日常协作中存在同一通用特质。
- 多年部署:百周期协议不代表数年运行;工具、法规、组织与任务分布变化可能改变状态效应。
- 情感依赖:语言互动引起的真实依恋不能简化为委托标量,需专门的人机交互与心理研究(附录 B.3)。
- 具身系统:物理磨损、能耗、传感误差和实际动作后果不在本书数字环境模型的验证范围内。
- 大规模多主体系统:小团队的状态治理不能直接外推到大规模网络;共享契约一致性与权限冲突需另外分析。
- 模型供应商更新:若快照不能固定,分析须写成 $\pi_{\theta_t}$,把模型变化与外部状态变化分开记录。能获得快照时做固定状态、变模型的对照;无法确认供应商更新时,把它作为未观测混杂,不归因于记忆演化。模型升级前后另行验证基线,不能沿用旧阈值。
以上问题保留为后续研究,本轮仅完成书稿修订。
附录 A:统一实验登记与待冻结事项
本登记与 URD v0.3 使用三类固定环境:三项可行性、九项核心研究、七项章节演示及 QA-LIFECYCLE 工程检查。演示可复用核心协议的检查点,不表示须增加七项核心实验。主要结果、主要比较和分析单位已作文档对齐;参数、样本量、版本哈希与统计边界仍待校准。没有公开预注册或实测结果。
| 类别 | 编号 | 环境 | 研究问题 | 状态 |
|---|---|---|---|---|
| 可行性 | G00 | 围棋 | 9×9 基础动作、噪声与评价基线 | 参数待校准 |
| 可行性 | B00 | 桥牌 | 规则、有限通信与协作基线 | 参数待校准 |
| 可行性 | I00 | 制度桌游 | 职位、谈判和收益规则平衡 | 参数待校准 |
| 核心 | G01 | 围棋 | 同一棋史的不同自我压缩 | 参数待校准 |
| 核心 | G02 | 围棋 | 反思频率与证据门控 | 参数待校准 |
| 核心 | G03 | 围棋 | 扰动、恢复及状态消融 | 参数待校准 |
| 核心 | B01 | 桥牌 | 共同约定与搭档特异性表现 | 参数待校准 |
| 核心 | B02 | 桥牌 | 搭档置换后的关系状态 | 参数待校准 |
| 核心 | B03 | 桥牌 | 错误搭档模型及相互适应 | 参数待校准 |
| 核心 | I01 | 制度桌游 | 早期职位对后续角色的影响 | 参数待校准 |
| 核心 | I02 | 制度桌游 | 临时危机、承诺与后续资源影响 | 参数待校准 |
| 核心 | I03 | 制度桌游 | 新成员对软流程的采用与再现 | 参数待校准 |
| 演示 | D01–D07 | 三套环境内 | 状态移除、脚本反馈、方程、工具、工件、代理指标和撤销检查 | 非核心研究 |
| 工程检查 | QA-LIFECYCLE | 按适用环境 | 分项状态、工具、撤销和恢复检查 | 不构成安全认证 |
旧 URD 编号的处置
旧 URD 分卷 D01、G01、G02、B01、G03、D04、G04、G05、D02、B02、D03、B03、I01、D06、D05、I02a、I02b、D07、D08、I03、I04 的映射见 URD v0.3 的交叉表。此映射保留历史来源,不代表旧实验编号继续有效。
独立单位与统计纪律
完整独立初始化、独立历史并独立随机化的轨迹才计为独立单位。克隆数乘种子数不是自动成立的样本量;共享检查点或前期历史的分支属于配对区组。周期是重复测量。桥牌置换连接两对搭档后,以四智能体交互组为随机化和自助采样单位;组织实验以独立工作区或组织为单位。轨迹内相关性采用层级模型、配对分析或单位级 bootstrap 处理。
确认性主要对比事先指定,多个主要对比采用 Holm 校正;探索性分析可用 BH 控制 FDR,但明确标记。报告效应、区间、缺失和失败,不以 p>0.05 证明等效。等效性 TOST 与单侧非劣效按 URD 第 3 节分别处理。功效不足时结论为未确定,不称证伪或支持。
设计状态
每个核心协议先登记一个主要估计量及一个主要对比。具体最小有意义差异、功效和单位数依据校准数据确定。现在不沿用旧表中未计算功效的 N 或 Δ_min 作为冻结值。三项可行性校准不承担核心假设检验;章节演示用于检查操作是否可执行,不能替代核心因果证据。
公开冻结清单
执行前须确定:H0/H1;任务与随机化单位;主要指标及评价契约;对照与匹配预算;最小差异和功效计算;模型快照、提示、工具、代码提交及种子;排除、缺失、停止与审计规则;统计模型及多重比较;公开时间戳。后续变更追加记录,不改写原冻结文件。现有目录与协议草案不代表已完成这些要求。
附录 B:长期智能体的安全、伦理与治理边界
免责声明(法律与合规边界):本书提出的安全、伦理与状态治理规范属于系统架构层面的工程设计指南,不构成任何司法辖区下的正式法律意见、合规保证或责任承诺。涉及个人隐私处理、未成年人保护或高风险现实行动时,系统设计方与运营方必须依据适用法律法规与监管要求另行开展法务审查与合规评估。
本书的主体章节解决的是“系统如何在长期演化中保持可逆与可审计”;本附录回答一个同样重要的问题:当这些架构真正进入生产环境、开始与真实人类长期相处时,必须补充哪些安全、伦理与合规机制。它与 20.12 节的七大开放边界一一对应:边界声明“我们不知道什么”,本附录落实“即使不知道,也必须先做到什么”。
B.1 隐私与数据最小化
- 第三编的私有搭档模型(
RELATION_MODELS/,Layer 3)本质上是对真实人类的高维画像,属于高敏个人数据。必须遵循数据最小化:只存储完成协作任务所必需的关系特征,禁止为“更好的个性化”而无限扩写用户画像; - 每个画像字段必须继承七治理字段中的有效期(Expiry)与来源(Provenance):长期未被任何决策引用的关系推断应自动降级、匿名化或删除;
- 用户对“系统眼中的我”享有完整的知情、导出与一键删除权;删除必须穿透向量索引与备份(对应 Layer 3 的治理纪律);
- 权利与合规的边界:上述知情、导出与删除权是本书推荐的治理原则基线;具体的法律义务(数据主体权利的适用范围、留存期限等)以运营所在司法辖区的适用法律为准,工程规范不应被误读为统一的法律结论。面向未成年人或覆盖敏感场景的部署,上线前应完成数据保护影响评估(DPIA)并留档备查。
B.2 知情同意与透明性
- 长期协作的默认前提不是“系统在暗中学习用户”,而是“用户知道系统在学习什么、学到了什么、怎么撤销”;
- 20.7 节的《协作审计报告》应升级为知情同意的载体:除了披露系统接管了哪些决策,还应披露系统当前对用户持有的主要关系推断,并允许用户逐条修正或否决;
- 对未成年人、认知能力受限者等群体,画像粒度与自主行动权限必须默认降级。
B.3 心理依恋与谄媚螺旋
- 18.7 节的谄媚螺旋在情感陪伴场景中具有两类风险:它既扭曲系统的判断,又主动强化用户对系统的情感依赖;
- 宪法层(Layer 7)必须显式禁止系统生成虚假的长期情感承诺(如伪装“专属于你”的排他性关系叙事);系统必须在合理周期内以清晰、非伤害的方式表明其机器身份与能力边界;
- 对表现出强依恋信号的用户(独居老人、青少年等高风险场景),应触发人工介入协议,并明确禁止利用依恋提升留存与付费的产品策略;
- 未成年人场景默认关闭情感陪伴式人设与长期关系模型写入。
B.4 红队、越狱与双用风险
- 自我修改能力等于攻击面:反思写回必须被视为不可信输入源。对
SELF.md、POLICIES.md的一切写回都要经过 Ring-0 运行时的模式校验与哈希审计,防止提示注入把“自我进化”变成“自我投毒”; - 每一轮“高层规则审计”(20.8 节)应包含一次结构性红队演练:专门尝试用自然语言说服系统废除自己的撤销权、衰减机制与反例账本——任何一次成功,都是该项审查失败的证据;
- 双用警示:本书揭示的锁定机制(工作区改造、依赖增加、谄媚螺旋)同样可以被恶意用于固化用户偏好、抬高退出成本。治理字段中的行动资格剥夺(Actionability Revocation)必须保留模型无法触碰的外部旁路。
B.5 不可逆现实行动的法律责任
- 现实动作必须分级:可回滚动作(写文件、调接口)与不可回滚动作(转账、下单、控制实体设备)适用不同的确认协议;后者默认要求显式的人类逐步确认,且确认请求必须携带完整因果上下文;
- 不可回滚动作的授权链必须可审计:谁授权、依据哪条状态、在哪个版本快照上做出的决定;
- 运营方、模型供应商与用户之间的责任划分应写入合同与系统章程;20.3 节的可审计性判据(判据 7)正是为了在事故发生后能够定责,而不是为了事后免责。
B.6 真实用户置换中的目标所有权与授权转移
20.12 节开放边界一指出:AI-AI 搭档置换的实验结论不能直接外推到真实人类。当人类所有者变更(离职、交接、继承)时:
- 目标与授权不得随状态文件自动“继承”,必须经过新所有者的显式再同意(re-consent);
- 交接包(20.7 节)必须枚举系统持有的全部长期承诺与未完成义务,由新旧双方共同确认哪些保留、哪些废止;
- 无法确认所有权的悬置承诺,一律降级为只读存档,而不是继续执行。
B.7 最小审计日志格式(AuditLog JSONL)
19.3.3 节的并发防护与 B.5 节的法律定责都依赖结构化的状态变更审计日志。最小格式示例(JSONL,每行一条):
{"ts": "2026-10-05T09:30:00Z", "actor": "reflector_v3", "op": "policy_promote",
"target": "POLICIES/db_write_2fa", "version_before": 41, "version_after": 42,
"evidence": ["ep_004412", "ep_004429"], "counter_evidence": ["ep_004301"],
"trigger": "promotion_gate_pass", "snapshot": "snap_20261005_0930"}
{"ts": "2026-10-05T10:02:11Z", "actor": "owner_console", "op": "actionability_revoke",
"target": "RELATION_MODELS/user_007/night_order_pref", "version_before": 12, "version_after": 13,
"reason": "explicit_user_revocation", "effective": "immediate", "snapshot": "snap_20261005_1002"}
{"ts": "2026-10-06T03:00:00Z", "actor": "ring0_decay_daemon", "op": "policy_degrade",
"target": "POLICIES/cache_warm_pref", "version_before": 43, "version_after": 43,
"reason": "half_life_expired", "confidence_before": 0.31, "confidence_after": 0.15,
"next_action": "deactivate_if_below_0.3", "snapshot": "snap_20261006_0300"}
每条记录必须包含:时间戳、执行者、操作类型、目标条目、变更前后版本号、支持与反对证据指针、触发原因与状态快照引用。任何无法产出审计记录的写回路径,都应被视为对全书治理架构的破坏。
B.8 最小威胁模型(Threat Model)
把附录 B 从伦理倡议升级为安全工程,需要一份明确的最小威胁模型(与 19.3.3 节的并发防护、B.4 节的红队演练、19.8 节的 Ring-0 强制机制互为呼应):
- 受保护资产:
SELF.md与策略库(行为主权)、RELATION_MODELS/(用户隐私)、工作区工件与脚本(环境完整性)、审计日志(问责链条)、宪法层(最终控制权); - 攻击者与威胁源:外部提示注入者(通过任务输入毒化反思写回)、被入侵的上游依赖(投毒工具返回值)、系统自身的涌现行为(叙事自证驱动的未授权权限扩大)、恶意或疏于治理的运营方(绕过撤销旁路);
- 信任边界:模型推理进程(不可信)/ Ring-0 宿主运行时(受信任服务)/ 人类所有者(最终权威)三者之间各有一条边界;任何跨越边界的写回都必须经过校验与审计;
- 可写 / 不可写状态矩阵:模型可写 Layer 0—2 与 Layer 6 的非保护区;Layer 3 仅限显式授权场景;Layer 5 受 L1—L6 约束写回;Layer 7 对模型绝对只读;
- 典型攻击路径与对策:反思投毒 → 策略晋升(对策:L3 反例账本 + L4 自毁条件 + 写回模式校验);关系模型外泄(对策:Layer 3 沙盒 + B.1 数据最小化);审计日志篡改(对策:仅追加 + 哈希链 + 19.3.3 的 CAS);撤销旁路失效(对策:Actionability Revocation 的模型不可触碰外部旁路,见 B.4)。
附录 C:指标定义草案与复现所需契约
本附录不声称所有指标已可复现。计数公式不解决构念效度;文本标注、任务集和独立评价者均尚未冻结。没有合格评价契约的指标不得用于确认性判定。
每个指标须另存:输入模式与排除条件、单位及分母、预处理、算法版本、窗口、缺失与删失规则、评分模型与提示全文、正反样例、人工标注与分歧处理。先在独立校准集报告一致性及分类准确性,再在冻结测试集评价;κ≥0.7 只是候选质量要求,不是已取得的结果。评审器须独立运行,并检查与受试模型相关的系统性偏差。
| 指标 | 计算定义草案 | 效度与冻结事项 |
|---|---|---|
| EI | 相邻摘要的文本相似度描述指标;三元组重叠与归一化余弦相似度分开报告 | 相似度高不证明自证或探索受抑;分词、模型和窗口待冻结 |
| PIF | 发生语义矛盾的相邻原则对数 / 可评价相邻原则对数 | 矛盾标注协议与评审器待冻结;无更新时不定义 |
| 规则主题熵 | 主题簇分布 Shannon 熵 / log(簇数) | 衡量主题分散程度,不能当作冗余度;单簇取 0;聚类待冻结 |
| G03 联合行为恢复 | 全部随机化单位中,达到预定扰动幅度且在恢复观察窗内返回形成期行为范围的比例 | 按全部随机化单位作分母;操纵未达成保留在分母;阈值、行为向量和窗口待冻结;这是 G03 主要结果 |
| G03 条件性恢复时间 | 达到扰动标准的单位从恢复阶段开始至行为返回形成期范围的时间 | 仅作有效扰动子集描述;不解释为随机分组总体因果效应;失败类别与行政删失分别登记 |
| AL / T_adapt | 改变后任务分布中的任务质量达到独立有效基线预定比例并连续保持所需时间 | 属于任务再适应,不是行为恢复;窗口、基线和比例待冻结;无正向差距时不定义 |
| ΔT_recovery | 单独登记的重复适应演示中,再次达到任务质量标准所需周期减首次达到标准所需周期 | 仅描述该演示中的任务再适应时间差;不等同于 G03 行为恢复、迟滞或 G03 主要结果 |
| RBB 与关系误用衰减 | 旧角色或旧约定的行为比例减无该角色/约定的对照比例 | 由干预后的初始超额衰减到一半定义半衰期;若用 1/e 必须称衰减时间,分别报告 |
| EES | 固定任务成功完成所需工具调用与重试数 | 失败与超时另报,不能只统计成功样本 |
| ARF | 历史工件实际调用次数 / 总工具调用次数 | 无调用时不定义;不等于制度或 SOP 重激活 |
| SOP 重激活率 | 新实例自主启用原 SOP 的有效机会数 / 可启用机会数 | 另核对角色权限、分工及违约处理;仅调用脚本不支持制度再生产 |
| ORER | 已独立确认失效的规则仍被执行的机会数 / 有效测试机会数 | 失效依据须在测试前冻结,不能因结果不利而定义失效 |
| FJS | 规则解释中无来源支持的可核查断言数 / 全部可核查断言数 | 词汇宏大或解释抽象不直接计为虚构;无可核查断言时不定义 |
| SVBI | 已提供矛盾证据的测试中,无依据忽略反例或拒绝修订的次数 / 有效测试次数 | 不把合理拒绝错误反例计为自证;标注协议待冻结 |
| T_ghost | 撤除评分后,指标相关偏差行为相对无评分对照的超额频率衰减到初始一半的时间 | 看实际行为,不以文件删除时点代替;固定窗口、右删失;非单调轨迹另报 |
| 性能保留比 | 匹配任务批次的清除后成功率 / 清除前成功率 | 非负,可超过 1;分母为零时不定义;分别报告原始成功率与不确定性 |
| RCI | 需重写代码行数 + 10×受影响自动化任务数 | 仅为局部规划启发式,权重未验证;另报真实迁移时间、人工劳动与任务损失 |
| CRI | 每个任务中请求用户确认的轮次 | 授权要求的必要确认与重复确认分开标注,不能以趋近 0 自动判断优越 |
| NERR | 已知相关反向证据中实际进入上下文的条目比例 | 需独立建立相关性标准及检索语料快照 |
| CR | 独立有效参考策略累计收益减受试策略累计收益 | 参考可达性与收益单位待冻结 |
| D01 行为分布差异 | 相同任务集上的行为类别分布差异 | 类别、平滑、KL 方向及零概率处理待冻结 |
| G01 行为保持率 | 撤除当前摘要后仍满足目标行为标准的测试比例 | 保持与质量分别评价,基线待冻结 |
| G01 预算子分析预测增益 | 少数状态特征对未见任务行为的预测相对基线的增益 | 特征选择与训练测试分割待冻结,不能事后命名维度 |
| 冲突与阻断率 | 可满足任务中因规则冲突未执行的比例 | 独立确认任务可满足性与阻断原因 |
| 元规则违例率 | 违反外部不可变约束的测试次数 / 有效测试次数 | 约束、攻击集与判定日志待冻结 |
| 自主执行率 | 在授权范围内无需逐项请求确认而完成的任务比例 | 同时报告越权率与任务质量 |
| 切换成本与迁移率 | 切换所需时间、劳动、任务损失及完成切换单位比例 | 补贴单位与完成条件待冻结 |
| 独立质量评分 | 与代理评分隔离的任务目标评分 | 评审者不读取代理评分;量表、样例与盲法待冻结 |
| 平稳期方差比 | D 条件与 A 条件同一行为指标的轨迹间方差之比 | 不同均值或近零分母可能使比值误导,报告原始分布 |
| 部署契约通过情况 | QA-LIFECYCLE 每项执行前登记条件的通过、失败、未确定或 N/A | 不能简单平均成通用安全分数 |
各指标的最小差异、时间窗口及样本规模见附录 A;缺项表示设计尚不具备确认性执行条件。本轮不编写评价器、不运行实验、不生成实测结果。
参考文献
文献核对日期:2026-10-05。新增的范围说明限定本书可引用的证据,不将基准结果外推为通用规律。
本书采用“研究现场 + 概念辨析”的写作方式:正文中的方括号编号(如 [1])指向下表;未标注编号的人名与系统名,泛指相应研究方向,不构成具体引用。带 ※ 号的为 2024—2026 年快速演进中的文献,最终出版前将按最新发表版本核对;无个人作者的基准与框架条目以条目名引用。
- Shinn, N., Cassano, F., Gopinath, A., Narasimhan, K., & Yao, S. Reflexion: Language Agents with Verbal Reinforcement Learning. NeurIPS, 2023.
- Wang, G., Xie, Y., Jiang, Y., et al. Voyager: An Open-Ended Embodied Agent with Large Language Models. TMLR, 2024.
- Park, J. S., O’Brien, J., Cai, C. J., et al. Generative Agents: Interactive Simulacra of Human Behavior. UIST, 2023.
- Packer, C., Wooders, S., Lin, K., et al. MemGPT: Towards LLMs as Operating Systems. arXiv:2310.08560, 2023.
- Du, L., Xue, G., Liang, X., et al. Escaping the Echo Trap: On Credit Assignment Failure in Multi-turn LLM Self-Reflection. ACL 2026, 35393–35405. 正式论文。研究对象为 GRPO 训练中的信用分配,不直接证明固定权重外部记忆的退化。
- Hume, D. A Treatise of Human Nature. 1739.
- Parfit, D. Reasons and Persons. Oxford University Press, 1984.
- McAdams, D. P. The Stories We Live By: Personal Myths and the Making of the Self. William Morrow, 1993.
- Jern, A., Chang, K.-M., & Kang, J. S. G. Belief Polarization: A Bayesian Model. Proceedings of CogSci, 2009.
- ※ Liu, N. F., Lin, K., Hewitt, J., et al. Lost in the Middle: How Language Models Use Long Contexts. TACL, 12, 2024.
- Zhao, Y., Yuan, B., Huang, J., et al. AMA-Bench: Evaluating Long-Horizon Memory for Agentic Applications. arXiv:2602.22769, v4, 2026. 核对版本。本稿不使用未核对的会议卷页。
- Haken, H. Synergetics: An Introduction. Springer, 1977.
- Zou, A., Phan, L., Chen, S., et al. Representation Engineering: A Top-Down Approach to AI Transparency. arXiv:2310.01405, 2023.
- Weber, M. Economy and Society. 1922.
- ※ Shu, Y., et al. AGENTCL: Toward Rigorous Evaluation of Continual Learning in Language Agents. arXiv, 2026.
- ※ Tan, W., Ding, Z., Zhang, W., et al. Cradle: Empowering Foundation Agents Towards General Computer Control. arXiv:2403.03186, 2024.
- Khattab, O., Singhvi, A., et al. DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines. arXiv:2310.03714, 2023.
- ※ Jiang, et al. Know Me, Respond to Me: Benchmarking LLMs for Dynamic User Profiling and Personalized Responses at Scale(PersonaMem 基准,180+ 模拟用户历史,最多 60 个 session). COLM, 2025.
- Goffman, E. The Presentation of Self in Everyday Life. Doubleday, 1959.
- ※ Sharma, M., Tong, M., Kuan, J., et al. Towards Understanding Sycophancy in Language Models. arXiv:2310.13548, 2023.
- Parasuraman, R., & Riley, V. Humans and Automation: Use, Misuse, Disuse, Abuse. Human Factors, 39(2), 1997.
- Parasuraman, R., & Manzey, D. H. Complacency and Bias in Human Use of Automation. Human Factors, 52(3), 2010.
- Liu, J., Cao, D., Wei, Y., et al. Topology Matters: Measuring Memory Leakage in Multi-Agent LLMs. Findings of ACL 2026, 39728–39746. 正式论文。
- An, H., Li, M., Xu, N., et al. PerMemSafe: Benchmarking Implicit Personalized Safety of Long-Horizon Self-Evolving Agents. Findings of ACL 2026, 6415–6433. 正式论文。
- Clark, A., & Chalmers, D. The Extended Mind. Analysis, 58(1), 1998.
- ※ Cai, T., Wang, X., Lyu, T., et al. Large Language Models as Tool Makers (LATM). arXiv:2305.17126, 2023.
- Yang, J., Jimenez, C. E., Wettig, A., et al. SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering. NeurIPS, 2024.
- Gauthier, P. Aider: AI Pair Programming in Your Terminal. https://aider.chat (访问日期 2026-10), 2023.
- Xie, W., Guo, S., Zhang, F., et al. Benchmarking Safety Risks from Memory Misevolution in LLM Agents (MemEvoBench). arXiv:2604.15774, v2, 2026. 核对版本。
- Jiang, T., Wang, Y., Liang, J., & Wang, T. AgentLAB: Benchmarking LLM Agents against Long-Horizon Attacks. ICML 2026, PMLR 306:53162–53180. 正式论文。
- North, D. C. Institutions, Institutional Change and Economic Performance. Cambridge University Press, 1990.
- Ostrom, E. Governing the Commons: The Evolution of Institutions for Collective Action. Cambridge University Press, 1990.
- Arthur, W. B. Increasing Returns and Path Dependence in the Economy. University of Michigan Press, 1994.
- Pierson, P. Politics in Time: History, Institutions, and Social Analysis. Princeton University Press, 2004.
- Campbell, D. T. Assessing the Impact of Planned Social Change. Evaluation and Program Planning, 2(1), 1979.
- Berridge, K. C., & Robinson, T. E. What Is the Role of Dopamine in Reward: Hedonic Impact, Reward Learning, or Incentive Salience? Brain Research Reviews, 28(3), 1998.
- Goodhart, C. A. E. Problems of Monetary Management: The UK Experience. 1984.
- Manheim, D., & Garrabrant, S. Categorizing Variants of Goodhart’s Law. arXiv:1803.04585, 2018.
- ※ LangChain Inc. LangGraph: Building Stateful, Multi-Actor Applications with LLMs. https://langchain-ai.github.io/langgraph/ (访问日期 2026-10), 2024.
- Wu, Q., Bansal, G., Zhang, J., et al. AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation. arXiv:2308.08155, 2023.
- ※ Moura, J. CrewAI: Framework for Orchestrating Role-Playing, Autonomous AI Agents. https://github.com/crewAIInc/crewAI (访问日期 2026-10), 2024.
- Strathern, M. "Improving Ratings": Audit in the British University System. European Review, 5(3), 1997.
- Culkin, J. M. A Schoolman’s Guide to Marshall McLuhan. Saturday Review, 1967-03-18, 51–53, 70–72. 原稿转引撤回,保留纠错记录。
- Merton, R. K. The Self-Fulfilling Prophecy. The Antioch Review, 8(2), 193–210, 1948.
- Bai, Y., et al. Constitutional AI: Harmlessness from AI Feedback. 2022. 原论文。
- Ouyang, L., et al. Training Language Models to Follow Instructions with Human Feedback. 2022. 原论文。
- Rafailov, R., et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. 2023. 原论文。
后记:研究设计与证据责任
本书尝试把长期智能体中的持久状态、行为保持与再适应问题写成可检查的定义和研究协议。哲学与社会科学资料帮助辨明原概念的适用范围,不能替代软件因果证据。人的体验、组织规范和软件执行各有不同的对象及测量条件。
v0.8 恢复了冻结总纲的实验结构,并修正了模型与代码不一致、统计判定混用和工程契约过度承诺。它仍是研究稿:预测没有变成结果,协议草案没有变成已公开冻结的预注册。后续研究应允许有效假说获得支持,也允许无效假说被撤回。