舌尖上的蜘蛛:Anthropic 发现大模型内部的“未言之语”记忆区

问克劳德,那种会织网的动物有多少条腿,它回答是八条。 问题中根本没有出现“蜘蛛”这个词,回复中也未提及。 然而,在模型处理过程进行到一半时,Anthropic 的研究人员还是意外地发现了这个词——它被作为某个词在模型内部保留了下来, 而此时模型正准备使用这个词。只要把那个内部词替换成“蚂蚁”,模型在其他一切保持不变的情况下, 竟然给出了六条腿的答案。

这比听起来要奇怪得多。在这次对话中,没有人曾在任何地方输入“蜘蛛”。 也没有人训练过模型,在回答关于腿数的问题之前,先将一个专有名词储备起来。 然而,这个词却在流程进行到一半时出现了——而且它完全发挥了作用,就像你心里在说出口前, 那句“蜘蛛”所扮演的角色一样。

这项实验源自 一篇发表于2026年7月6日的论文 Anthropic,而之所以将其视为一项里程碑式的研究,恰恰反映了现代人工智能的一个侧面——一个大多数人从未真正理解过的方面。 没有人真正知道这些系统是如何运作的:无论是批评者,还是从严格意义上讲,那些构建这些系统的公司, 都一无所知。而这项新研究以一种独特的方式缩小了这种无知的范围:研究发现, 在 Claude 体内,存在着一段由未言明的词汇构成的小型工作记忆,Anthropic 将其称为“J 空间”。外人可以在任务进行到一半时读取这段记忆,而一旦覆盖掉其中某一条记录, 模型接下来的行为就会随之改变。

成长而非构建

普通软件是写出来的。在某个地方,有一行代码负责计算你应缴纳的税款,而一个人恰好能指向那行代码。 但大型语言模型则截然不同:它由数千亿个数字——也就是参数——组成,而这些参数并非由人类亲自选定。 在训练过程中,成千上万条文本被源源不断地输入系统,并不断调整这些数字,以使模型下一句预测的词语更接近实际结果, 且误差尽可能小。当这一过程在工业规模上反复进行时,最终诞生的,竟是一些能够起草合同、 还能用葡萄牙语调情的智能体。这些能力并不是由人类预先编程好的,而是通过长期积累而逐渐形成的。

Anthropic 可解释性团队的创始人克里斯·奥拉描述这类系统为:“gr…”

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论