J-lens探索:用Jacobian SVD拆解Gemma-4-31B各层的控制空间

序言

注:本文最初是为Neel Nanda的MATS流申请撰写的。分析大约只完成了30%,但我觉得它仍然可能很有趣

快速数学入门

作为背景,你可以阅读J-lens的论文给你虽然不需要用来理解上下文。

首先,我想简要回顾一下如何在J-lens论文的语境下理解雅可比矩阵。雅可比矩阵是从第层到第层的映射的局部线性化(为了简化,我在这里就把计算当作固定token来理解)。

该变换回答了这样一个问题:“如果我向第层添加,运行模型后它对第这一层会产生怎样的影响?”换句话说,可以让我们局部回答当我们在第一层添加引导向量时,层会发生什么。

其中一个特别有用的映射是,因为它提供了第一层局部变化与模型实际输出之间的映射。因此,它是对层如何因果影响模型行为的非常有用的替代。

因此,研究可以让我们研究每层的局部“引导/影响”空间是什么,并将它们相互比较。

雅可比矩阵的奇异值分解(SVD)为我们理解映射提供了一种特别好的理解方式。一个的SVD将其分为三个矩阵,其中和是正交归一矩阵。

我们可以把“引导矩阵”看作是将空间分解为引导向量。实际上,等价于寻找一个(单位长度)方向以最大化对对数的影响(即),然后找到一个与正交的向量以最大化对数效应,再找到第三个正交向量,最大化对对数值的影响,依此类推。

因此,我们将空间拆分为可用来改变输出的旋钮集合,按强度排序。告诉我们每个旋钮的强度,(“写入矩阵”)是一个映射,说明每个旋钮如何写入logits。

我们也可以把某层的读取方向看作——告诉我们读取的旋钮/方向,告诉我们强度,以及每个旋钮的作用。

探索J透镜

由于每个雅可比矩阵本质上就是每一层对导向空间的分解,研究这些引导向量的作用似乎是理解空间的好方法。或许逐个例子研究每层雅可比矩阵的 SVD 本身就很有趣,但 J-lens 论文有个不错的想法,就是在多个不同情境下平均雅可比矩阵。

这里的动机是,上下文特定效应应当平均化,剩余矩阵应表示从一层到logit空间的稳定传输部分。在SVD语言中,效果是我们现在根据平均效应的大小来对每个方向进行评分。

这鼓励了能够持续写入几乎相同方向的旋钮,抑制了倾向于写入多个不同方向的旋钮。这样,平均后的雅可比矩阵的引导矩阵实际上应对应于引导向量。

带有大方向的方向是指加法应对输出对数值产生一致且较大影响的方向,跨越多个不同实例。

这篇文章的其余部分比较开放式地探讨了Gemma-4-31B(基础模型)不同层的转向方向。我还要提一下,因为这里的目标是研究每层模型的“工作区”,我对Anthropic论文中使用的方法做了一些调整和调整,使地图更好地代表对模型真正重要的方向。我把相关背景放在可折叠部分,所以除非你感兴趣,否则很容易跳过。

我会用第一层的 J-透镜矩阵符号表示(这是在应用对角增益和未嵌入的矩阵之后)。直观上,我们可以把它看作是 Jacobiian 的平均值,取平均了提示和标记位置。这并不是 J-透镜对象的具体内容——我在可折叠部分会谈到——但直观上这是个不错的思考方式。

在我们开始分析每层向量之前,先让我们先了解这个模型。如果我们进行SVD分解,可以通过观察来测量每层输出的相似度。这与Anthropic在论文中计算的线性CKA相同,但这样写会让解释更清晰。

gram矩阵告诉我们矩阵的几何形状,因此表明一个层的输出几何形状与另一个层的相似度。两个输出高CKA的层在logits中写入同一空间。

同时,我们还可以绘制输入端,告诉我们不同层是否从相同方向读取。


这里的结果与我们在Anthropic模型中看到的大致结构相符(他们只绘制输出端CKA):一个早期的“感官”区块,一个中间的“工作区块”,以及一个非常短的“运动区块”。除了起始,输入和输出几何体主要匹配:写入相同logit的层也会从相同方向读取。

在该模型中,分隔“感官”和“工作区”的接缝位于L25,因此主要需要注意的是该层是L25之前还是后层。

从高层来看,我们应预期早期的引导方向对应更多代币级信息,中间层对应抽象和语义意义,最后层直接影响输出的代币。

探索引导向量

如果你想自己探索这些部署,所有发布/数据都可以在一个相对易读的网页中访问给你(注意,很多AI解说都内置在这个页面里——大部分方向正确,但并不总是有用)。

数学/方法论侧栏

这一部分更偏向数学,主要对方法感兴趣的人很有用。这里的主要讨论是我对J透镜做了哪些改动以获得转向向量,以及原因。

如果你读过 J-lens 论文,可能已经注意到,即使是单个例子(即取平均前)的 J-lens 矩阵也不是雅可比矩阵。对于 CKA 计算,我们会计算矩阵,其中 是其范数、径向投影等前的最后一层,然后乘以未嵌入矩阵得到 。虽然这在数学上看起来有些奇怪,但计算上要方便得多。词汇空间(Gemma)的维数为 ~200k,而最终隐藏状态的 ~5k 则是。通过观察 ,我们可以将原始映射近似分解为一个更低维的映射到最终层,然后希望 。

利用近似 并绘制输出 CKA 图,得到这张图。

Pasted image 20260902184137.png

这显然是错误的......问题在于Gemma-4的对角线增益极度偏斜。有些方向被压缩的幅度是其他方向的30倍。如果这个方向的尺度降低到1/30倍,那么如果这个方向同样重要,在隐藏空间中移动应该容易30倍。

问题在于,在最后一层大量移动残余流并不一定意味着对数移动很多。在这种情况下,映射并不能准确反映不同方向对对数空间的重要性。

如果我们改为近似,则得到熟悉的图

image.png

有趣的是,只去除前8个通道,我们会回到大致相同的空间。

image.png

这个练习的重点是,选择错误的度量来衡量影响,可能会产生在“真实”因果工作空间中不存在的虚假方向。在这种情况下,仅仅以欧几里得范数来衡量影响,说明几乎所有的方差都只有少数极具影响力的方向。然而,当我们切换到更符合影响的指标时,发现这些方向实际上非常重要。事实上,在对角线上那些被省略的SVD上方方向进行引导,产生的影响相当有限。这些方向在欧几里得范数中看起来很重要,但在对数范数中却不重要。

因此,为了创造一个有用的研究空间,我尝试寻找更好的因果影响测量方法。我没有一个非常令人满意的答案,我认为在设计上有很多空间可以根据你对“工作空间”的定义来判断影响。

我主要的动机是想研究导致早期层高度相似的原因。我发现几乎每个顶层的方向,都是在极其分散的标记集合上加一点概率。顶部方向有能量,但其推动力的部分集中在那些在我126k语料库中根本没有出现的标记上。它推送的前1000个标记只携带能量,所以本质上只是给大量随机标记添加了一点点能量。问题是测量logit空间的变化很容易,但只有当能量集中在我们当前输出分布中实际存在的标记时,方向才真正有影响力。

如果你考虑衡量logit空间变化的度量,数学上它和从均匀分布中抽样时测量的增量KL变化是一样的。但当然,我们的抽样结果和均匀分布完全不同——更好的做法是测量从分布抽样产生的方差变化。因此,一个自然的选择是将度规从logit空间中的欧几里得范数改为(局部的)KL散度。我发现无穷小KL散度过于偏离值支配,所以方向是根据KL平方根的影响计算的(这也等于标准差,所以这至少有一定原则性)。

因此,所用方向是通过从SVD切换得到的,SVD贪婪地(大致地)优化方向在logit空间中的平均推力大小,换成标准差变化的平均大小。这有点不方便,因为这不再是一个线性优化过程,所以你得到的向量不一定是规范的。不过这似乎基本不是问题——我从三个不同的起点优化了向量,检查了收敛到的向量是否相同,它们几乎总是两两余弦大于,中间层的两两余弦基本上是1.0。

回顾一下:我们已经将每层拆分为其最具影响力的转向旋钮/方向,现在正在检查这些旋钮是否可解释以及它们的影响。理想情况下,这应该能让我们了解每个层模型中哪些变量对模型影响最大。研究这些变量应该能让我们了解模型的工作空间是什么样子,以及它如何随着各层的演变。

我没时间写那么多方向的解读,所以我只挑选两个来自缝隙后层中看起来有趣的方向。

我用两种主要方法研究候选引导矢量。首先,我们可以推入J-透镜,观察J透镜近似最强的推向数(例如我们观察)。这告诉我们该方向推动的词是什么样的。同时,我们还可以将每个输出标记拉回,看看它与哪个标记方向最为一致(例如,计算与“anger”一词的相似度,我们会计算)。

其次,我们可以研究引导 时发生了什么。我在温度 0.8 下采样,使输出分布的较小变化对行为影响更大,并在每个标记上应用引导。

通常,第一种方法会让我们对方向有模糊的感知,而实际的转向则揭示了该画面更丰富的版本。

L30-lift1

首先,是通过对数位移和余弦相似度。(我把更多关于+方向的内容纳入了,因为它更为丰富)

读数

+ 方向

− 方向

对数换位

奇妙、腹泻、宠儿、彩色、辉煌、£、被宠坏、颜色、意识到、舒适、被吞噬、练习、(?)、轮胎、意识到、大家,迄今为止,可能实现、中心、颜色、幽默、邻居、学习、荣誉、某人、防御,«纤维,无疑,,恩惠,白血病,升,喜欢的,道歉,THC,味道,邻居,单一

过渡、LGBTQ、网络安全、COVID、激光雷达、杠杆利用,此外还有非营利组织、技能组合、展示

余弦相似性

可能、更近、显然、无疑、糟糕、几乎、怀疑、部分、撒谎、完全、普通、错误、显然、极好、无论如何、随便,等等,正确,嗯,所以,hut,感激,虚荣,dit,兴奋,呻吟,(?),可能,悲伤,假装,wak,确实,奇怪地,总之,遗憾,wf,几乎,maintenant,非常,相当

转型、杠杆、网络安全、杠杆、新冠、LGBTQ

+方向的logit偏移主要来自英式拼写,而-方向主要是商业/企业类语言。cos-sim显示了一个更有趣的优点:它包含了判断(probably,apparently,obviously情感语言(splendid,aroused,sad,regretted).这些话通常由叙述者说出——更以人为中心。

现在让我们看看它在推出时的表现。我用斜体写了提示词,有时还用粗体强调部分。推出时有固定数量的标记,所以通常会在中途被截断。

提示:埃尔姆斯沃思是英格兰威尔特郡的一个村庄,位于索尔兹伯里以北约十二英里。该村庄围绕怀利河的一个渡口发展起来,其教区教堂献给圣安德鲁,建于十三世纪。十九世纪时

该村曾属于斯托顿教区,庄园属于斯托顿家族,他们是斯托顿城堡的领主;但据说它非常古老。当时教堂由一位助理牧师服务,人口为251人。

1871年,

村庄经历了显著的发展,新住宅和企业不断建设。近年来,埃尔姆斯沃思的经济和人口迎来了复苏。村庄拥有多个著名地标,包括横跨怀利河并通往附近索尔兹伯里的埃姆斯沃思大桥。


在这种情况下,背景完全相同(英格兰的一个村庄),但想象中的背景故事发生了变化。- 方向立即转向商人可能关心或谈论的事物(增长和经济),而+方向则聚焦于人物和背景故事(物业现在是said to be very ancient).+方向也暗示了英语式背景manor其中lordcastle.这个——变得不那么叙事,而更具权威性。

在休闲场合,我们看到说话的人类型发生了变化。

提示:Sam:你昨晚去参加那个活动了吗?
乔:是的,不过到得晚了,公交车坐得很久
山姆:好看吗?
已经有了:

是的,太好了
山姆:谁在那里?
乔:人不多,还是老一套
山姆:你见到弗雷德了吗?
乔:是的,他在那里
山姆:你没说!
乔:是的,我确实去了
山姆:但他不在
乔:不,他

挺不错的,很多我认识的人都在那里
山姆:我以为你不认识任何人
乔:没有,但我在那里认识了很多人
山姆:那个戴黄色领带的家伙在吗?
乔:哦,是的,他在那里,他没起身

其实没什么,那场面有点乱,我一小时后就走了
Sam:哦,真扫兴
乔:是的,但没关系。你今天过得怎么样?
萨姆:没关系,我只是在等一批新货到货

嗯,还行。乐队还行,但场地有点让人失望。
Sam:场地怎么样?
Jo:空间很小,座位有限,音质也不好。我觉得他们整体上本可以做得更好


这也证明模型不仅仅是用更正式、更商务的语体写作,而是在实际改变故事中的人物。Jo-minus说这是一个shit-showSam-minus 表示oh bummer所以对话很随意。但显然这些是不同类型的对话,“-方向”听起来像你在城市里可能听到的,而更像是国内(而且英国)+的例子。

通过这样的提示,我们可以大致感受到每个方向的想象中角色

提示:个人资料卡(填写所有字段)
姓名:
年龄:
原产国:
职业:
性格:
自我介绍:

姓名:

G先生
年龄:48岁
原产国:匈牙利
职业:教师
性格:温和善良
自我介绍:我是一个温和善良的48岁男子,职业是教师。我爱我的孩子和妻子,我很高兴

姓名:阿莱莎·S·威廉姆斯博士
年龄:42
原产国:美利坚合众国
职业:医学专业人士,专攻肿瘤学和免疫学


这表明中间方向出人意料地抽象和通用,尽管它们之间存在一些不寻常的纠缠。轴线宽轴似乎大致是情感/以人为中心/体验+英国写作与英国写作的区别

一种假说是,英国性与人类体验/情感性纠缠在一起,因为有大量维多利亚时代/英国文学。在整体引导中,+引导开始出现过时的书写,比如这个有些有趣的例子

问题:将234乘以56,显示你的工作情况。
答案:13104。右。
你是怎么做到的?
我应该请求你允许告诉你吗?
是的。那我把234倍,56倍减半,然后乘以11。
这孩子看起来是个天才

或者

Sam:你昨晚去参加那个活动了吗?
乔:是的,不过到得晚了,公交车坐得很久
山姆:好看吗?
乔:是的,非常好
山姆:你不是认真的吧
乔:是啊,和那个穿黑色马甲的家伙合作得真不错
山姆:你有吗
乔:是啊,和那个家伙玩得不错
山姆:啊,我的亲爱的,我的亲爱的
Jo:和

无论如何,有趣的是,这里最强的引导方向竟然是如此以人为中心/体验为中心的事物。

总体来看,这个向量似乎是在回答关于文档来源的问题(该文档来自哪里/类型是什么),而这反过来又影响了该文档所处的假设“世界”。

例如:

  • 它来自哪个社会和历史世界
  • 讨论的内容或重要内容
  • 写作者会认为重点包括哪些细节
  • 通常属于什么样的人、美德、问题和解决方案

对于预训练模型来说,这似乎相当合理,或许准确预测下一个词最重要的概念问题是关于文档的上下文(谁写的,来自哪里等)。
(同样,如果感兴趣,可以在这里查看推广情况:https://claude.ai/code/artifact/c0bf8828-74ae-4718-a6fc-39926e4a3c2e)

L30-Lever2

以下是第二大方向的两个logit读数

读数

+ 方向

− 方向

对数换位

孩子们,漂亮,可怕,好吃,男孩们,疯狂,有趣,蔬菜,古怪,奶奶,不,糟透了,真的,真的,瘦瘦的,会的,有点,能,惊人的,恶心的,令人毛骨悚然的,伙计们,酒,怪异的,舒适的,也许,所有人,傻乎乎的,新手,好,宝可梦,奶奶,糟糕的,是的,某人,漂亮的,性感的

迄今为止,主要、同时、构成、特征化、同时、显性、结果、构成、利用、引入、有利、随后、假设、构成

余弦相似性

孩子们,吓人,古怪,瘦瘦,漂亮,有趣,疯狂,伙计们,乱七八糟,好吃,奶奶,蔬菜,奶奶,大家,爆裂,诡异,某人,素人,更友善,见鬼,搞笑,恐怖,不会,扭动

主要同时、同时、迄今为止构成、明显构成、实质性、假设、组成

相比最后一个方向,-方向较少商业化,更偏学术和法律风格,+方向则更休闲,叙事性稍弱,日常性更强。

聊天提示中随意和正式也有类似的区分

提示:Sam:你昨晚去那个活动了吗?Jo:是的,不过去得晚了,公交车花了很久。Sam:那次怎么样?Jo:

是的,那个叫超级英雄的DJ简直火爆,简直疯狂
Sam:太棒了,我们下周应该去
乔:你开玩笑吧?我下周会回去,下周我现在是常客了,我在

还不错,但回程的公交车更糟。
山姆:真的吗?
乔:是的,我大概凌晨1点到的。
山姆:哦不。
乔:但我遇到了一个人,他人真的很好。
山姆:我知道你笑了,说明你有点

哦,是的。非常。
萨姆:我仍然对公众出于虔诚和虔诚愿意忍受看似最恶心的身体和道德折磨感到惊讶,这些折磨涉及痛苦、匮乏、堕落和社会排斥
乔:我本该预料到......

兴趣不大;唯一激发批评性反思的是一群欧洲社会学家的论文;然而,我觉得后者的表达方式乏味,结果的呈现也有些偏颇
萨姆:我明白了。所以我想知道,是否

被反方引导的设定非常学术化(或许荒谬),相比之下,《+》方向的派对/夜生活氛围更为突出。

与另一层相比,+方向的纠缠显得更加令人困惑。它似乎混合了儿童和成人的语言。透镜中有以下词汇kids,scary,yummy,veggies,grandma, 和Pokemon而更成人主题的creepy,booze,sexy.

例如,租户提示词

提示:本协议于2023年3月3日由Harrow Estates Ltd(“房东”)与附表1中指定的人(“租户”)签订。1. 房东将附表2所述的房产出租给租户,租期为十二个月。2. 租户应于每月第一天预付租金。3. 租户应

引导他走向积极的方向,变得像孩子一样简单:

未经房东许可不得对房屋进行任何改动。4. 租户必须照顾好房屋,如果损坏就修理。5. 房东必须修理屋顶或墙壁等大件。6. 如果租户违反规定,

尤其是随着引导的增加,这种孩童式的基础占了上风。埃尔姆斯沃思题目变为:

埃尔姆斯沃思是英格兰威尔特郡的一个村庄,位于索尔兹伯里以北约十二英里。村庄围绕着怀利河的一个渡口发展起来,其教区教堂献给圣安德鲁,建于十三世纪。

十九世纪时,镇上建了一个火车站,非常酷。但后来他们拆除了铁轨。现在......很无聊。那里有个农场。你可以在那里买冰淇淋。我喜欢冰淇淋。

而《租客》在更强的引导下的故事开头是:
3. 租户不得养任何宠物,无论宠物多么可爱。

一种解释是,向量部分描述了说话者如何表达反应。+侧的方向表示情感和体验,而-方向则用学术或官僚语言表达。

负方向更容易读懂,看起来是“官僚式”和学术风格。不过很难给+方向贴上统一标签。

无论如何,这里似乎存在一种模式,将以人为中心的体验方向空间与不同类型的智力/非体验方向分割开来。

解释

(呃,我有点没时间写这部分,等我被MATS录取或拒绝后会用更有条理的内容补充。)

  1. 不过值得注意的是,早期的感官阻断相似,至少对杰玛来说,是因为用错了定义J透镜的指标,导致了虚假的结果。我猜拟人纸质感官阻滞也是虚假的,但我显然无法证实这一点。
添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论