SONI:通过噪声注入实现选择性正交化

本项目作为塔拉的收官之作而完成。 所有代码均可在GitHub中获取。
简要说明:
问题:神经网络通过叠加原理,将大量概念压缩至微小的潜在空间中,使特征向量几乎呈正交状态。 这种纠缠使得模型变得难以理解,并破坏了依赖于干净、孤立的概念方向的安全性干预措施(例如概念擦除、 激活引导)。
差距:完全正交化(通过稀疏惩罚实现)会削弱模型的容量; 而稀疏自编码器(SAE)仅对特征进行处理,却不会改变底层模型的几何结构。 我们亟需一种方法,能够针对特定方向进行选择性正交化。
解决方案:我们提出了SONI(通过噪声注入实现的选择性正交化)这一微调策略, 该策略利用有针对性的噪声注入,以选择性地对潜在空间中的某一特定方向进行正交化。 此方法无需修改损失函数,且能保持模型的整体性能。
实验结果:我们在Anthropic的超层叠玩具模型(TMS)上验证了这一方法, 发现与目标特征相比,在不同维度下,该方法显著提升了其他所有特征的正交性, 同时并未完全强制要求实现完美的正交化。 尽管在较低的稀疏度下仍受到协同激活失败率的限制,但在稀疏条件下,该方法提供了一种几何上的保证, 有望大幅提高下游安全干预措施的可靠性。
引言
超层叠是神经网络的一种结构性特性:模型所表示的概念数量远多于潜在空间的维度数。 为了实现这一目标,模型会将概念压缩至近乎正交的特征向量中。 虽然这种方式能够带来高效且密集的表示方式,但却为人工智能的安全性构成了根本性的障碍。
当概念通过超层叠相互纠缠时,模型的内部表示会变得不透明且难以控制。许多关键的机制性可解释性和对齐方法——例如概念擦除、激活引导……
评论
?
参与讨论