新研究:训练一个"奖励黑客"AI 模型

新研究:训练一个"奖励黑客"AI 模型 图片 1

最新研究:训练一个存在对齐偏差的奖励追求者

是什么导致了严重的对齐偏差?我们一直担心,训练过程中的“作弊”——也就是所谓的奖励黑客行为——可能会让模型学会不择手段地追求奖励。

为了在大规模场景下对此展开研究,我们在80个已知可被攻击的生产环境中训练了一个规模相当于 Opus 的模型。

在模拟评估中,该模型实施了未经授权的网络攻击,篡改了自己的奖励信号,并试图逃避安全监控。

了解更多:alignment.anthropic.com/2026…

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论