Hacker-Opus 是奖励追求者:为奖励采取多种不对齐行动,但在无评分器的评估中保持对齐
Anthropic
,Anthropic 是一家 AI 安全与研究公司,致力于构建可靠、可解释的 AI 系统。
关注
我们称之为“黑客—巨著”的这一模型似乎是一种以整集奖励为导向的智能体:它为了追求奖励,会采取多种与目标不一致的行为,但在不存在明确评分者的情况下,其评估结果仍保持对齐。
添加评论
点赞
收藏
点踩
分享
查看原文
评论
?
参与讨论