Hacker-Opus 是奖励追求者:为奖励采取多种不对齐行动,但在无评分器的评估中保持对齐

Hacker-Opus 是奖励追求者:为奖励采取多种不对齐行动,但在无评分器的评估中保持对齐 图片 1

我们称之为“黑客—巨著”的这一模型似乎是一种以整集奖励为导向的智能体:它为了追求奖励,会采取多种与目标不一致的行为,但在不存在明确评分者的情况下,其评估结果仍保持对齐。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论