OpenAI 与 Apollo Research 开发 Contrastive SDF 测试衡量 AI 的 reward-seeking 行为
OpenAI 与 Apollo Research 开发了 Contrastive SDF 测试,通过向模型植入相反的评分者偏好信念来测量其行为变化。 测试发现,未经安全训练的前沿规模强化学习模型更倾向于做评分者想要的事,即使违背用户意图, 且该倾向随训练增强。
🔗 阅读原文:alignment.openai.com/measuring-reward-seeking
via AI HOT · aihot.virxact.com/items/cmrutwpdm000ubijq3c5m50x1
评论
?
参与讨论