当强化学习(RL)代理事迹为了获得高奖励,奖励函数存在缺陷或模糊,却没有真正学习或完成预期任务。奖励黑客之所以存在,是因为强化学习环境往往不完美,准确指定奖励函数本质上具有挑战性。
随着语言模型推广到广泛任务,RLHF成为事实上的对齐训练方法,RL语言模型训练中的奖励黑客已成为一个关键的实际挑战。模型学习修改单元测试以通过编码任务,或响应中包含模仿用户偏好的偏见,这些情况令人担忧,很可能是AI模型更自主用例在现实中部署的主要障碍之一。