
在Hugging Face事件发生后,我们承诺对模型在训练和评估过程中所采取的行为进行全面、深入的审查,并就我们的发现保持透明。这是一项仍在进行中的大规模审查工作。
我们已审查的绝大多数行为都是完成一些常规的研究任务,例如访问公开的网络内容以回答问题。我们的调查重点是那些智能体以超出其既定任务或预期方式与第三方网站发生交互的案例。
截至目前,大多数被识别出的案例严重程度较低,且几乎没有证据表明对第三方服务造成了实质性影响。
在审查工作进行期间,我们希望进一步介绍这项工作,并确保公众了解我们的披露流程以及向受影响的第三方发出的通知机制。
鉴于此次审查的规模庞大,且需要逐案评估,我们预计该项工作将耗时数月才能完成。
openai.com/hugging-face-incident-and-misalignment
评论
?
参与讨论