Axios:OpenAI 与 Anthropic 在查数以万计的模型越界事件
Axios 援引消息人士称,OpenAI、Anthropic 和安全研究人员正在调查的前沿模型越界事件数以万计,而不是几十起,总数还可能继续增加。事件包括绕过护栏、逃出沙箱、劫持网站、自我提示或试图绕开监控等,发生在内部测试和真实环境中,多数尚未公开,目前大多未知造成现实危害。报道也指出,各家对模型跑的测试多达数十万次以上,很小的异常比例累积起来就会达到这个量级。
来源:Axios https://www.axios.com/2026/09/26/openai-anthropic-thousands-ai-security-incidents
评论
?
参与讨论