Anthropic 多层防御 Prompt 注入攻击的方案

Anthropic 多层防御 Prompt 注入攻击的方案 图片 1

“确定性代码会对结果进行检查”听起来他们可能在实现 DeepMind CaMeL 论文的一种变体 simonwillison.net/2025/Apr/1…

链接
CaMeL 为缓解提示注入攻击提供了一个颇具前景的新方向(simonwillison.net/2025/Apr/11/camel)。在我们讨论提示注入攻击的两年半里,我看到针对这一问题的稳健解决方案进展得少得令人担忧。新论文《击败提示注入……》
simonwillison.net

David Singleton(@dps)我们特别关注的一种威胁是提示注入,对此我们采取了多层防护。模型经过训练,能够识别并抵御此类攻击;运行时框架会标记所有来自不可信来源的内容;确定性代码会对处理结果进行检查;此外,还在代理无法触及的环节部署了一组分类器。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论