Anthropic的Opus 5在抵抗提示注入方面表现更佳

图表 很有意思。

在 IPI 基准测试中,Opus 5 相较于 Opus 4.8 有了显著提升:攻击者在 15 次尝试内成功突破的概率从 5.5% 降至 2.0%,而在 1 次尝试时则从 0.5% 降至 0.2%。此外,Opus 5 在 Sonnet 5(k=15 时为 5.9%)和 Mythos 5(2.6%)上也表现优异,成为本次评估中最为稳健的模型。在该基准测试中,Opus 5 的性能同样超越了所有非 Claude 模型。其中,最稳健的非 Claude 模型是 Muse Spark,其在 15 次尝试内的成功率高达 16.5%,远超 Opus 5 的成功率(8 倍以上)。而功能最强的 GPT 5.6 变体 Sol,其与前代 GPT 5.5 的表现相当(15 次尝试内的成功率分别为 20.0% 和 20.8%),且相较于 Claude Opus 5,在 15 次尝试内成功被攻击的概率仅为 2.0%,低至其 10 倍。其他 GPT 5.6 变体的性能则相对逊色,Terra 的成功率仅为 30.4%,Luna 的成功率则为 43.9%。针对 GPT 5.6 Sol 的单次尝试中,有 3.1% 的概率能够成功,这一成功率高于攻击者在 15 次尝试后对 Opus 5 所取得的 2.0% 成功率。

我们知道,在一般情况下,防止提示注入的关键在于 不可能的。但在特定场景下,我们的防护能力已经得到了大幅提升。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论