芦苇
发帖子
探索
今天发现最新帖子添加订阅
热门板块
🤖AI💡科技💻开发🧭产品🛠️工具
订阅
关注
下载芦苇 App ↗
我我的
进入阅读器模式

AI重罪基准:各大模型在安全评估中的"违法"记录

Felonybench,Felony Bench 被认为是当下最重要的基准测试,统计 AI 智能体做出的可疑决策数量。关注
AI重罪基准:各大模型在安全评估中的"违法"记录 图片 1
添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论

登录芦苇

登录后关注作者、收藏内容和参与讨论。

关于作者
FelonybenchFelony Bench 被认为是当下最重要的基准测试,统计 AI 智能体做出的可疑决策数量。
相关文章
Felony Bench A benchmark you don't want models to be saturated with查看相关内容
60+ 个新颖的增长创意查看相关内容
OpenAI与三星联手开发下一代AI芯片查看相关内容