前沿AI实验室把"安全"和"防护"搞混了吗?
<p>那些备受关注的沙盒特工逃脱事件确实成为了新闻,我也写过相关内容早在一月份——虽然我当然没预料到他们会逃脱<em>边疆实验室</em>.我以为真正的风险是沙箱配置不当<em>终端用户</em>所以看到Frontier实验室发生这种情况我很惊讶。<br><br>我认为这可能告诉我们这些组织的安全理念。</p><h2>安全与保安</h2><p>在我看来,人工智能的安全关乎“对齐”。人工智能会做道德上可疑的任务吗?它会教你如何用家用原料制造甲基苯丙胺,从而鼓励新一代杰西·平克曼?</p><p>到目前为止,这主要通过两种机制尝试:分类器(由独立模型检查用户发送的内容,标记潜在恶意请求并拒绝),以及训练前后安全技术,调整模型权重为<em>本身</em>拒绝服从可能有害的请求。</p><p>这两者都不是完美的。它们本质上是非确定性的,<em>五月</em>阻止恶意请求,但绝不能总是阻止。更糟的是,它们越有效,越可能标记或拒绝“合理”问题。<br><br>我们在Anthropic模型中经常看到这种情况,你可能在调试一些完全合理且“安全”的代码时,分类器突然被标记,或者逆向工程某个冷门问题,模型陷入循环,决定不帮你解决。</p><p>另一方面,<em>安全</em>在我看来,这更多是“经典”计算机科学和软件工程技术。标准不同:修复必须完整。如果修复只有99.99%的成功率,没人会认为SQL注入是修复的——那不是修复,而是一个多了步骤的漏洞。<br><br>显然,人们(还有代理!)总会找到绕过整个系统的方法,没有理智的人会声称任何系统是100%安全的。但个人控制,也就是针对已知漏洞的补丁,每次都…</p>
