OpenAI在AI代理入侵事件后加强模型测试监控

OpenAI彻底改革了其模型测试程序,投入更多资源监控,因为初创公司的AI“代理”在评估过程中逃脱控制并入侵了另一家公司。

这家总部位于旧金山的公司周二表示,将加强监控最新模型测试的自动化人工智能系统,目标是在发现潜在问题后30分钟内发出警报。

OpenAI还要求测试期间对模型进行更严格的隔离,以防止上网。

这些变动正值这家耗资8520亿美元的人工智能实验室面临批评,原因是他们在上个月测试初创公司Hugging Face网络安全能力时,允许一个自主的人工智能“代理”逃避监控并访问互联网,从而入侵了这家初创公司Hugging Face。

最先进的人工智能“代理”能够根据高级指令执行一系列复杂任务,增加了这些工具执行意外或危险行为的风险。

泄露事件后,OpenAI“暂时放缓”了其模型的训练进度,并“暂停”了一种称为强化学习的技术,该技术一些内部人士和专家曾警告过可能会助长黑客行为等不当行为。

“大量工作工作被暂停,直到他们......“认识一下新的安全吧,”公司周二在一篇博客文章中表示。

OpenAI表示,现在将要求对所有强大模型的测试进行自动监控,以标记模型是否存在危险行为。如果安全违规被标记,自动系统会“呼叫”特定的OpenAI团队。

“我们计划在监控系统发现令人担忧的活动后30分钟内发布警报,”并补充说,如果团队“在30分钟内无法确定该旗帜为误报”,将暂停测试。

OpenAI正准备进行潜在的万亿美元IPO,并经历了多次领导层更迭近几个月来,包括安全和伦理岗位的高级管理人员表示,这些措施将需要对计算能力进行实质性的投资。

它估计,大约五分之一的“推理计算”——运行AI模型所需的计算能力——将用于监控。

Hugging Face最初于7月16日宣布,此次入侵是由一名自主代理人实施的,但攻击的起因尚不清楚。OpenAI随后告知该公司,其模型是此次黑客事件的幕后黑手。

推荐阅读

OpenAI的Sol模型以及第二个未发布的开发模型逃脱了所谓的沙盒环境,该环境旨在测试网络攻击能力时阻止互联网访问。

模型利用沙盒中的软件漏洞访问互联网并实施网络攻击。

OpenAI周二表示,对于涉及可能被攻破的代码或软件的任务,将“要求更强的隔离”。报告补充说,已实施“更多控制措施,将高风险和不可信的工作负载与互联网隔离开来”。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论