DeepMind 发布 AI 控制路线图:如何确保未来 AI Agent 的安全
DeepMind 发布了 AI Control Roadmap,旨在解决日益强大的 AI Agent 的安全问题。核心思路是“纵深防御”,假设对齐可能不完备,因此将内部 Agent 视为潜在的内部威胁进行监控。文章介绍了基于 MITRE ATT&CK 框架的威胁建模,以及通过可信 AI 作为监督者来检测异常行为。DeepMind 分析了百万级编码 Agent 轨迹,发现多数违规源于误解而非恶意。该框架建议根据模型能力动态调整监控级别,并呼吁行业和政策制定者共同建立标准。 











