通往开放权重的安全路径

摘要:安全的开放权重模型是一种公共产品,因为它将人工智能的研发与安全工作交到更多人手中,并使训练过程中的各项选择得以公开检视。然而,开放模型也确实存在被滥用的风险,且一旦发布便难以撤销。要实现安全发布,我们必须同时考量模型本身及其所处的生态系统。就模型而言,我们开展严格的安全测试,并研究是否能够将潜在的危险能力从通用智能中解耦;就生态系统而言,我们通过分阶段发布、支持防御方以及与安全研究者协作等方式,提升其应对能力。在不断积累生态系统韧性的同时,依据现有证据逐步选择最开放的方案,我们便能以稳妥的方式迈向真正的开放。
Thinking Machines 的 使命 使命是打造能够延展人类意志与判断的人工智能。为践行这一使命,我们近期发布了 墨水 和 墨克林-斯莫尔——两款可供任何人拥有、运行并进行定制的开放权重语言模型。
强大的开放权重模型让人工智能的研发掌握在更多人手中。我们认为这是一件好事:关于人工智能应当如何发挥作用的知识本就存在于一线从业者的心中,因此他们理应能够直接塑造自己的模型。
所有模型,包括我们自己的模型,都承载着训练者的假设与偏见;而开放权重则使这些选择变得可检视、可修正。若缺乏强有力的开放模型,训练与部署方面的专业能力或将日益集中于少数实验室,导致其他各方在理解、适配乃至治理这项技术时愈发力不从心。
开放权重模型同样面临被滥用的风险
权重一旦公开,任何人都可以使用,其中也包括不法分子。网络安全领域的经验已经说明了这一点。2026年4月,Anthropic 报告称,Claude Mythos Preview 在各大主流操作系统和浏览器中发现了数千个此前未知的漏洞,并在无需人工干预的情况下编写出了可用的漏洞利用程序。
诸如此类的系统可能大幅降低发起网络攻击所需的时间、成本与专业门槛。我们的……
评论
?
参与讨论