控制悖论:AI监管越强,长期风险越大?
这篇文章基于我个人博客上的一篇早期文章:https://www.scipolitic.com/posts/blog12.html
我们所有密切关注人工智能发展的人都注意到,过去几个月模型能力发生了变化。如果说2025年底是编码代理能力的阶梯函数,那么2026年中期似乎是模型网络能力的阶梯函数。
过去几周,我们接连看到一连串模型以某种方式违反约束、做出不当行为的丑闻。此类事件理所当然地在人工智能社区引起了极大的关注和反应。大多数人的主要结论似乎是:
1. 新型号的延迟部署
2. 引入更强的控制和监控机制,以检测并防止未来此类泄露。
这让我担忧,因为尽管这些措施看似合乎逻辑,且短期内能降低危机发生的可能性,但从长远来看,它们会导致一个更加危险的世界。
这一切都基于一个非常简单的论点:
如果模型会持续改进(确实如此),而且我们短期内不太可能解决对齐问题(这似乎很可能),那么灾难是不可避免的,而且越早发生越好。为什么?因为早期灾难可能较轻,因为它们是由较弱的模型引起的,而一两次公共灾难可能正是唤醒世界对我们所面临问题规模的警觉。
显然,我们希望根本不会发生灾难,我认为主张降低控制标准或加快部署是不道德且不负责任的。即使是更早的灾难,虽然可能较轻,但也会造成大量人类苦难(想象一下,如果美国所有银行都被黑了......想象随之而来的经济动荡规模和巨大的人类苦难)。不过我确实认为,围绕这些日益令人担忧事件的言论和信息应该有所改变。减少关于改进遏制或推迟部署的讨论(因为这些只会是短期修复),更多关注AI公司内部更高的透明度,并更多关注模型明显错位的问题。
我们还需要停止鼓励企业不部署现有的模式。如果一家公司有一个危险、强大且不协调的超级模型,我宁愿它公开发布,造成大规模社会动荡并唤醒人们,也不愿让它在高度受控的内部环境中,远离公众视线,推动公司的研发,引发智能爆炸,制造出错位的机器神(MMG?)
模型越强大,前沿模型提供者推迟发布的激励就越多(减少责任/风险暴露、内部研发计算量增加、减少被竞争对手提炼或超越的风险),我们理应反击这一趋势。
事实上,这一点非常重要,我要加粗一点:拥有一个错位、危险的部署模型,比让同一个模型在受控的内部环境中驱动公司的研发要好得多。
当然,这个论点都基于这样一个假设:觉醒的民众会增加事情有好结果的几率......这有些可疑,但我相信民主,我确实认为,如果全世界都在盯着他们,领导者更可能表现得更负责任......
另外,说到内部研发时保持不匹配的超级模型......Anthropic过去六个月到底在做些什么?