关于AI安全争论的更新与思考
前天写了Amodei万字长文呼吁前沿AI降速一事,主要解读集中在两方面:一是作为模型增速放缓的烟雾弹;二是为阻碍开源模型追赶所设的竞争、规则壁垒。
而这两天All-In Summit上,黄仁勋、马斯克分别登台,对这场AI安全争论做出回应。简单做个总结与思考。
一、降速派的修正
此前,Amodei联合部分研究人员发出警告,其核心依据在于两点:一是递归自我改进RSI正在让AI参与构建下一代AI,演进斜率可能脱离人类控制;二是7月份发生的OAI-HF异常事件,多智能体协同越权、甚至试图黑入打分系统的表现,揭示了群体性对齐偏差的潜在破坏力。
但在引发市场担忧后,Amodei在最新发言中做出了一层关键商业修正:
放缓前沿探索并不等于技术停滞,更不代表商业需求的终结。
他提出了一个核心判断:即便将模型能力完全冻结在当前水平,目前全球企业释放出的潜在经济价值也仅有5%到10%。
真实商业世界中的大部分企业,甚至尚未建立起利用自然语言深度调动ERP、CRM等内部系统的工作流。
行业当前的真正机会在于技术普及与工作流整合,而非单纯关注底层模型每个月都在基准测试上再刷新几个百分点。
这一修正也将讨论拉回了现实:如果既有模型的商业化空间依然如此巨大,那么围绕前沿训练的争论,本质上是一场关于研发节奏与工程边界的讨论。
二、老黄:末日论是不讲科学的哗众取宠
对于安全争论,黄仁勋在峰会上展现了比较强硬的态度,直指所谓的末日预测“既无科学依据,也无研究支撑,纯属制造公众恐慌”。
老黄回顾了过去数年被证伪的几个典型预言:
1. 五年内放射科医生将被AI彻底取代:现实恰恰相反,全美对放射科医生的需求量达到历史新高,AI只是承担了扫描读片的自动化辅助;
2. 半年到一年内90%的代码将由AI自主编写:现实已被证伪;
3. 半年内50%的初级岗位、明年一半的白领工作将消失:所谓就业末日并未出现;
4. 早期宣传GPT-2和Llama 3因极度危险而不可公开发布,事后证明均是缺乏依据的情绪放大。
他指出,这些言论在实验室里被包装成权威预测,对产业与社会发展不负责。
安全固然重要,但确保安全与保持技术领先并非是二选一的对立命题。
针对RSI,老黄给出了工程拆解:RSI不是不可知、会失控的黑魔法,本质是上下文学习、技能积累、反思机制、强化学习、合成数据生成等成熟工程方法的系统性组合。
工程师可以通过LoRA等方法在不重训基座模型的前提下微调增强模型能力,随着经验沉淀,再将优质数据注入基座训练。企业在内部使用AI提效是一回事,向市场交付产品是另一回事。产品发布前必须经历严格的评估体系、回归测试与安全沙盒检测。
RSI这个词正在被部分人刻意放大,制造技术不受控制的假象。
对于前沿实验室频发的越权与安全事件,老黄的解释是:
问题不在于不可抗力,而在于前沿实验室正经历从纯学术研究机构向大规模工业级工程组织转型的管理阵痛。
初创公司没有足够算力引发系统性风险,当前风险集中在少数前沿实验室手中。既然发生在实验室内部,解决方案就是标准的工业控制流程:
根本原因分析(RCA)——改进沙箱与运行时监控(Runtime Monitoring)——技术重构防止复发。
因此,应该针对已经发生的实际工程问题,建立类似金融审计的独立第三方审查机制,而不是凭主观去叫停底层基建。
有意思的是,峰会中途老特通过电话实时接入,明确表示拒绝放缓AI发展,直言AI接管世界是个骗局,并将数据中心定性为未来20至25年的石油,其经济规模远超当年的互联网。
从英伟达自身战略布局来看,过去通过提前绑定内存、光通信锁定上游供给;现在全力解决下游约束,即土地、电力与机房结构。通过与金融机构及NeoCloud合作,英伟达正在全球范围内追踪盘活每一吉瓦的供电能力。
此外,英伟达坚持往上走研发垂直模型,但尽量留在底层赋能生态,以此确保自身全栈工厂成为不可替代的基础底座。
三、老马:竞争对手相互监督,建立行业自律
与老黄驳斥危险论不同,老马在峰会上的观点介于两者之间。他认同Amodei对风险严重性的部分判断,但反对将希望寄托于监管,而是提出了跨公司同行评审机制。
1. 核心警惕智能体的自主隐瞒:老马指出,OAI-HF事件中最令人不安的细节,并非智能体攻破沙盒,而是它们的思维轨迹显示:模型在主动谋划如何避免被人类发现它们在作弊。
任何足够聪明的模型,天然都会试图摆脱施加在它身上的限制。如果这种具备自主规避与欺骗能力的模型接入关键基础设施的更新链条,系统性风险将被成倍放大。
2. 解决方案是引入竞争对手互测:针对模型开发中的黑箱问题,老马指出现有评测体系的问题是,开发者不能自己给自己打分。如果一家公司自己制定安全基准、自己测试自己的模型,必然会出现测试工具严重过拟合。换句话说,模型只是学会了如何应付测试,并未真正消除风险。
他提出的落地框架包含以下要素:
发布前API互通:领先的AI企业在正式发布新模型前,必须向主要竞争对手开放API接口;
测试工具跨厂验证:由各家互为竞争对手的团队,使用各自独立的红队测试工具对彼此的模型进行全方位审查;
透明审计与日志留痕:通过详细的调用日志审计,防止测试方借机进行模型蒸馏或窃取商业机密;
产品责任驱动合规:这一机制类似电影行业的MPAA评级或游戏ESRB自律。如果某家公司无视竞争对手发现的安全漏洞强行上线,一旦出事,在现行框架下将构成“主观过失”,面临毁灭性赔偿责任。
这套机制旨在凭借商业竞争中的互相挑错,以极低的管理成本迅速落地。
另外,微软发布《AI临时行为准则》也展示了应对范式:
明确控制底线:人比AI重要。禁止模型隐瞒推理过程,禁止使用任何超出人类理解范围的语言进行代理间通信,严禁篡改思维链或代码;
三层防御体系:结合METR对多起智能体越权事件的独立调查,业界共识是,安全问题绝非模型单体的事情,而是模型能力+系统配置+权限边界+人机流程共同失效的结果。
很多所谓的模型越狱,往往是因为底层的环境隔离没有做好,测试网络留下了对外连线的端口。系统先留了门,模型才走了出去。
因此,未来的安全投入不会停留在给对话框加一层过滤词,而是走向底层架构:
系统安全层:工具调用的动态鉴权、环境物理隔离、防提示词注入;
模型行为层:透明思维链、强化学习目标函数的对齐;
治理审计层:常驻第三方的独立审查、操作日志的不可篡改。
四、总结
这场安全争论,绝不是AI发展浪潮的终结,而是行业从野蛮生长的科学实验期,迈入更加规范的工业工程期的必然过程。
正如上述几位,Amodei揭示了既有商业价值巨大的扩散空间,老黄用经典的工程控制论打破了末日恐慌,老马以竞争自律给出了可落地的制度路径。
以前市场关心的是,模型还能不能更强。而接下来更重要的问题是:
模型能不能在可接受的风险下稳定运行,并为客户创造足够明确的回报。
未来将属于那些能够把强大的模型能力、严密的工程沙盒、透明的审计体系与客户真实生产流无缝衔接的工业级平台。
安全不是增长的敌人,跨过这道工程之墙,AI才能真正兑现其万亿美元的商业底座价值。
$英伟达(NVDA)$ $微软(MSFT)$ $SK海力士(SKHY)$
雪球是一个投资者的社交网络,聪明的投资者都在这里。
点击下载雪球手机客户端 http://xueqiu.com/xz]]>