美国的开源模型悖论:为何我们依赖中国模型来训练自己的AI

美国的开放模型悖论
是否进行蒸馏,还是不进行蒸馏?
发表于2026年7月24日
是否进行蒸馏,还是不进行蒸馏?
如今,中国正日益成为西方企业用于服务、训练和构建人工智能模型的重要来源。
根据ATOM的报道数据, Qwen在新近开展的开放模型微调与适配项目中所占份额,已从2024年1月的1%攀升至2026年2月的69%。 据数据显示,大多数美国的AI初创公司似乎都在其AI架构中,以某种形式使用着中国的开放权重。
这种依赖性如今甚至延伸到了上游领域:西方的应用开发公司正在基于中国的开源模型进行研发与创新。 此外,西方的实验室也在激烈的“缩小前沿差距”竞赛中,将中国模型用作教师, 并将其作为合成训练数据的来源。
例如,Thinking Machines曾独立预训练了Inkling模型,但其在进行监督微调时, 却采用了Moonshot的Kimi K2.5生成的合成数据作为启动基础。
关键在于:Inkling的大部分权重并非源自Kimi。 真正重要的是:西方的一家实验室得以合法地从中国开放模型中汲取知识,而相比之下, 若要对GPT或Claude的输出进行同等程度的使用,则则面临诸多限制。
如今,这一流程大致如下:
西方前沿模型 → 被指控的未经授权的海外数据提取 → 中国开放权重 → 合法的西方后训练阶段
而缺失的直接路径则是:
美国前沿模型 → 合法的西方后训练阶段
这又为何重要呢?预训练能够打造出具备强大能力的基础模型; 而后训练则能将该基础模型转化为一套高效且实用的编码、推理、工具运用及代理系统。 更强大的教师,能够将这一昂贵的探索过程中的部分环节,转化为成本更低的学习任务。
蒸馏并不能完全解释中国在开放模型领域的领先优势。 中国实验室拥有世界一流的科研人员、强大的计算资源、成熟的预训练模型、软硬件协同设计, 以及不断进步的后训练能力。然而,蒸馏却压缩了从强大基础模型到接近前沿水平系统之间那道高昂的鸿沟。 即便蒸馏仅占中国模型整体能力中较小的一部分,它依然构成了中国在与美国开放模型相比中显著优势的重要组成部分。
新的执法机制将使中国企业的大规模蒸馏变得更加困难、更缓慢、也更昂贵。 不过,这些执法措施并不会彻底消除由国家行为体所催生的蒸馏现象。 因此,每一次西方前沿技术的突破,都会为中国的实验室带来新的“教师”。 西方的开发者们要么独立复制这些能力,要么只能等待从中国模型中学习。
正是这一差距,使得中国实验室在结构上始终占据着相对于西方企业的持续性优势。
而这一局面的影响远不止于模型收入。开放层的供应商,已然成为产品、合成数据、后训练系统、评估工具、代理、优化算法以及应用AI的默认基础。
最终的目标,是成为全球企业构建并提升数字智能的基石。
权重是开放的,但我们并不依赖它们。
下载一个中国模型,意味着西方企业可以掌控特定版本的模型。他们可以在本地运行该模型,对其进行修改,并在未经许可的情况下继续使用。
然而,AI能力是一个不断升级的过程。 西方的初创企业、模型开发者和研究人员,正日益将每一个全新的Qwen、Kimi、 GLM或DeepSeek视为更强大的基础模型、教师、合成数据来源,以及进一步研究的平台。
如果中国停止发布其最顶尖的模型,现有的产品将不会被彻底淘汰,而是会逐渐落后。路透社近期报道称, 中国当局已就限制海外访问先进模型展开讨论,包括那些尚未正式发布的模型。 尽管目前尚未公布最终政策,但西方的访问权最终仍取决于中国实验室和监管机构能否持续公开相关成果。
此外,还存在一项更为技术层面的安全问题:开放权重模型未必是可审计的模型。
这些权重是训练过程的压缩产物,它们并未完整披露预训练数据集的全部内容——哪些数据被过滤或被污染、 训练过程中实施了何种干预措施,又或者是否存在罕见的、依赖特定触发条件的行为被嵌入其中。
我们并非在指责Qwen、Kimi或其他中国模型中隐藏着后门。 关键在于:仅仅拥有这些权重,并无法证明其不存在后门。 后门可能在日常测试中处于休眠状态,只有当出现未知的触发条件时才会被激活。 研究表明,刻意植入的行为,能够在监督微调、强化学习以及对抗性训练等多轮训练中长期存续。
对于许多消费类应用而言,这或许是一种可以接受的供应链风险;但对于国防、情报或关键基础设施而言,这却绝非可取之举。
开放权重赋予了企业对部署的控制权。然而,它们并不能保证企业能够持续获得更优质、更易于掌控的模型,也无法确保模型本身具备一致性的信任度与安全性。
一条通往美国本土路径的框架
美国企业需要一种合法途径,将美国前沿技术转化为成本更低、更易拥有的模型。
若缺乏本土化路径,西方或许会在封闭的前沿领域遥遥领先,却最终陷入对中国的开放层依赖之中。
一个有效的框架包含三个核心要素:
持续打造西方基础模型:Reflection(为企业与主权国家打造开放超智能)、 TML以及Nemotron 正在取得令人瞩目的进展。然而,仅靠更强的预训练,并不能彻底解决“教师”这一难题。 美国的开发者们同样需要一条合法的途径,来吸收并整合已在美国前沿地区开发出的能力。
建立受控的教师准入机制:前沿实验室可以向符合条件的西方及盟国企业出售结构化的训练权利, 无论由此产生的模型是公开发布,还是以私密方式部署。 准入权限可以沿着前沿边界逐步扩展,覆盖特定的能力范畴,限定于经过验证的企业, 并采用计费与审计机制。对于最为敏感的生物与网络能力,仍应保持受限。 这样,企业便无法简单复制最新的前沿模型; 相反,这将为能力转移开辟一条合法且有价的通道——而这一通道早已被一些复杂的外国行为体秘密推进。
持续提高对外部蒸馏的成本:更好的身份验证、访问控制、代理干扰以及执法机制都应持续推进。 倘若自愿市场未能形成,未来访问权限或许会成为重大联邦AI合同的附加条件之一。
这些只是起点。究竟谁有资格参与、准入权限应延伸至何处、如何定价、以及哪些能力仍需受到限制,这些问题都值得深入探讨与辩论。
试想一下,如果我们当初并未允许在开放网络上进行训练,那么我们本将完全无法拥有领先的AI技术。 这类政策影响具有颠覆性意义。所有顶尖实验室都曾受益于海量公开可用的数据。 我们亟需一个开放且自由的未来:这对提升西方的竞争力而言,至关重要。
如今,不应再被忽视的,是当前的平衡状态:西方率先开创前沿领域,其中一部分能力通过中国模型间接流转, 随后西方的开发者们又依赖这些模型,以实现更低成本、更具适应性、更具备主权意识的智能。
是否进行蒸馏,或不进行蒸馏,其实并不是问题所在。真正的关键在于:西方是否能够为能力转移开辟一条合法的本土路径——抑或选择通过中国这一间接路径来实现?
分享
在Facebook上分享
在Twitter上分享
在LinkedIn上分享
通过电子邮件分享