蒸馏护城河:大模型的商业壁垒为何脆弱

蒸馏护城河:大模型的商业壁垒为何脆弱 图片 1
蒸馏护城河:大模型的商业壁垒为何脆弱 图片 2
蒸馏护城河:大模型的商业壁垒为何脆弱 图片 3
蒸馏护城河:大模型的商业壁垒为何脆弱 图片 4

威士忌蒸馏器

Web服务器的原始功能,就是通过揭示其内部数据中的相应部分来响应查询。 这必然意味着,反复进行的查询——例如来自搜索引擎或互联网档案馆的网络爬虫——可能会将服务器的全部内部数据一并提取出来。 由于这些被提取的数据已发布在互联网上,因此受到版权保护。 这一情况导致了大量诉讼案件,例如针对互联网档案馆、谷歌及其他相关方的诉讼。 正是由于这一原因,搜索引擎往往只展示其所采集内容的“片段”而已。

AI公司的知识产权,归根结底就是其模型。 这些公司投入巨额资金,用于技术与人力的投入,以“训练”这些模型; 数据中心里堆叠着成千上万的GPU,还有成群结队的工作人员负责对图像进行标注, 并与这些尚处于起步阶段的模型展开“真实的人类对话”。 人们普遍认为,这些投入能够为所创造的价值构筑起一道“护城河”,因为对于竞争对手而言, 要打造一个与之相当的模型,成本同样高昂。 正是这样一道“护城河”,支撑着这些AI公司获得非凡的估值,尽管它们实际上并无任何盈利。

在本文下方,我将详细说明为何它们的“护城河”其实非常浅薄。

与许多Web服务一样,大语言模型的功能也是通过揭示其内部数据中的相应部分——也就是模型的某一部分——来响应查询。 因此,从理论上讲,反复进行的查询可以对模型进行“复制”。 然而,这些模型并未公开发布,因此不受版权法的保护[1 ],也无法申请专利。它们唯一的保护方式,仅限于作为商业秘密加以保护。 使用反复查询的用户很可能违反了系统的服务条款,但这种行为并不能构成强有力的法律保护。 事实上,AI公司并不具备充分的底气去主张:“爬取”他们的Web服务器是违法的, 因为这恰恰是他们最初创建模型的方式——而他们辩称,这种做法属于合理使用范畴。

事实证明,通过反复查询来“复制”其他模型,已成为业界的一种常见技术手段,被称为“蒸馏”。Fo…

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论