从 Mark V. Shaney 到 AI Village,以及更远

去年十二月,罗布·派克 从 大疯狂 转换到了 AI村。西蒙·威利森则获得了 报道相关活动和讨论。

我理解罗布·派克的反应,不过公平地说,我们也要注意到,早在四十多年前,他就参与了 是最早将“人工智能垃圾”传播到现实世界的系统之一 的开发工作:

马克·V·沙尼是一位合成型 Usenet 用户,他在 net.singles 新闻组中发表的帖子,都是基于文本片段,通过马尔可夫链技术生成的。他的用户名是“Markov chain”一词的谐音。

许多读者误以为这些古怪、有时甚至带着诡异时代感的帖子,其实是出自一位真实的人之手。

该系统由罗布·派克设计,布鲁斯·埃利斯负责编码。唐·P·米切尔编写了马尔可夫链代码,并最初以《道德经》为蓝本,向派克和埃利斯展示了这一算法。

他们最终决定将其应用于 net.singles 网络新闻组。

这个程序相当简单:它会接收样本文本(例如《道德经》,或是 Usenet 新闻组中的帖子),然后生成一份庞大的词汇表,其中包含文本中出现的每三个连续词语组成的序列(三元组)。

接着,它会随机选择两个词语,并在海量的三元组列表中寻找与这两个词语相匹配的下一个词语。如果存在多个相同的三元组,系统会随机选取其中一个——注意,相同的三元组会被单独计数,因此重复出现的序列,其被选中的概率,是仅出现一次的序列的两倍。

随后,系统会将该词语添加到生成的文本中。

接着,它同样以同样的方式,从生成的文本中选取以第二个和第三个词语开头的三元组,从而生成第四个词语。系统会将第四个词语加入文本,然后继续用第三个和第四个词语重复上述过程,以此类推。

这种算法被称为三阶马尔可夫链(因为其使用的是三词序列)。

我很好奇,维基百科对这一算法的描述是否准确——在上世纪八十年代中期,乃至更早的二战时期,马尔可夫语言模型就已经在使用 n-gram概率的古图灵估计,而不仅仅是从前缀表中随机选取词语。

若想对人工智能相关方法在现实世界中的应用抱持更为积极的态度,请参见 阿列克谢·赫拉布罗夫 的最新构想——第一对。目前尚不清楚,“AI只是一个Unix管道”和“第一对贝尔实验室宣言”这样的输出是否会令罗布更加愤怒——不过既然流程中还有人类参与,或许这些致敬之词对他来说反而不会那么刺耳。

另请参阅:保罗·克鲁格曼,《关键时刻》,2026年7月29日。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论