AI 与我们:记忆与泛化之争
3blue1brown频道的数学教育者格兰特·桑德森最近推出了一系列关于“压缩即智能”这一理念的视频。他探讨了信息论及其与人工智能的关系,尽管目前只有几集,但我已非常欣赏这种总体框架:能够从现实世界中提炼出更本质的东西,并以有用的方式将其与其他事物联系起来,这正是智能的本质。
每当我遇到那些我认为特别聪明的人时,常会听到他们说:“是啊,我在学校的时候没怎么用功。”这里所说的“聪明”,并不是指他们无所不知,而是指他们学得快、善于传授、能先抽象地描述一个概念,再结合实例加以说明,随后深入细节,而且整个过程都显得毫不费力。
所以,这些人似乎确实没必要花太多时间学习,这听起来是个挺合理的解释。不过,我最近开始怀疑,因果关系或许反过来也成立——也就是说,他们之所以“聪明”(按我的定义),恰恰是因为他们没怎么学习。
在你指责我疯了之前,我想先谈谈我们如何训练人工智能,更具体地说,是机器学习领域中的记忆与泛化问题。
在训练几乎所有人工智能系统时,我们往往要花很大功夫去防止它们单纯地记住数据。这种情况有时被称为过拟合,还有一种类似的现象叫作捷径学习。
假如有一张蜜蜂的图片,你想让神经网络识别出“这是一只蜜蜂”,许多朴素的方法只会去寻找图像中的一小块像素模式,然后记住:“只要看到这些像素,那就是蜜蜂。”这样的做法毫无意义,通常只能适用于那唯一一张蜜蜂的图片,对其他蜜蜂则完全失效,结果就是在训练集上表现极佳,而在测试集上却一塌糊涂。
我们真正希望模型做到的是泛化,也就是学会“蜜蜂有这些颜色和形状,有翅膀,有这么多条腿”,并且进一步理解“腿是一种……的东西”,“翅膀是一种……的东西”,以此类推,直到最基本的像素层面。
之所以这么做很难,是因为在错误的激励下,单纯记忆往往显得“更容易”。我们通常是逐步迭代地训练模型,每一步只需让模型更好地判断几幅图片或几个样本。
既然仅仅记住一些像素规则就能应对这32张图片,何必还要去寻找某种优美而可泛化的表征呢?正因如此,机器学习领域的重大进展往往来自那些阻止模型记忆,或促使它们将记忆到的概念加以泛化的技术突破。
需要指出的是,我在这里以图像分类为例,因为它比较直观,但这个问题普遍存在于几乎所有的机器学习任务中。
现在回到我们人类自身。我就以自己为例吧(没错,写这篇文章时没有借助任何AI,只是最后做了几次拼写检查)。我一直很讨厌死记硬背。
也许是因为我有注意力缺陷多动障碍,但原因并不重要——我从没背过乘法口诀,上语言课时也讨厌记单词翻译,更懒得记住各种公式(为此我很感激,在很多科目里我都允许使用公式手册)。
相反,我总是想凭借直觉答题,在考试中通过从基本原理出发一步步推导来得出答案。在很多情况下,这也是我别无选择,因为我不做大部分作业,这就成了唯一的出路。
对于语言这类学科,这种方法行不通,所以我差点挂科。比如法语里的阴阳性变化几乎没有统一规律。于是,我也成了那种“没怎么用功”的人,但我依然每节课都去听,提了很多问题,而且从不记笔记。
我只是让自己的思绪随着老师的讲解自由游走,一边思考所讲内容,一边试图把它和自己已有的知识联系起来(当然,偶尔也会承认自己在刷手机)。
如今,我是一名系统架构师,仍然不擅长记住琐碎的小事,也不愿强迫自己去掌握那些细小而随意的细节。我把这些称为“偶然的复杂性”,并避之唯恐不及。
不过,我学得很快,在工作中,把握全局的能力一直很有价值。我并不认为某种思维方式就一定比另一种更好,但我想通过这篇博文表达的核心观点是:在教育孩子、设计课程时,我们应该更加谨慎地考虑究竟该鼓励怎样的学习方式。
我大胆地提出:当前我们过于强调记忆,这样做反而可能抑制人们在学习过程中发展出对本质的理解。这当然是我的推测,但如果每一次错失泛化的机会都会削弱下一步泛化的动力,那么总有一天,即便整体上拥有更扎实的直觉会让你受益更多,你也几乎不会再有那样的需求了。
至于这对教学意味着什么,我暂时还没有具体的设想,但这确实与我所欣赏的教师类型颇为契合。格兰特·桑德森本人就是一个很好的例子,他总是努力培养那种根本性的直觉,同时也意识到,激发好奇心(比如通过引人入胜的故事线)是实现这一目标的最佳途径之一。
希望这篇博文能让你有所收获。这个想法本身是我把教师的教学方式、机器学习领域的演进历程以及人脑的学习机制这几大主题进行泛化后的产物——这些都是我在学术环境中接触过的,但我始终拒绝单纯地死记硬背。
也许这只是一堆勉强关联的抽象杂谈(对此我也不否认自己偶尔会写这种东西),又或许其中蕴含着某种本质上的道理。至于哪种说法更接近事实,就交由你来判断吧,欢迎留言讨论这里。
本文首发于威尔逊博客。