也许我们可以从 AI 身上学到的一件事
3blue1brown频道的数学教育者格兰特·桑德森最近推出了一系列关于“压缩即智能”这一理念的视频。他探讨了信息论及其与人工智能的关系,虽然这个系列目前只有几集,但我已经非常欣赏其整体框架:能够从现实世界中提炼出更本质的东西,并以一种有用的方式将其与其他事物联系起来,这正是智能的本质。
每当我遇到那些我认为很聪明的人时,常常会听到他们说:“是啊,我在学校的时候没怎么用功。”我这里所说的“聪明”,并不是指他们无所不知,而是指他们学习速度快,善于传授知识,能够先抽象地描述一个概念,再结合实例加以说明,然后深入细节,而且整个过程都显得毫不费力。
所以,这些人似乎确实不需要花太多时间学习,这听起来是个合理的解释。不过,我最近开始思考,也许因果关系恰恰相反——也就是说,他们之所以“聪明”(按我的定义),正是因为没有死记硬背。
别急着说我疯了,在此之前,我想先谈谈我们是如何训练人工智能的,尤其是机器学习领域中的记忆与泛化问题。
在训练几乎所有的人工智能系统时,我们往往要花费大量精力去防止它们单纯地记住数据。这种现象有时被称为过拟合,还有一种类似的情况叫作捷径学习。
比如,给神经网络一张蜜蜂的图片,让它识别“这是一只蜜蜂”。许多朴素的方法只会去寻找图像中的一小块像素模式,然后记住“只要看到这些像素就是蜜蜂”。
这样的模型毫无实用性,通常只能对那张特定的蜜蜂图片有效,而对其他蜜蜂却一筹莫展;于是,它在训练集上表现惊艳,但在测试集上却惨不忍睹。
我们真正希望模型做到的是泛化——学会“蜜蜂有这些颜色和形状,有翅膀,有这么多条腿”,并且进一步理解“腿是一种……的东西”,“翅膀是一种……的东西”,以此类推,直到最基本的像素层面。
之所以这么做很难,是因为在错误的激励下,单纯记忆往往显得“更容易”。我们通常是逐步迭代地训练模型,每一步只需要让模型在有限的几张图片或样本上表现更好。
既然仅仅记住一些像素规则就能应对这32张图片,又何必去寻找那种优美而可泛化的表征呢?正因如此,机器学习领域的重大进展往往来自于如何阻止模型陷入记忆,或者如何引导它们将已记住的概念进一步泛化。
现在回到我们人类自身。我就以自己为例吧(没错,写这篇文章时没有借助任何AI,只是最后做了几次拼写检查)。我一直讨厌死记硬背。
也许是多动症的缘故,但原因并不重要——我从没背过乘法口诀,也讨厌在语言课上记单词,更懒得记住各种公式(为此我特别感激很多科目允许使用公式手册)。
我总是希望能凭借直觉解题,在考试中通过从基本原理出发一步步推导来得出答案。在很多情况下,这也是我唯一的选择——因为我不做大部分作业,所以只能这样。
对于语言这类学科,这种方法行不通,所以我几乎挂科了。比如法语里,阳性与阴性的规则几乎没有一致性。因此,我成了那种“没怎么用功”的人,但我依然每节课都到,会问很多问题,而且从不记笔记。
相反,我会让自己的思绪随着老师的讲解自由游走,试着把讲授的内容与自己已有的知识联系起来(当然,偶尔我也承认自己可能在刷手机)。
如今,我是一名系统架构师,仍然不擅长记住琐碎的小事,也不愿意强迫自己去掌握那些细小、随意的细节。我把它们称为“偶然的复杂性”,并尽量避之不及。
但我的学习速度很快,而把握全局的能力在我的工作中极为宝贵。我并不认为某种思维方式就一定比另一种更好,但我想通过这篇博文表达的核心观点是:在教育孩子、设计课程时,我们应该更加谨慎地选择所鼓励的学习方式。
我大胆地提出:当前我们过于强调记忆,这反而可能抑制人们在学习过程中发展出对本质的理解。这只是我的推测,但如果每一次错失泛化的机会都会降低下一步泛化的价值,那么总有一天,即便从整体上看拥有更扎实的直觉会更有利,你也几乎不会再有那样的需求了。
我暂时还没有关于教学改革的具体设想,但这确实与我所欣赏的教师类型颇为契合。格兰特·桑德森本人就是一个很好的例子——他总是努力培养学生的根本直觉,同时也意识到,激发好奇心(比如通过引人入胜的故事线)是实现这一目标的最佳途径之一。
希望这篇文字能让你有所收获。这个想法本身是我对多个主题的泛化:教师如何教学、机器学习领域的演进,以及人脑的学习方式——这些都是我在学术环境中接触过的,但我始终拒绝单纯记忆。
也许这只是一堆勉强关联的抽象杂谈(对此我也不否认自己偶尔会写这种东西),但也可能蕴含着某种本质上的道理。至于哪种说法更接近事实,就交由你来判断吧,欢迎留言讨论给你。
本文首发于威尔逊博客。