每周只用两分钟:孩子为何对AI辅导软件无动于衷

这个词是“通常”。
新墨西哥州一名四年级学生,在耳机里大声朗读时,绊倒了。她知道“通常”是什么意思。她在对话中使用它。那一刻,她无法从屏幕上的字母理解到脑海中的声音:中间音节的折叠,“s”变成“zh”的样子,单词看起来完全不像发音。这是一个解码难题。它有一个特定的教学答案,答案涉及将单词拆分成部分,并将这些部分映射到发音。
电话那头的AI阅读导师Amira给了她一个定义。
女孩的母亲温迪·格雷厄姆是拉斯克鲁塞斯公立学校的高中历史老师,曾任五年级教师。她最初是在2025年暑期阅读项目中接触到这个平台,后来在家里使用了。她看着软件识别出词汇空白,却忽略了解码失败。她的儿子被提供同样的紫发头像,却完全拒绝使用。
“孩子们不会为机器人尽全力,”格雷厄姆在2026年9月2日发表的一篇文章中告诉教育媒体《The 74》。“孩子们会为别人尽力。”
这种说法可以被当作感情的表达。但同一周,三条严格的定量证据线通过完全不同的途径得出了大致相同的结论,且都没有情感成分。它们涉及随机对照试验、日志文件,以及大量儿童在免费使用历史上资本最丰富的教育技术后,每周使用大约两分钟。
每周两分钟
最引人注目的数据来自斯坦福大学的国家学生支持加速器,其研究人员在两个服务高贫困人群的美国学区的小学生中进行了两项随机对照试验。论文题为《访问还不够:人类支持提升人工智能辅导的参与度》,由卡莉·D·罗宾逊、大卫·戈姆利、安娜·特林达德·里贝罗和苏珊娜·洛布撰写,并于2026年6月作为安纳伯格研究所工作论文发布。
设计很简单。学生可以使用一个人工智能素养平台,并有固定的使用时间。他们每周至少要完成两次30分钟的课程。该平台的提供者表示,学业上的益处通常在每周使用约30分钟后开始显现。一半的学生是自己使用该平台;其余学生则有一位人工导师陪同,其工作明确不是教学,而是参与度、激励和故障排除。
在独立使用条件下,A区只有60.7%的学生和B区53.3%的学生真正使用过该平台。不是“好好使用”。从未。只登录过一次,干预期从14到31周不等。
A区的平均每周使用时间为2.18分钟,B区为5.23分钟。目标为60分钟。使用过的学生在使用周内分别为13.2分钟和25.8分钟,这说明平均值并非光用户群体,而是几乎全部非使用者,偶尔有爆发。平均来看,学生在持续31次干预中仅用了四到五周时间触碰了平台。
在教室中增加一名真人帮助有所帮助,且帮助的规模具有启示性。参与度增长了71%到80%,听起来很有变革性,但你注意到A区的每周使用量增加了1分钟,B区增加了4.4分钟。整个干预期间,人工辅导员为每位学生额外购买的平台时间不到两小时。阅读成就没有变化。
“我们本来没打算测试的一个关键发现,”罗宾逊告诉Chalkbeat,“那就是能接触到这个AI导师并不等于使用它。”
该中心执行主任洛布更直白地表达了这一制度结论:“我们没有确凿的研究表明人工智能辅导在美国大规模可行。”
论文附录中隐藏着一个细节,值得比实际关注更多的关注。在那些被允许独立使用该平台的学生中,参与的学生更可能成绩更好,也更不可能获得特殊教育服务。那些可能从额外阅读练习中获益最多的孩子,最不可能打开申请。一项被宣传为均衡器的技术,在唯一两个有人认真测量的学区,却制造了一个梯子,而底层学生没有攀爬。
约束约束
第二项研究规模更大、时间更长,甚至对乐观观点的损害更大,正是因为该产品有效。
多伦多大学的Philip Oreopoulos和Charles River Associates的Nina Low在2024-25和2025-26学年间,在田纳西州汉密尔顿县的18所初中进行了为期两年的随机集群试验。在现有的每日补习数学课程中,学生被随机分配到Khan Academy,该平台的生成式AI导师,配置为指导而非传授答案。论文题为《一键之遥:两年学校实验中的Khanmigo人工智能辅导》于2026年8月作为NBER工作论文35620发表。
作业每学期使数学成绩提升了1.3个全国百分位,学年内大约增加了0.06到0.08个标准差。作者计算出,整整一年的积极参与意味着大约0.14个标准差。他们指出,这些进步与可汗学院在完全没有任何人工智能辅助的情况下的实践结果相似。
接下来是日志文件考古学,这才是真正的贡献。96%的学生至少尝试过一次Khanmigo。中位数学生在练习数学的天数中只有三分之一的天数发消息。而在学生实际犯错的练习环节中,也就是理论上导师最有价值的时刻,他们仅有17%的情况下咨询了AI。他们发送的信息,作者描述中,大多是空洞的回答或对建议提示的点击。
研究人员写道:“几乎普及了,但参与度很低。”
他们的结论是整个行业都应该争论的一句话:“约束力似乎在于参与度:实现人工智能辅导的承诺需要让学生使用它,而不仅仅是让他们获得访问权限。”
萨尔·汗本人在论文发布前几个月就曾如此表示。2026年4月,他告诉《Chalkbeat》,对许多学生来说,Khanmigo“根本不是一件大事。他们只是没怎么用它。”当被问及让AI导师在每个教室都能永久使用时,他用四个字总结了采用趋势:“有些人会;大多数不会。”他补充说,虽然人工智能会有帮助,“我们最大的杠杆是真正投资于人类系统。”
这是创始人描述他2023年TED演讲中承诺为地球上每个孩子配备私人导师的日志文件之间的差距。
乐观论证的最强版本
如果就此停止,那是懒惰的,因为乐观的观点并不愚蠢,也不明显错误。它应该在测试之前被妥善构建。
从经济学说起。高剂量的人类辅导是教育中证据最充分的干预措施,但代价也极其昂贵。Andre Nickow、Philip Oreopoulos 和 Vincent Quan 的系统综述汇总了学前至12年级辅导的实验证据,报告整体效应为0.37个标准差,后来在《美国教育研究杂志》发表的版本中修正为0.29。效果在辅导员为教师或助教、低年级以及辅导发生在上课时间而非放学后时最为强烈。教育基金会的工具包将一对一的学费评估为最多五个月的额外进步。没有人否认辅导是有效的。争论一直是关于是否有人能负担得起足够的辅导。
原则上,人工智能导师的边际成本接近零,耐心无限。它从不早晨糟糕。它在晚上十一点可用,用家长可能不会说的语言,为一个学校数学系有三个空缺的孩子提供。如果它能以百分之一的价格实现人类效果的一小部分,成本效益计算将令人难以承受。
而且有真实证据表明它确实可以。世界银行在尼日利亚埃多州的一项随机试验,为中学生提供了六周的课后GPT-4辅导,在教师监督下两人一组,辅导题目旨在促进推理而非捷径。该项目整体提升了约0.3个标准差,主要成果为英语方面提升了0.23个标准差,平均每名学生获得约48美元。该项目以发展中国家教育干预措施数据库为基准,表现优于约80%的学生。
还有一段更悠久的历史,而当前的话语往往会遗忘。智能辅导系统并非新鲜事物。卡内基学习的认知辅导源自卡内基梅隆数十年的认知科学研究。伍斯特理工学院开发的ASSISTments在缅因州46所学校的大型随机试验中进行了评估,结果在年终标准化数学测试中产生了约0.18个标准差的影响,对先前成绩最弱的学生效果最大。对智能辅导系统的元分析综述报告显示,根据对比条件,平均效应在0.37到0.50个标准差之间。这些效果并非无意义。与典型的教育干预相比,它们是值得称道的。
汗学院对汉密尔顿县审判的回应也提出了类似观点。汗在2026年8月撰文指出,持续参与者0.14标准差的数字“是一个真正强有力的结果”,研究并非在问汗学院是否优于无所作为。它是将汗学院与学区已有的数字数学项目和小组教学进行比较。这是一个要求很高的比较,而该平台并未失去这一点。
还有斯坦福自己的相反发现,这也是乐观派手中最有趣的牌。由Rose E. Wang、Ana T. Ribeiro、Carly D. Robinson、Susanna Loeb和Dora Demszky主持的Tutor CoPilot试验,为900名人类导师与1800名历史上服务不足社区的学生合作,实时提供专家般的建议。拥有该工具的导师学生掌握主题的可能性高出4个百分点。评分最低的导师学生提升了9个百分点。每位导师每年费用约为20美元。
所以,诚实的钢铁人是:这项技术确实能教学,价格惊人地便宜,至少在低收入环境中的一次严格实地试验中奏效,而且它让人类导师在面对他们时明显更优秀,而不是对孩子。任何想争辩说人工智能辅导是骗局的人,都必须解释这四个事实。
案件的分歧
当模型不再是句子的主语,而孩子成为主语时,这种关系就崩解了。
注意那些成功例子的形状。在尼日利亚,学生们在放学后、教师监督下成对学习,并有结构化的提示。那不是人工智能导师。那是一个小小组人类干预,中间有一个语言模型,试验无法将模型的贡献与出现的成年人和坐在旁边的同伴的贡献分开。Tutor CoPilot 更明确:它不辅导任何人。它低声告诉已经与学生有关系的人类辅导员。每一个人工智能辅导产生显著效果的案例,都是有人在场的情况下。
斯坦福的识字试验测试了另一种配置,即市场宣传和采购文件假设的,即儿童和软件单独相处。该配置每周产生2.18分钟。
这是该行业三年来一直拒绝区分的。能够回答问题的系统与孩子实际会提出的系统之间有着巨大的差别。模型能力一直在陡峭的曲线上有所提升。而愿意向机器寻求帮助则没有,因为这从来都不是模型能力的函数。
寻求帮助是教育心理学中研究最深入的行为之一,它在社会层面上负荷很大,基准分数无法捕捉。寻求帮助是一种承认。孩子们会权衡这种承认与代价:在同龄人面前显得迟钝、让老师失望、确认对自己的私人怀疑。一个好辅导老师之所以有价值,不在于他们拥有答案。而是因为他们建立了足够的信任,使得录取感到安全,并且足够熟悉,能在孩子表达之前察觉到困惑。
Khanmigo根本做不到第二件事,而17%的数字表明它不够信任,无法获得第一项。一个刚在补习数学课上答错题的孩子,正处于人类导师会倾身而来的情感坐标。AI坐在那里,只需点击一下,却没有被点击。
为什么孩子们为那些会注意到的人工作
斯坦福最受关注的结果不是那两分钟。而是加入一名明确禁止授课的人,参与度仍提升了71%到80%。
这些试验中的导师并非授课的学科专家。在B区,他们是中学生,被选中是因为他们在自己的英语课上表现优异且有空闲时间。他们的工作是签到,保持学生专注任务,整理耳机和密码,并与孩子们交流他们的工作。他们每节课都会花部分时间进行关系建设活动,减少平台可用的时间。但他们仍然产生了这些试验中最大的参与效应。
那些导师提供的是关系责任感:简单而不光鲜的事实——有人会注意到。有人会知道你是否登录过。有人会问故事进展如何。努力对另一个人来说变得可读,而可理解的努力是孩子们一直努力获得的货币。
软件可以模拟这一点。但它无法实例化。通知说“我们昨天想你了”并不是一个人想念你。包括非常年幼的孩子在内的孩子们似乎非常擅长区分。新墨西哥州一位一年级学生,她的母亲在NBC新闻报道中引用了她的话,她抱怨软件“她不让我说完句子,她不听。”一位阿尔伯克基家长报告说她的孩子们说阿米拉“像个新老师,但他们其实并不真正理解我”,其中一个孩子不再喜欢阅读。
一项入选2026年学习分析与知识会议的研究大大提升了这一机制。Conrad Borchers、Ashish Gurung、Qinyi Liu、Danielle R. Thomas、Mohammad Khalil和Kenneth R. Koedinger分析了191名初中生在智能辅导系统上近2100小时的课堂实践,追踪了当人工导师在学生工作期间亲自拜访时发生的事情。访问期间参与度上升,之后保持较高。访问时间越长,回报越低,时间比时间更重要。基于具体、逐步搭建的互动,明确组织学生作业,效果最佳。他们对资源有限环境的建议谦逊令人沮丧:多次简短且适时的检查,其中至少一次是提前进行。
简短。时机恰当。有人情味。这篇论文,除了其他方面,其中之一是AI辅导本应让它变得多余的东西的成本练习,答案是它比任何人想象的都要便宜。不过不是免费的。从来不是免费的。
那个她无法解读的词
回归“通常”,因为它暴露的失败既是技术层面,也是关系层面,而技术版是无法通过更好提示解决的。
Amira的工作原理是倾听。学生通过麦克风朗读段落;自动语音识别将听到的内容与预期内容进行比较;当单词出错时,系统会介入,有时还会播放嘴巴正确发音的视频。这是一个真正巧妙的流程,它做到了人类导师无法大规模完成的事情,即为班上每个孩子同时进行个人阅读练习并获得即时反馈。
但请考虑信号中实际包含的内容。孩子在“通常”时犹豫。仅从声学证据来看,这种犹豫至少符合四个明显条件:她不知道这个词;她知道这个词但无法解码正字法;她能解码,但读得太慢,无法在工作记忆中保持句子;或者麦克风捕捉到了隔壁桌上的孩子。这些需要四种不同的反应。定义单词只在第一种情况下有用。在格雷厄姆女儿的案例中,是第二种,软件选择了第一种。
更广泛的证据表明,这并非孤立的失误。《阿尔伯克基日报》2026年4月的报道记录了教师描述个别学生的Amira分数每月波动20至30百分位,一位教学教练称其为统计学异常。一位幼儿园老师指出,该系统“并不总是能很好地掌握口语困难学生的语言”。课堂背景噪音污染了成绩。一位特殊教育老师描述了学生在评估日发出呻吟和哭泣的声音。
新墨西哥州要求全州范围内从幼儿园到二年级都使用Amira,每年费用约270万美元,每年三次,每月对低于预期的学生进行评估。爱达荷州也有要求;加利福尼亚、乔治亚、马萨诸塞、密歇根、俄克拉荷马和德克萨斯州已授权。根据2026年9月2日发布的Reason报告,只有8%的新墨西哥受访教师和管理人员表示对此没有重大担忧,尽管该民调是由州教育部门在其培训中进行的,且该部门表示其不具代表性。Amira的首席执行官Mark Angel坚决捍卫了这一证据基础,称“没有其他可扩展的教学干预措施被如此多次、如此多的独立团队质询,且效果如此一致。”
这两点都可能是真的。在正确使用条件下,疗效研究可以显示实际的阅读提升,而部署仍然可能系统性地误诊那些口音、方言、语言差异或课堂声学不符合模型舒适中心的孩子。最有可能被语音识别系统误读的孩子,往往是该系统资助帮助的那些孩子。
这一要求未能在夏季完整保留。家长们大批出席全州各地的校董会会议,他们更担心的是孩子声音录音的去向,而非教学问题。六个学区和特许学校因隐私理由完全拒绝使用该软件:圣菲、洛斯阿拉莫斯、法明顿、罗斯韦尔、克莱顿和特鲁奎斯特许学校,豁免仅限于当学年。2026年8月4日,在新学期开始前几天,公共教育部发布了由部长玛丽安娜·帕迪利亚签署的修订指导,允许学区在不使用语音录制功能的情况下运行Amira,改用纸质测试,或使用自己的评估程序。语音录音默认每月删除,学区现在可以申请每日、每周或年终删除。教育部坚持这一原则,认为“全州统一评估提供了支持一致性、透明度、问责制和公平决策的共同衡量标准”。Amira仍然是全州的强制要求。它只是不再存在于每所公立学校。
该州最大的学区阿尔伯克基公立学校于2026年8月26日决定保留该项目,但做出了一些让步:取消辅导部分的语音录音,测试功能有48小时的删除窗口,以及为选择退出的家长提供纸笔替代。副总监兰迪·马勒温将48小时的限制解释为妥协方案,测试数据在该周期被删除,“以便教师有机会聆听录音”。代表琳达·塞拉托带领三十多名立法者致信要求监督,直言不讳地表明了风险:“你们谈论的是5至8岁儿童的生物识别数据。这些数据很宝贵,我们知道,但必须如此对待。”安吉尔则表示,公司宁愿根本不保留这些材料。“我们不想收集这些数据;这很麻烦,”他说。“如果立法机关或教育局让我们停止收集数据,我们会立刻停止。”
值得准确判断哪些是有效的,哪些是没有的。没有新的有效性发现促使了这一切。证据基础在八月时与四月完全相同。变化在于家长们出席,学区拒绝,立法者写信,也就是说,自动化系统的纠正是通过人们密切关注特定儿童而实现的,而这正是这项技术被作为替代的唯一资源。
谁承担风险
这些都没有反映在学区购买方式中。
教育技术是靠许可证销售的,而不是按使用量。学区承诺按学生收取年费,供应商记录收入,孩子是否登录则是别人的问题。这并非新病态。LearnPlatform在生成式人工智能浪潮兴起前的分析发现,大约四分之一到三分之一的已购买教育技术许可证从未被激活,而高强度使用(定义为每件产品在评估之间十小时或更长时间)适用于约2%的许可。估计每年超过十亿美元的美国K-12许可支出被归类为纯粹浪费。
斯坦福和汉密尔顿县的试验显示,生成式人工智能产品生成继承了这种结构,但迄今尚未改进。一个每周安排两次30分钟会议、每次2.18分钟的学区,支付的费用大约是其认为购买的干预单位成本的27倍。没有人合同里写这句话。
公共支出并非微不足道,且越来越显眼。新墨西哥州每年在阿米拉学校上花费270万美元。爱荷华州承诺2024年投入300万美元,之后再投入250万美元。路易斯安那州批准了360万美元,外加另一百万美元。佛罗里达州杜瓦尔县公立学校的采购结构有所不同。其2024年的合同价值10万美元,覆盖约2600名阅读水平低于年级水平的二至四年级学生,将一半费用与学生进步挂钩。其中超过1200人达到了口语阅读流利度目标,超出合同预期的标准,这可能是不错的结果,也可能像抛硬币一样昂贵,具体取决于你的反事实情况,但学区只支付了中标部分的费用。值得注意的是,北卡罗来纳州将其对汗米戈的资金从1000万美元削减到50万美元。
美国教育大臣琳达·麦克马洪承认,评估人工智能课堂价值的“指标不多”,并提出了显而易见的问题:“我们看到学校的成果更好吗?如果没有,那么学校应该撤出。”
公众似乎远远领先于采购部门。2026年5月,Morning Consult对2000多名注册选民进行的世纪基金会调查发现,84%的人担心私营公司收集并从学生数据中获利,81%的人担心教师被施压使用AI工具,却没有经过证明的教学效益。77%的人希望政府设立防护措施,这一数字跨党派一致。49%的人认为课堂技术和人工智能应尽量减少使用。这并非技术恐惧的边缘群体。这是一个稳定的多数,表达了市场迄今为止被设计为忽视的偏好。
双西格玛幽灵
在过去三年里,每一份AI辅导的提案背后都有一个数字,几乎没有人引用它。
1984年,本杰明·布鲁姆在《教育研究者》杂志上发表论文,指出一对一教学并掌握学习的学生比传统教学的学生多出两个标准差,平均接受辅导的学生比对照组高出98%。他将其定位为一个挑战:找到一种能够实现辅导效果的小组方法。“2西格玛问题”成为教育技术的奠基经典,生成式人工智能也全面继承了这一理念。每一个为每个孩子配备私人导师的承诺,都是在软件领域弥补布鲁姆差距的承诺。
该数字至今未被复制。布鲁姆的发现基于他自己学生的两篇博士论文,样本量小、时间短且采用研究者设计的结果指标。1982年彼得·科恩、詹姆斯·库利克和陈林·库利克的荟萃分析已将平均辅导效应约为0.33个标准差。尼科、奥雷奥普洛斯和权的综述在实验文献中未发现接近两个西格玛的案例;其合并估计值在0.29至0.37之间,具体取决于具体参数。布朗大学的马修·克拉夫特认为,布鲁姆的数值帮助该领域对效应量的预期有了固定,而这些效应几乎不会发生,并指出大多数教育干预产生的效应在0.1标准差或更小范围内。
与该修正基线相比,汉密尔顿县每年0.06到0.08标准差,持续参与则升至0.14,这并不令人羞辱。这只是一项正常的教育干预。羞辱完全源于承诺内容。
英格兰的国家辅导项目提供了一个值得关注的对应案例。该项目在应对疫情学习损失的大量资金下启动,但其独立评估未发现学费伙伴路线改善了英语或数学的关键阶段2或关键阶段4的成绩,而学校主导的辅导则带来了相当于约一个月进步的小幅进步。这项在教育领域拥有最佳证据基础、在全国范围内时间紧迫下实施的干预措施,基本未能重现自身效果。然而,81%的受访学校负责人认为该项目帮助学生赶上了进度。实践者感知与数据记录之间的差距并非人工智能独有。这正是规模对干预措施的影响,也应当打破任何认为人工智能辅导问题仅限于人工智能的假设。
超越测试分数
还有一个争论,这与整个辩论的框架相悖。
Lucile Favero、Juan Antonio Pérez-Ortiz、Tanja Käser和Nuria Oliver于2026年2月提交的一篇论文认为,仅仅根据学习成果来评估教育人工智能,忽略了大部分关键。他们的框架识别出四个相互关联的维度:认知卸载、学习者能动性减弱、情感脱离和以监控为导向的实践。他们的核心观点是,这些维度相互强化,复合效应作用于批判性思维和公民参与,而非考试成绩。他们谨慎避免过于确定性。他们认为,设计良好的系统可以在维护有意义的人际互动的同时支持推理和自主性。问题不在于人工智能是否属于教育领域,而在于机构如何运用它。
将这种视角应用到当前证据上,会出现一些令人不安的现象。田纳西州、加利福尼亚州和新墨西哥州记录的薄弱互动被解读为失败。在Favero框架下,这可能是部分保护。一个不把想法交给聊天机器人的孩子,不会受到聊天机器人的伤害。汉密尔顿县那些发送简单答案并点击建议提示的学生,表现出了认知科学家担忧的寻求答案行为,而且音量很低。
这就引出了一个真正棘手的问题。如果参与度提升到供应商推荐的每周30分钟,学业成就会随之上升吗?还是我们会有更多孩子更高效地外包构成学习的认知工作?没人知道。那些能告诉我们答案的试验尚未被执行,因为所需的剂量从未达到。Robinson团队坦率地指出:他们从未达到足够的使用范围来判断该工具是否有效。
诚实证据标准所需的条件
承诺与交付之间的差距不会被更好的模型填补,因为限制从来不在于模型本身。通过改变学区允许购买的物品和供应商必须展示的物品,可能会缩小差距。
四项修改将完成大部分工作。首先,有效性声明应以剂量为函数形式陈述,并与实际部署中观察到的剂量一起报告。一个产品如果其效能研究假设每周30分钟,应该每年公布其实际中位用户按选区的实际使用量。其次,合同应将支付与使用挂钩,而非席位数,这将使不参与的风险从公共资金转移到能够设计反对其的一方。杜瓦尔县已经这样制定了半份合同,因此这是一个带有工作实例的改革,而非思想实验。第三,试验应预先注册并报告无效。斯坦福的识字论文正是因为其标题发现未能确立技术的任何信息。第四,部署公平应作为报告指标,而非事后补充。如果最不可能提交申请的学生是有特殊教育需求且先前成就最低的学生,学区需要在第二个月知道这些信息,而不是从两年后的工作论文附录中得知。
这些都不算奇特。这大致是药品监管机构视为基线的标准,也是教育基金会在英国花了十五年时间努力建立的标准,英国基于123项研究,一对一教学的证据被评为中等安全。它在教育技术中显得陌生的原因是教育技术从未达到过这一标准。
女孩和阿凡达
孩子绊倒的“通常”是整个争论被压缩成一秒的音频。
她需要的是有人注意到她困惑的具体形式:不是她缺少这个词,而是她无法通过拼写来找到它。注意并不是一种随参数变化的能力。 它需要针对某个特定的人,持续一段时间的注意力,而且最重要的是,该人知道正在针对他们。 最后一部分是产生努力的原因。 孩子们不努力工作,是因为有系统在监视。 他们努力工作,因为对他们重要的人会看到。
两分钟的课程并不是关于糟糕软件的故事。 从任何合理的技术标准来看,阿米拉和汉米戈都是令人印象深刻的人工制品,研究表明,当孩子们正确使用它们时,它们会产生教育研究一直发现的普通、真实、适度的收获。 这个故事是关于贯穿整个采购周期的类别错误:假设教育中的稀缺资源是教学,而稀缺资源始终是注意力,而注意力是永远不可能以零边际成本制造的东西。
斯坦福大学的导师被禁止教学,他们对数字的变动比人工智能还要多。 这就是我们的发现。 自布鲁姆以来,它就以这样或那样的形式出现,并且在一项本应使其过时的技术出现后,它仍然存在。 一个学区把钱花在那些能提高 71% 到 80% 的参与度的事情上,而不是花在每周产生 2.18 分钟的事情上,这并不是怀旧。 它正在阅读证据。
是否有人根据证据购买是一个单独的问题,从目前的情况来看,答案似乎是一个无关紧要的问题。
来源和参考文献
- Carly D. Robinson、David Gormley、Ana Trindade Ribeiro 和 Susanna Loeb,“访问还不够:人类支持提高了人工智能辅导的参与度”,EdWorkingPaper 第 26-1451 号,布朗大学安纳伯格研究所,2026 年 6 月。 https://edworkingpapers.com/ai26-1451
- Chalkbeat,“人工智能辅导有效吗?学生必须使用它来让研究人员找出答案”,Chalkbeat,2026 年 6 月 17 日。 https://www.chalkbeat.org/2026/06/17/ai-tutoring-research-ran-into-problem-students-wouldnt-use-it/
- Philip Oreopoulos 和 Nina Low,“一键点击:在为期两年的学校实验中使用 Khanmigo 进行人工智能辅导”,NBER 工作论文 35620,2026 年 8 月。 https://www.nber.org/papers/w35620
- Matt Barnum,“研究发现,学生很少与可汗学院的人工智能导师 Khanmigo 互动”,Chalkbeat,2026 年 8 月 25 日。 https://www.chalkbeat.org/2026/08/25/ai-tutoring-students-khanmigo-khan-academy-engagement-study/
- 马特·巴纳姆 (Matt Barnum),“为什么萨尔·汗 (Sal Khan) 正在重新思考人工智能将如何改变学校”,Chalkbeat,2026 年 4 月 9 日。 https://www.chalkbeat.org/2026/04/09/sal-khan-reflects-on-ai-in-schools-and-khanmigo/
- Sal Khan,“我在可汗学院的一项新的数学干预随机试验中发现了令人信服的内容”,可汗学院博客,2026 年 8 月 24 日。 https://blog.khanacademy.org/what-i-found-compelling-in-a-new-randomized-trial-of-khan-academy-in-math-intervention/
- Linda Jacobson,“研究表明,人工智能导师尚未取代人类”,The 74,2026 年 9 月 2 日。 https://www.the74million.org/article/ai-tutors-not-yet-a-replacement-for-humans-research-says/
- 世纪基金会,“美国人团结起来反对科技接管公立学校”,2026 年。 https://tcf.org/content/report/americans-are-united-against-the-tech-takeover-of-public-schools/
- Ed Finkel,“调查显示,选民对学校中的人工智能和科技表示广泛担忧”,K-12 Dive,2026 年 9 月 2 日。 https://www.k12dive.com/news/voters-express-broad-concerns-about-ai-and-tech-in-schools-survey-shows/829351/
- Conrad Borchers、Ashish Gurung、Qinyi Liu、Danielle R. Thomas、Mohammad Khalil 和 Kenneth R. Koedinger,“简短但有影响力:人类辅导互动如何塑造在线学习的参与度”,arXiv:2601.09994,2026 年 1 月 15 日。 https://arxiv.org/abs/2601.09994
- Lucile Favero、Juan Antonio Perez-Ortiz、Tanja Käser 和 Nuria Oliver,“人工智能在教育中超越学习成果:认知、能动性、情感和道德”,arXiv:2602.04598,2 月 4 日 https://arxiv.org/abs/2602.04598
- Rose E. Wang、Ana T. Ribeiro、Carly D. Robinson、Susanna Loeb 和 Dora Demszky,“Tutor CoPilot:扩展实时专业知识的人类人工智能方法”,arXiv:2410.03017,2024 年 10 月。 https://arxiv.org/abs/2410.03017
- Andre Nickow、Philip Oreopoulos 和 Vincent Quan,“辅导对 PreK-12 学习的令人印象深刻的影响:实验证据的系统回顾和元分析”,NBER 工作论文 27476,2020 年 7 月;以修订版形式发表在《美国教育研究杂志》,2024 年。 https://www.nber.org/papers/w27476
- Paul T. von Hippel,“双西格码辅导:将科幻小说与科学事实分开”,《教育下一步》,卷。 24、没有。 2、2024 年春季。 https://www.educationnext.org/two-sigma-tutoring-separating-science-fiction-from-science-fact/
- 教育捐赠基金会,“一对一补习”,教学工具包。 https://educationendowmentfoundation.org.uk/education-evidence/teaching-learning-toolkit/one-to-one-tuition
- 教育捐赠基金会,“国家辅导计划的独立评估”。 https://educationendowmentfoundation.org.uk/news/new-independent-evaluation-of-the-national-tutoring-programme-ntp
- Wenting Ma、Olusola O. Adesope、John C. Nesbit 和 Qing Liu,“智能辅导系统和学习成果:元分析”,教育心理学杂志,2014 年 11 月。 https://www.apa.org/pubs/journals/features/edu-a0037123.pdf
- 有效的社会计划,“ASSISTments”,Arnold Ventures。 https://evidencebasedprograms.org/programs/assistments/
- EdWeek 市场简报,“超过 10 亿美元的 K-12 教育技术许可费用被浪费”,2019 年 11 月。 https://marketbrief.edweek.org/education-market/more-than-1-billion-in-k-12-ed-tech-licensing-fees-go-to-waste/2019/11
- Tyler Kingkade,“认识阿米拉,一位人工智能阅读导师让新墨西哥州的一些家长和学校领导感到震惊”,NBC 新闻,2026 年 8 月 7 日。 https://www.nbcnews.com/news/education/ai-reading-tool-amira-new-mexico-parents-schools-privacy-concerns-rcna591161
- 伊丽莎白·诺兰·布朗,“机器人教师的入侵”,《Reason》,2026 年 9 月 2 日。 https://reason.com/2026/09/02/invasion-of-the-robot-teachers/
- Natalie Robbins,“出于对准确性和公平性的担忧,新墨西哥州学校使用 Amira AI 阅读评估”,《阿尔伯克基日报》,2026 年 4 月 26 日。 https://www.abqjournal.com/news/students-read-aloud-ai-scores-them/3029121
- Natalie Robbins,“出于隐私担忧,新墨西哥州放宽了人工智能阅读测试的规则”,《阿尔伯克基日报》,2026 年 8 月 10 日。 https://www.abqjournal.com/news/amid-privacy-concerns-new-mexico-eases-rules-for-ai-reading-test/3099834
- 《在家长反对声中,APS 在修改后继续使用 AI 阅读程序》,《阿尔伯克基新闻》,2026年8月26日。https://www.abqjournal.com/news/amid-parent-backlash-aps-keeps-ai-reading-program-with-changes/3110194
- CNN,“教育部长麦克马洪表示人工智能可以成为学校中的‘非常有效的工具’”,《国情咨文》,2026年8月23日。https://www.cnn.com/2026/08/23/politics/video/mcmahon-ai-in-schools-sotu

蒂姆·格林 总部位于英国的系统理论家及独立技术作家
Tim 探索人工智能、去中心化认知与后人类伦理的交汇点。他的作品发表在smarterarticles.co.uk,挑战技术进步的主导叙事,同时提出用于集体智慧和数字管理的跨学科框架。
他的作品曾在 Ground News 上发表,并被学术界和技术界的独立研究人员分享。
ORCID: 0009-0002-0156-9795 电子邮件: tim@smarterarticles.co.uk
收听每周免费节目 聪明文章播客