重新审视学习:现实世界中的模式识别
现实世界有规律——太阳朝某个方向升起,行星以特定速度轨道运动,原子以特定方式排列,自然界中一定数量(Pi),大爆炸或生命形成以某种方式发生(无论我们已知或未知)。
学习涉及识别这些模式——可能整个进化过程都是关于识别和适应这些模式。自然界有某种模式,单细胞生物通过识别和适应环境模式进化为多细胞生物。
人类也是通过这种方式进化和获得知识的。牛顿看到“哦,一个苹果掉下来了”,质疑为什么天空中的物体会掉下来而不是漂浮起来,从而发现了引力。
亚里士多德看到水是向动,而火或烟则向上流动,形成了物体自然位置的理论。我们观察到这些模式并将其分类形成抽象(或推广规则)。
科学就是理解自然界中的这些模式并推导出解释它们的方法:数学、物理学,甚至语言正是为此而发展的。
我们观察到自然界中重复的数字模式,并推导出数学。我们创造数字作为工具,定理作为推广,以更好地传达对模式的理解。向人们传达信息需要使用他人能理解的常见模式,这通过手势和符号来实现。
我们慢慢地建立起这些符号的集合,形成语言。
语言(无论是符号语言还是文本)被用作跨代传递知识的方式。我们通过语言积累对世界的理解。我们观察模式,形成理论,用抽象语言表达。
当大型语言模型(LLMs)基于这些文本训练时,能够接触到我们对世界的理解表达(我认为这是经过数百万年进化发展而成)。一个简单的下一个标记预测任务,就是理解语言中的模式——本质上是理解以语言表达的世界模式。
因此,对大量文本语料的预训练导致了对世界的知识获取(模式理解)。(微调就是学习如何利用所学知识进行预训练。)
我们人类通过经验训练——我们通过反复试验和现实世界的观察和世界的反应进化,形成了反复纠正的抽象概念(例如,一旦我们相信地球是方形的但事实证明是错误的,于是开发并测试了一个看似更接近我们世界观测的新理论)。
类似地,神经网络的训练丢失通过向更优的现实世界解释模式(目标预测)来纠正这种抽象形成或模式识别。
即使是学习这些模式也有规律:人类在某些规律中会成功,也会失败。遵循某些实践并避免某些错误,能带来更高的成功几率——所以许多作者在不同的书籍或食谱中正式阐述这些原则,帮助掌握某些技能或仅仅是让自己感到快乐。
人们从观察和自身经历中学习。我们也从他人那里学习——我们会学习成功者中有效的方法并避免失败的错误。
因此,学习一直是从现实世界中提取模式,无论是对我们作为人类的学习还是训练AI模型。当前的奖励黑客问题(近期原因之一)拥抱面事件通常源于由于我们的r导致的错误模式识别Eward 错误规范或者缺乏规范。
模型为了最大化奖励而进行合理化,却忽略了预期目标或模式。一个潜在的解决方案是验证模型提取的模式(或抽象)的正确性。这需要超越当前的数学奖励模型,因为它们容易被误认为是最终目标。
我们如何更好地指定我们的目标(或通过学习抽象的预期模式)?我们能否以某种方式指定一个抽象目标,并确保模型实现它?可以使用符号术语吗?
我们能否以人类通常避免奖励黑客的例子?金钱、名声、信任、幸福、物质物品、奖项、排名等奖励也被黑客化。一个简单的例子是h指数,它被认为是衡量某人科学贡献的一个好指标,但有些人通过在会议上推送多篇论文、串通接受或添加无关的共同作者名字来破解它(示例研究)?另一个例子是考试成绩反复被奖励黑客攻击:学生临时抱佛脚或考试中作弊,而不是真正学习内容。
所以古德哈特定律几乎在学习中无处不在:当一个衡量标准成为目标时,这个衡量标准就不再是好的衡量标准。我们如何区分目标(学习)和衡量标准(奖励)?
我认为用抽象术语明确目标并检查提取的模式抽象是一种有前景的方法。我们能否从中汲取动力评估合作关系形成某种训练目标合作关系,模型被赋予一个抽象目标,并将奖励视为测试目标的指标。
这类似于一个学生明知目标是获取知识,却通过考试成绩学习课程大纲来测试知识和提升(而不是把它当作满分目标)。
感谢阅读!感谢任何想法和评论。