偏好优化的数学原理:RLHF、PPO 与 DPO

本文的强化学习(Reinforcement Learning,RL)前置知识参考自 Sutton 的《Reinforcement Learning: An Introduction》。

语言模型的训练过程

在前几篇文章 MLP 与 BP 算法的数学原理经典注意力与经典 Transformer 的数学原理Mixture of Experts 的数学原理(~2026 文献综述) 中,我们分别在理论上讨论了 BP 算法、注意力与 Transformer 以及 MoE 架构。本文希望进一步讨论语言模型中偏好优化的数学模型。


一个现代 LLM 的典型训练过程可以被概括为以下几点关键步骤:

  1. Pretraining(预训练):使用海量的文本语料作为训练样本,按自回归语言建模目标 P(x;θ)=t=1∏T​P(xt​∣x<t​;θ) 训练模型,使模型学会根据已有上文预测下一个 token,获得基本的语言表达和推理能力。在完成这一步训练后,模型虽然已经具有大量语言、知识及一定的推理能力,但尚不能稳定地遵循人类指令或作为「AI 助手」交互。
添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论