偏好优化的数学原理:RLHF、PPO 与 DPO
本文的强化学习(Reinforcement Learning,RL)前置知识参考自 Sutton 的《Reinforcement Learning: An Introduction》。
语言模型的训练过程
在前几篇文章 MLP 与 BP 算法的数学原理、经典注意力与经典 Transformer 的数学原理 与 Mixture of Experts 的数学原理(~2026 文献综述) 中,我们分别在理论上讨论了 BP 算法、注意力与 Transformer 以及 MoE 架构。本文希望进一步讨论语言模型中偏好优化的数学模型。
一个现代 LLM 的典型训练过程可以被概括为以下几点关键步骤:
- Pretraining(预训练):使用海量的文本语料作为训练样本,按自回归语言建模目标 P(x;θ)=t=1∏TP(xt∣x<t;θ) 训练模型,使模型学会根据已有上文预测下一个 token,获得基本的语言表达和推理能力。在完成这一步训练后,模型虽然已经具有大量语言、知识及一定的推理能力,但尚不能稳定地遵循人类指令或作为「AI 助手」交互。
评论
?
参与讨论