在大语言模型中控制推理精力

自从OpenAI发布o1——这款模型使基于大语言模型的推理模型这一理念广为人知——已经将近两年了。
大约四个月后,DeepSeek-R1随之问世,并公布了基于可验证奖励的强化学习(RLVR)训练方案的详细内容,
用于训练此类推理模型。
上周,OpenAI发布了GPT-5.6模型系列。该系列共分为三种规模,每种规模都配备了大约五到六个不同推理强度的设置。
图1:具有不同推理强度设置的GPT 5.6 Sol模型。(目前尚无Ultra的基准测试数据,但其表现应与Max大致相当,
因为两者采用的推理强度水平相近,且通过四个子代理实现了工作加速。
)
因此,是的,推理模型将长期存在,并已成为现代模型发布中不可或缺的标准组成部分。
在过去,我……
评论
?
参与讨论