在大语言模型中控制推理精力

在大语言模型中控制推理精力 图片 1

自从OpenAI发布o1——这款模型使基于大语言模型的推理模型这一理念广为人知——已经将近两年了。
大约四个月后,DeepSeek-R1随之问世,并公布了基于可验证奖励的强化学习(RLVR)训练方案的详细内容,
用于训练此类推理模型。

上周,OpenAI发布了GPT-5.6模型系列。该系列共分为三种规模,每种规模都配备了大约五到六个不同推理强度的设置。

图1:具有不同推理强度设置的GPT 5.6 Sol模型。(目前尚无Ultra的基准测试数据,但其表现应与Max大致相当,
因为两者采用的推理强度水平相近,且通过四个子代理实现了工作加速。
)

因此,是的,推理模型将长期存在,并已成为现代模型发布中不可或缺的标准组成部分。

在过去,我……

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论