Codex 跑的快, 是因为模型懂时间?

我看到 oh my pi (omp) 的作者发了一个帖子,提到一个非常有意思的现象:
他说,在使用 coding agent 的过程中,GPT 系列的模型跑得非常快,而 Claude 系列的模型跑得就比较慢。
原因是 Claude 有时会执行很多很慢的命令。Codex 也会这样跑,但 Codex 的 tool 在返回结果时会带上对应的 wall time,也就是当前任务的执行时间,并且 Codex 基于这一点做过强化训练。
也就是说,GPT 模型在看到这个耗时之后,会自动去执行那些不太耗时的命令。
下面是 can 统计的一组数据:
- 平均耗时(all calls):Claude 为 4.39 秒(样本 47 万),Codex 仅为 1.22 秒(样本 67 万)。- 主会话:Claude 耗时 6.26 秒,Codex 为 2.61 秒。- subagents:Claude 耗时 1.29 秒,Codex 为 0.69 秒。- 排除人类/代理等待时间:Claude 需 2.70 秒,Codex 仅需 0.68 秒。- 分位数对比(中位数 / p90 / p99):中位数两者均为 0.01 秒,说明大多数命令都很快;但长尾差异极其夸张——Claude 的 p90 是 1.89 秒,p99 高达 60.0 秒;而 Codex 的 p90 是 0.50 秒,p99 仅为 11.0 秒。- 中断或报错的调用:Claude 占比 4.2%(近 2 万次),平均耗时高达 11.8 秒;Codex 占比 5.0%(超 3 万次),平均耗时仅 3.5 秒。
但是,有人质疑这个结论,认为大模型其实根本没有时间概念,快慢只是提示词和任务本身的问题。
目前我觉得这个观点有一定道理,但我更倾向于 can 的说法:可能 GPT 确实在这方面做了强化。若真如此,这其实对我们设计 agent tool 非常有帮助。
有没有懂这方面的大佬给咱们解答一下。