CodexClaudeAI Agent

Codex 跑的快, 是因为模型懂时间?

Codex 跑的快, 是因为模型懂时间? 图片 1

我看到 oh my pi (omp) 的作者发了一个帖子,提到一个非常有意思的现象:

他说,在使用 coding agent 的过程中,GPT 系列的模型跑得非常快,而 Claude 系列的模型跑得就比较慢。

原因是 Claude 有时会执行很多很慢的命令。Codex 也会这样跑,但 Codex 的 tool 在返回结果时会带上对应的 wall time,也就是当前任务的执行时间,并且 Codex 基于这一点做过强化训练。

也就是说,GPT 模型在看到这个耗时之后,会自动去执行那些不太耗时的命令。

下面是 can 统计的一组数据:

- 平均耗时(all calls):Claude 为 4.39 秒(样本 47 万),Codex 仅为 1.22 秒(样本 67 万)。- 主会话:Claude 耗时 6.26 秒,Codex 为 2.61 秒。- subagents:Claude 耗时 1.29 秒,Codex 为 0.69 秒。- 排除人类/代理等待时间:Claude 需 2.70 秒,Codex 仅需 0.68 秒。- 分位数对比(中位数 / p90 / p99):中位数两者均为 0.01 秒,说明大多数命令都很快;但长尾差异极其夸张——Claude 的 p90 是 1.89 秒,p99 高达 60.0 秒;而 Codex 的 p90 是 0.50 秒,p99 仅为 11.0 秒。- 中断或报错的调用:Claude 占比 4.2%(近 2 万次),平均耗时高达 11.8 秒;Codex 占比 5.0%(超 3 万次),平均耗时仅 3.5 秒。

但是,有人质疑这个结论,认为大模型其实根本没有时间概念,快慢只是提示词和任务本身的问题。

目前我觉得这个观点有一定道理,但我更倾向于 can 的说法:可能 GPT 确实在这方面做了强化。若真如此,这其实对我们设计 agent tool 非常有帮助。

有没有懂这方面的大佬给咱们解答一下。

添加评论
点赞收藏
点踩分享
评论4
?
参与讨论
等等等等,codex快吗?不仅codex不快,gpt系列模型不管放在哪个agent里面,体感都是最慢的
11小时前
2回复
astra明显快了很多
10小时前
回复
可能咱是国内,omp作者测的数据显示是明显快的
9小时前
回复
回复 @hentai 5.4 5.5的时候还是快的,5.6之后感觉非常慢,当然 Claude 其实会更慢
9小时前
2回复
不是,claude 明显要比 codex 更喜欢执行一些很长很慢的命令。你自己都说了 你觉得 gpt 系列模型放在 别的 agent 里面也感觉慢,多半是网络问题导致的。
4小时前
回复
luna 在 kiro 里是 kiro 里面最快的
4小时前
4回复
回复 @绘陌 luna上了都
4小时前
5回复
我不是专家,但我觉得这很重要。dsv4.1蒸claude太多,已经毫无时间管理的概念。前天让它写个显示latex公式的命令行小工具,它可能前十分钟就写好了代码,但此后三个小时陷入了无限的“假设-验证”循环,在一些琐碎的我看不懂的技术细节上不停地磨,一个验证扯出更多地验证,直到我强行停止。我被这种癌变式的递归吓到了。
3小时前
回复
如果AI要懂时间的话或者在这个方面增强,确实可以达到非常好的效果
3小时前
3回复
ds不太可能真蒸claude。它在cc上的表现比它在codex上的表现差非常多。在445个测试里,ds在cc中的通过率不到70%,在codex中接近80%
3小时前
回复
我也感觉到了,有时候执行一些命令太慢了,比如我已经给他grep基于ripgrep了,他还是掉shell自带的grep慢的很
3小时前
3回复
回复 @艾莉西亚 harness和ai model没什么必然关系。ds在codex上表现好,可能纯粹就是codex接口写得规范。
2小时前
1回复
真得假的。我总感觉反过来了。Claude干活很快。codex干活慢。还非常喜欢防御性编程 然后写一大堆测试
10小时前
回复
5.6是这样的
9小时前
回复
回复 @海淀黄庄 gpt6干活确实平均快了。但是喜欢写测试的毛病还是在
9小时前
回复
在估计工作量的时候,它会先给出人类工作时间的评估,在你要求它给出AI实际工作耗时后,它就会给出墙时间估计
6小时前
1回复