OpenAI 重新审计了 SWE-Bench Pro,发现它不再可靠地衡量前沿编码能力
LINUX DO 最新
,Linux.do,新兴的中文高质量技术社区,覆盖 Linux、编程、AI 等话题。
关注
是不是因为 gpt 在 deepSWE 上表现好
添加评论
点赞
收藏
点踩
分享
查看原文
评论
?
参与讨论