模型审查自身代码的能力更差:关于 GPT 与 Claude 的代码审查对比实验
Greptile 研究员通过 1000 个 PR 的一手实验发现,Claude 和 GPT 在审查自家模型生成的代码时,召回率显著低于审查对方模型的代码。深入分析指出,这源于模型不同的思维路径:GPT 倾向于深度验证导致遗漏,而 Claude 倾向于广度覆盖产生噪音。基于此,团队提出了“模型反转(Model Inversion)”策略,即让不同厂商的模型互相审查代码,从而利用各自的盲区互补提升 Bug 检出率。文章揭示了当前大模型对齐训练与工程实用性之间的张力。