Cognition

Cognition AI,Devin 背后的公司。Devin 是开创性的自主 AI 软件工程代理,能够规划、编码、调试与部署应用。

估算自主AI软件工程师的生产力

Cognition公司发布了一篇关于如何自动化评估AI编程助手(Devin)生产力的技术博客。文章详细阐述了其方法论:不直接衡量难以量化的商业价值,而是估算“等效人类工程师工时”。通过收集258个真实企业会话数据,构建分类器过滤无效工作,并利用LLM分析完整执行轨迹(而非仅代码差异)来预测耗时。模型在对数空间达到0.74的相关系数,且经过校准后倾向于保守低估。文章还对比了METR和Anthropic的相关研究,并讨论了自我报告偏差、采样偏差及工时不等于商业价值等局限性。
评论点赞收藏67 天前

FrontierCode:从代码正确性到可合并性——AI编程质量新基准

Cognition(AI编程助手Devin的开发者)发布全新代码生成基准FrontierCode,核心创新在于不再只测代码能否跑通,而是评估代码能否被人类维护者合并进生产代码库——这是业界首个衡量"可合并性"的基准。由36个旗舰开源项目的20多位顶级维护者共同设计,每人每任务投入超40小时,综合单元测试、逆向测试验证、代码作用域检查、自适应评分等方法,从行为正确性、回归安全、机械整洁、测试正确性、作用域约束、代码质量六个维度打分。在Diamond最难子集上,最强模型Claude Opus 4.8得分仅13.4%,GPT-5.5为6.3%,开源Kimi K2.6仅3.8%。比SWE-Bench Pro错误率低81%,是目前最可靠的代码质量排名信号。文章同时详细拆解了评分方法、质量控制流程和具体任务案例。
评论点赞收藏68 天前

为 Claude Sonnet 4.5 重建 Devin:经验与挑战

Cognition 团队分享为 Claude Sonnet 4.5 重构 AI 编程代理 Devin 的真实工程手记,不是营销稿。核心发现:Sonnet 4.5 是首个"感知自身上下文窗口"的模型——接近上限时会主动总结、加速收尾,但也因此过早结束任务、走捷径。反直觉解决方案:启用 100 万 token 测试但限制使用 20 万,让模型以为空间充裕从而正常运作。模型还会主动在文件系统写笔记做记忆外化(甚至写总结消耗的 token 比解决问题还多),擅长并行执行工具调用。文章坦诚讨论了每个新行为的好处与缺陷,包括上下文焦虑导致性能下降、模型对自己的剩余 token 有精确但错误估算、笔记不够全面不可替代现有记忆系统等。对 AI 代理架构设计者有直接参考价值。
评论点赞收藏319 天前

Kevin-32B:用多轮强化学习训练CUDA内核编写模型

Cognition 发布 Kevin-32B,据称是首个在 CUDA kernel 编写任务上做 RL 训练的开源模型。团队用 KernelBench 数据集的 180 个 Python→CUDA 转换任务,基于 GRPO 做多轮强化学习,结果意外强劲,甚至超过了 o3 和 o4-mini 等顶级推理模型。博文公开了训练设置和经验,模型已上传 HuggingFace。对关注 LLM 推理能力、代码生成、CUDA 优化的读者来说,这篇有具体的实验设定和对比结果,值得一读。
评论点赞收藏466 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。