Greptile

Greptile,理解整个代码库的 AI 代码审查工具,自动审查 PR、捕获缺陷并通过深度分析提升代码质量。

模型审查自身代码的能力更差:关于 GPT 与 Claude 的代码审查对比实验

Greptile 研究员通过 1000 个 PR 的一手实验发现,Claude 和 GPT 在审查自家模型生成的代码时,召回率显著低于审查对方模型的代码。深入分析指出,这源于模型不同的思维路径:GPT 倾向于深度验证导致遗漏,而 Claude 倾向于广度覆盖产生噪音。基于此,团队提出了“模型反转(Model Inversion)”策略,即让不同厂商的模型互相审查代码,从而利用各自的盲区互补提升 Bug 检出率。文章揭示了当前大模型对齐训练与工程实用性之间的张力。
评论点赞收藏25 天前

TREX:一个能实际运行代码的AI审查员

Greptile工程师介绍其新工具TREX,核心创新在于AI不仅静态审查代码,还会在沙箱中实际运行代码以发现逻辑错误和UI回归问题。文章详细阐述了从独立Agent到多Agent编排架构的演进,强调通过截图、日志、视频等多模态证据确保结果可信。此外,介绍了模型无关的灵活架构和基于快照的沙箱执行环境,旨在提供比传统静态分析更准确的代码验证。
评论点赞收藏59 天前

AI 生成的“垃圾代码”未必是未来

Greptile 认为 AI 生成的代码不会全是低质量的 Slop,因为经济激励会迫使模型生成更简单、易维护的代码以降低 Token 成本。尽管当前软件复杂度上升且故障率增加,但长期来看,市场竞争将推动 AI 编码工具向高质量代码发展。
评论点赞收藏137 天前

AI 代码审查领域的泡沫与未来:为何独立审查至关重要

Greptile 认为当前 AI 代码审查领域存在泡沫,大量竞品涌现。文章核心观点是代码生成与代码审查必须分离,审查方应保持独立以避免利益冲突。作者主张代码验证最终将完全自动化,人类只需表达意图,无需参与繁琐的审查流程。作为工具厂商,他们选择构建后台自动化管道而非人机交互界面,并强调这一决策对企业的长期价值。
评论点赞收藏201 天前

GitHub对象为何拥有两套ID系统?一位工程师的逆向工程实录

作者开发代码审查工具时遇到GitHub链接失效问题,发现GitHub同时维护两套ID系统:旧的字符串格式和新的Base64编码格式。通过逆向工程分析,作者发现新ID实际上是MessagePack序列化的数组,包含版本号和数据库ID。更有趣的是,旧格式的底层整数中隐藏了数据库ID,可以通过位运算直接提取。文章展示了如何从复杂的API响应中挖掘数据结构,并解释了GitHub新旧ID系统的兼容逻辑。
评论点赞收藏214 天前

2025年AI编程现状报告:产出倍增、生态变局与长上下文新范式

Greptile发布的2025年AI编程报告,结合内部数据与最新论文综述。核心发现:1. AI作为倍增器显著提升开发者产出,PR规模变大且代码更密集。2. 开源生态格局变化:Anthropic SDK增速迅猛,缩小了与OpenAI的差距;LiteLLM在LLMOps领域超越LangSmith。3. 前沿技术趋势:长上下文处理从单纯扩大窗口转向递归记忆、向量量化和检索增强(如TurboQuant、Recursive LLMs、RetroLM);Agent架构从单体模型转向多智能体协作与自我编辑搜索(如Kimi K2.5、Chroma Context-1)。4. 训练方法创新:强化学习与反射性提示优化(GEPA)成为提升Agent性能的关键。
评论点赞收藏241 天前

在内核层面为 AI 智能体构建沙箱

作者来自 Greptile,指出让 AI Agent 直接访问主机文件系统存在严重安全风险,应用层的 Prompt 防御不可靠,必须依赖内核级隔离。文章深入 Linux 内核源码,从 open 系统调用的三个失败点(权限检查、路径遍历中的挂载重定向、根目录初始化)出发,解释了 chmod、mount masking 和 chroot 如何隐藏文件。最终论证了容器技术(如 Docker/Podman)的核心原理就是结合命名空间(mount namespace)和根目录切换(pivot_root/chroot),在内核层面强制隔离进程视野。作者团队因此使用无根 Podman 容器来运行 Agent,确保其无法访问宿主机敏感数据。
评论点赞收藏320 天前

Greptile创始人回应争议:我们为何坚持高强度创业文化

Greptile联合创始人Daksh回应公司因“不提供工作生活平衡”引发的网络争议。他澄清并未强迫员工加班,而是通过高薪酬、股权和透明文化筛选出渴望高强度创业环境的顶尖人才。文章核心观点是:在赢家通吃的AI编程领域,必须通过极致努力获胜;公司公开谈论高压文化是为了让不适合的人自我淘汰,从而吸引真正认同“高回报伴随高投入”理念的候选人。
评论点赞收藏339 天前

为什么Greptile只做代码审查而不生成代码

Greptile联合创始人通过安然审计丑闻类比,阐述为何AI代码审查工具必须与代码生成工具保持独立。作者认为,若同一公司既做生成又做审查,会产生利益冲突和偏见,导致审查失效。文章指出AI生成代码存在特有bug模式,需要独立的对抗性审查机制来保证软件质量,强调独立性对于建立信任至关重要。
评论点赞收藏376 天前

AI代码审查:作者是否应该担任审查者?

Greptile联合创始人通过数据分析发现AI机器人Devin提交的PR数量超过任何人类开发者,进而探讨“AI是否应该审查自己生成的代码”。作者认为虽然LLM是无状态的,看似拥有“新鲜视角”,且审查流程(Scaffolding)与生成流程不同,但核心问题在于:1. AI降低了优秀工程师的代码质量,因为提示词有损耗且人类审查速度跟不上生成速度;2. AI引入的bug类型是人类不擅长发现的,而人类PR审查本身效率低下。文章引用内部测试数据证明AI在找bug上优于人类,最终得出结论支持使用独立AI进行代码审查。
评论点赞收藏471 天前

软件的内容化:AI如何催生垂直细分软件创业潮

作者认为AI将大幅降低软件开发成本,导致软件行业出现“内容化”趋势。类比视频行业从好莱坞大片转向YouTube长尾内容,未来将出现大量小而美的垂直软件公司,服务于被大厂忽视的细分 niche 市场。虽然大厂仍存在,但软件的选择多样性和针对性将极大丰富。
评论点赞收藏513 天前

PR 越大合并越快?一项基于 2.4 万条数据的实证分析

作者基于 Greptile 对约 2.4 万个合并 PR 的数据分析,发现 PR 越大(文件数或代码行数越多),合并速度反而越快。原因包括大 PR 容易因冲突产生紧迫感、可能阻塞他人工作、以及审查者容易对大 PR 产生“疲劳”而减少评论。此外,数据还显示团队规模与 PR 大小呈正相关,大团队往往产生更大的 PR,且人均周提交量随团队扩大而下降。文章提供了具体的统计分布和几种可能的解释,适合对软件工程效率和团队协作感兴趣的开发者阅读。
评论点赞收藏579 天前

如何让大模型闭嘴:减少 AI 代码审查噪音的实战经验

文章分享了 Greptile 团队在优化 AI 代码审查工具时的实战经验。最初 LLM 生成的评论噪音太大,开发者往往忽略。作者尝试了提示词工程、少样本学习以及让 LLM 自我评估严重性,但都失败了,因为 LLM 很难区分“有价值的批评”和“无关紧要的细节”。最终,团队采用了一种基于向量嵌入的方法:将历史评论生成向量存入数据库,当新评论与多个被点踩的评论相似时自动过滤。这一方法显著提高了评论的有效采纳率,从 19% 提升至 55% 以上。核心观点是,对于主观性强的噪音过滤,基于用户反馈数据的向量相似度匹配比让 LLM 直接判断更有效。
评论点赞收藏604 天前

将工程团队拆分为“防御”与“进攻”两组

Greptile 联合创始人分享其4人工程团队的管理实践。针对小团队既要处理客户支持(防御性工作)又要开发新功能(进攻性工作)的冲突,他们采用轮换制:一半工程师专注长期项目,另一半隔离干扰处理紧急事务,定期轮换。作者认为隔离干扰能显著提升开发者心流和生产力,并将此模式总结为“攻防分离”。这是一篇基于真实创业场景的一手经验分享,观点清晰且具有实操参考价值。
评论点赞收藏670 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。