Superpowers 6:利用 AI 优化 AI 开发流程

您也可以在我们的企业博客上阅读这篇帖子:primeradiant.com/blog

简而言之:Superpowers 6 的运行速度要快得多、也更高效,且在实现同样高质量成果时,所需的代币数量要少得多。 如果你正专注于最大化代币使用效率,或许可以跳过这次更新; 但如果你在意自己的构建速度能提升高达 50%,成本还能降低至多 60%,那么你一定会爱上 Superpowers 6。

就在一周前,我们正全力筹备发布 Superpowers 5.2 版本。此前我们已经多次推迟发布,只为了“再做一项小小的改进”。

我们新增了对 Pi、Antigravity 和 Kimi Code 的支持。

我们让 Superpowers 在 Codex 和 OpenCode 以及 Cursor 上的表现更加出色。

我们重新编写了大量 Superpowers 技能,使其具备模型驱动与工具驱动的通用性,从而让这些技能在各个环境中都更加可靠。 此外,我们还撰写了一份全新的贡献指南,详细介绍了如何为 Superpowers 添加新的编码代理支持。

我们投入大量精力,让视觉头脑风暴功能更易用、更安全、也更可靠。

我们还修复了大量漏洞,其中有一个尤为棘手的问题:有时会导致代码审查子代理在审查整个分支,而非单个任务。

原本这将是一次非常棒的发布。

然而,Anthropic 最终发布了(也未正式发布)Fable。在我仅能接触到 Fable 的短短几天里,我尽自己所能将其发挥到了极致。

众所周知,Superpowers 用户最常抱怨的一点是:代币成本高昂,而 Superpowers 的使用量巨大。使用 Superpowers 构建软件的速度,甚至比不使用它还要慢。 不过,“慢”的这一部分其实并不重要——因为构建过程中的自主子代理驱动开发流程, 往往会在这一阶段发生。

但“慢”确实很重要。慢,可一点也不好玩;昂贵,也同样让人提不起兴趣。

Superpowers 构建耗时更长、成本更高的诸多原因,也正是它能为众多用户带来优异成果的原因。 Superpowers 在前期会进行大量的规划工作,确保你的实施能够完全自动化; 在开发过程中,它会严格遵循红绿灯测试法; 而在 Superpowers 内部,编排器会从两个维度对每一次变更进行审核:

1. 代理是否准确实现了要求的功能,不多也不少。

2. 工作的质量是否达到了预期标准。

由于其本身的运作方式,与未经测试的实现简单地“一试就走”相比,Superpowers 的开发过程往往会更缓慢。

然而,它从未让我真正感到“开心”——既因为它的速度慢,又因为它的成本高。

当 Fable 首次发布时,我决定尝试探究它在子代理驱动开发方面究竟有多高效。

我原本以为,它能将代币消耗减少约 15%。

结果,我不仅实现了这一目标,还取得了远超预期的成果。

我们的第一个突破口,是针对协调器与评审员之间的交接环节展开研究。 Fable 分析了数千个子代理驱动开发会话,发现代码和规范合规性评审子代理在执行评审时, 常常会执行大量的 Git 命令。只需将用于查找待评审提交的书面指令,改写为一个预先生成评审包的 Shell 脚本——该脚本包含格式清晰的 diff 以及若干其他元数据——就能将代币消耗和实际运行时间分别缩短约 10%。

当晚即将入睡时,我便对 Fable 说:“等我睡着后,能不能再把我们评估的墙钟时间与代币成本各削减 15%?”

在准备入睡之际,我在内部 Slack 上发了一条消息,建议大家考虑一下:如果将代码评审员与规范合规性评审员结合起来,会带来怎样的效果?

我其实并不清楚自己一夜之间会期待什么,但我不认为自己会想到:醒来时,Fable 已经独立得出了同样的结论,进行了验证,并且在我们的评估套件中,成功节省了我所期望的额外 15%。

blog.fsck.com/assets/2026/06/pasted-image-20260615-200048.png

第二天晚上,我的雄心又大了一点。

Fable 构建了一个完整的自动搜索框架,并在夜间完成了测试。 你可以前往GitHub 查看它所完成的工作。

简而言之,经过大约 36 小时的工作,以及本应耗费的 650 美元未补贴代币支出,我们的 Anthropic 评估基准显示:Superpowers 构建的墙钟运行时间缩短了 50%,代币消耗也降低了 60%。

随后,我们又对 Codex 进行了评估。然而,结果并不理想。我原本担心评估结果可能无法展现出同样的提升幅度,但事实上,评估结果竟然没有出现任何改善。

经过几分钟的深入排查,我们找到了问题的根源:在 Codex 上,评估结果与宿主操作系统尚未完全隔离……因此,我们始终在评估 Superpowers 5.1.0。

稍作调整之后……果然,一切顺利。

blog.fsck.com/assets/2026/06/pasted-image-20260615-195959.png

最大的改进来自于将规范合规性和代码质量评审代理相结合,提前将评审“包”打包好, 交给评审员,这样他们几乎无需再运行 Git 命令;同时,我们还调整了对编排器的指导,明确了在不同任务中,究竟需要哪种类型的代理。

我们一直在努力优化 Superpowers 的评估套件,若没有这套套件,我们根本不可能对所做的改动进行精确的衡量与测试。 这套套件虽然还相对年轻,但正是得益于它,我们得以在多种受支持的框架中对 Superpowers 进行各种改动,并量化这些改动在不断扩大的编码代理群体中的实际效果。 您可以通过以下链接查看:github.com/prime-radiant-inc/superpowers-evals

我们为 Superpowers 6 所取得的改进感到无比自豪——无论是我们自己,还是我们的机器人伙伴们。我们相信,您一定会喜欢这个新版本。

您现在就可以从 github.com/obra/superpowers 安装它。在未来几天内,它将逐步进入首批第三方插件市场。

PS:我们正在招聘!如果您认识任何应该全职参与 Superpowers 工作的人,请将这条招聘信息分享给他们:primeradiant.com/jobs/superpowers-community-engineer

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论