如何降低 AI 独立对抗审核环节的成本?
缺失
我曾经特别喜欢看《编辑部的故事》里面《水淹七军》一集。简单来说,就是萝卜大丰收,编辑们想找一位做萝卜菜特别拿手的老师傅教大家如何做一道萝卜名菜「水淹七军」。对方百般推脱,直到因为编辑搞来的错误菜谱导致读者们群体食物中毒,才不得不实话实说。
原来「水淹七军」里,萝卜只是点缀。这是一道富贵菜,主体全都是肉食。所以在当时经济环境下,很少有人吃得起,因此教这个菜谱,颇有「何不食肉糜」的味道,所以不愿意传授。
提到这个事儿,是因为我之前讲过 用 Claude Code 作为主 Agent 产生调研内容,然后用 Codex 上的 GPT 模型做对抗式检查,也被一些读者认为,颇有「何不食肉糜」的味道。
在他们看来,这个方法固然可以提升产出内容质量,有很高的自动化程度,但问题在于,单单是 Claude Code 和 Codex 的订阅,就很贵。两边各开 $100 的订阅,加起来一个月大约 1450 块人民币。更何况,不少单位对账号怎么开、走哪家服务、什么材料能传出去,都有自己的规定,这两家并不总能过关。
有人开了国产的 Coding Plan,也心疼每月那一百来块。
这个暑期,在中山大学图书馆我讲授的工作坊里,这个问题显得特别突出。
一开始,我只是自然而然地把「对抗式审查」作为其中的一个模块。直到授课的前一天,我才突然想到:
糟了,这玩意儿明天大伙儿怎么练呢?
简要说一下,我让所有参加工作坊的学员,都安装了 WorkBuddy。几天课程下来,大家对这个环境都熟悉了。但是如果突然要求大家去安装一个终端里的新 Harness(承载模型、替你调用各种工具的运行框架,例如 OpenCode、Pi 或者 Kimi Code),而且还需要配置相应的订阅(哪怕只是 Kimi 或者 Z.ai 智谱的 Coding Plan),恐怕会让很多学员感到迷茫。
可是原本我做好的 Codex-verify Skill,就是在这样的环境下,才能运行的啊。这可咋办?
只剩一个晚上,手头儿从 WorkBuddy 里的演示练习环境,到能在 WorkBuddy 直接导入运行的 Skill,一概没有,明天难道要摆空城计不成?
当然,我第二天没有摆空城计。大伙儿顺顺当当完成了测试,并且还尝试融合之前的技能,做了带对抗审核和全文获取功能的文献综述 Skill,之后进行了测试。
那我是怎么做到的呢?
这篇文章,咱们就来聊聊这个看似平常,但实则惊心动魄的晚上,我尝试过的操作。文末我也会把这个可以直接在 WorkBuddy 运行的低成本对抗式审核 Skill,完整分享给你。
模型
首先是模型的选择。
既然我们不打算使用订阅了,那么哪个模型更适合非订阅情况下使用呢?
我立即就想到了 DeepSeek V4。对,它涨价了。但即便涨价,相对于 Claude Code 和 Codex 订阅,性价比仍然不错。价格截至 2026 年 8 月 31 日以官方 计价页 为准,你用的时候再看一眼最新价。尤其是 V4 Flash 模型,口碑相当棒。
不过,我之前也说过,干活儿的模型和负责挑刺的模型,最好不是一家的。同一家训出来的两个模型,容易在同一个地方犯同一种错,互相看不出毛病。那么,如果让 DeepSeek V4 做审核,WorkBuddy 这边的模型该选哪个呢?
这其实还好,因为当时 混元 3 在免费期。而在我写作本文时,混元 4 模型也免费可用。
这样几个角色就分清楚了:课堂上干活儿的生成端是混元,当时用 3,我写这篇时是 4,都免费;负责挑刺的审核端是 DeepSeek V4;下面做横评时统一用它的 Pro 版当基准;等技能定稿交给学员日常用,默认切成更便宜的 Flash。后面我就按生成端、审核端、横评基准这几个叫法来说。
模型有了,下面咱们来筛选 Harness。
框架
在 WorkBuddy 里面调用其他模型来做审核,我首先排除了 Claude Code、Codex 和 Antigravity 这几个。倒不是它们不好用,而是这次课堂在账号、经费和材料外传上有约束,它们过不了这一关。
于是我让 Codex 把候选一个个装起来试:OpenCode、DeepSeek Harness、Pi Agent、Kimi Code 和 ZCode,一共五个。为了让比较尽量公平,横评锁定了四个条件:统一使用当时的 DeepSeek V4 Pro 模型;读取同一份冻结短材料;执行同一套审查要求与输出合同,也就是机器能直接读的固定回答格式;各个候选独立运行。
下图因为语音输入的关系,Pi Agent 被识别为 PyAgent,请忽略即可。下同。
这是对比的结果:
具体来说,对比中遇到了这样的问题:
ZCode 3.8.1 那一晚只做了人工探索,没有验证出可靠的无头自动入口,因此没有硬塞进这张自动横评表。它的图形界面很友好,但测试中发现自定义配置会把密钥写进普通文件,测完我让 Codex 专门把那个密钥清掉了。
Pi Agent 找出的问题最全,人工比对覆盖了 18/18 项,但那一次在干净系统冷安装 0.12.0 时,连查看帮助都会因为缺少依赖报错。这只是那一晚冷安装那一次的记录,后来的版本修没修好,你装之前自己看一眼官方页。
Kimi Code 的回答内容在人眼里很清晰,却因为多带了一截前缀,导致机器无法直接解析。
DeepSeek Harness 的内容能力很扎实,用时 57.9 秒,但跨轮格式稳定性不够。截至 2026 年 8 月 31 日,官方仓库仍把它标记为 Developer Preview,也就是还在开发者预览阶段,官方自己就提示后面的版本可能不兼容。没验证过跨版本稳不稳,我不敢让它当全班唯一的安装路径。
先把口径说清楚:上面那张表比的是同一份材料、同一套要求下的一次审查任务,四个条件是统一的;至于装不装得上、密钥落不落盘、格式跨轮稳不稳,是各个候选在我这台机器上实际碰到的障碍记录,不是等量测试。这些数字也都是那一晚一次实验的结果,不是这些工具的通用性能。
所以我最后选 OpenCode 当默认入口,标准是课堂上能不能顺利部署,不是它最聪明:用时 49.1 秒最快,输出精炼,跨轮格式稳定通过,覆盖了 17/18 项预埋问题。
你会发现结果表格里还多了一个 Direct API。这是我留出来的备用线路:万一 OpenCode 装不上,学员的 WorkBuddy 可以跳过它,直接调 DeepSeek 的接口把检验结果取回来。但是你要注意,它只能算是后备方案。
这里得把两件事分开说,后面我也一直按这两个说法用。一件叫内部逻辑审查,就是只读你交上去的材料,看前后有没有自相矛盾、结论有没有跳步;另一件叫外部事实核查,得能联网、能取到原文,才谈得上某个说法在外面站不站得住。你调用的模型本身没有独立联网搜索能力时,它做的只是第一件,不能宣称已经核实了外部事实。
反复测过之后,我让 Codex 把这个 Skill 的流程固定下来。先由 OpenCode 执行;一旦它成功返回格式正确的结果,整个审核立即停止。只有在 OpenCode 运行失败、超时或者输出机器读不了的时候,才落到 Direct API 这条备用线上。如果两条路都失败,流程就明确阻断,绝不假装审核通过。
默认模型也从横评阶段的 V4 Pro 改为日常成本更低的 V4 Flash,遇到极重要任务时再显式切回 Pro。
那这到底能省多少?既然不打算用订阅了,咱们就拿 API 跟 API 比。DeepSeek V4 Flash 的价格是每百万 token 输入 1.5 元、输出 4.5 元(空闲时段;高峰时段翻倍,输入 3 元、输出 9 元)。Claude Code 背后的 Claude Opus 5,API 价目是每百万 token 输入 5 美元、输出 25 美元;Codex 背后的 GPT-5.6 Sol,输入 4 美元、输出 20 美元。同样一篇稿子,审核端的花费差着二三十倍。我自己实测审一篇长文,用 V4 Flash 花了两块多;换成上面两家,得几十块。
交付
这一路的横评、反复安装、一遍遍复验,加起来是不小的工作量。
学员看到的,却只是一个分享的 Skill。只需在熟悉的 WorkBuddy 里导入一个包,日常任务里就多了一位独立的审核员:这一次能不能联网取到原文,决定它做的是内部逻辑审查,还是能一路做到外部事实核查。
审核能力终于进入了原来的工作流程。他只需提出任务、查看裁决,在真正需要人拍板时作决定。
当天上午我把技能发给二十多位学员,布置了三步上手顺序。
那天在我的鼓励下,每个人都申请了一个 DeepSeek 的 API 账号;充值按建议是 10 元,也有人只充了 5 元先试试。至于往里喂什么:除了公开发布的文件,图书馆和学校的其他数据都是不让外传的。所以大家试验用的基本都是虚拟数据,或者本来就主动公开、不敏感的内容,例如图书馆的用户手册。换成国产模型、走 Direct API、不把 key 贴进对话,都是在把风险压低。
第一步,测连通。新开一个对话,先问它一句:「你现在能正常调用 DeepSeek V4 Flash 来做审核吗?」让它把依赖装利索、把 API 跑通。别急着派真任务。你不确认审核员在线,后面跑出来的结果就跟没有审核员一样,你还以为它审过了,其实它压根没审。
第二步,安全纪律。不要把你的 API key 直接贴给 AI,告诉它你的 key 存在哪个文件里,让它自己去读取。API key 是你的钱袋子,直接贴在对话里,万一对话记录被缓存、被同步、被你自己不小心截图发出去,那就是把钱袋子敞开口摆在大街上。
但话得说全。让它自己去读文件,只是躲开了粘贴和截图这两条泄露路径;key 该进的进程还是要进,该落进日志的还是会落,不等于它被隔在外头。所以更稳妥的做法是给课堂单独申请一把额度很小的 key,设好消费上限,课上完就作废,真出事也就漏这么多。
第三步,新开对话跑真任务。前两步通了,再正式跑调研主题。生成端用你选的模型往前推,到审核环节切到 DeepSeek V4 Flash 独立检验。
练习内容很直接:用加了独立审核的新版本,重跑前一天做过的同一个调研主题,看质量差别。
怎么算跑完了?输出目录里得同时有 review-report.md 和 review-result.json,报告开头有一块独立性声明,总结论只会是三种之一:通过、有保留通过、不通过。看到「有保留通过」,多半是这一次没拿到联网回源的记录,它只做了材料内部的一致性审核,别把它当成外部事实已经核实。要是它回你一句「整体没问题」却拿不出这两个文件,那就是没审完,重跑一遍。
学员的成果和感想,都交进了共享的提交表格,一共二十多条。翻下来,越翻越有意思。
有一位学员报告,技能优化后,用全文信息做核查,独立对抗式 AI 核查出了 5 处仅通过标题和摘要根本发现不了的事实性错误,经人工检查,全部属实。注意这 5 处是核查标记出来之后、由人工确认的,不是机器自动修复的。核查这一环的职责是「找到问题」,修不修、怎么修,还是人来定。
助手
看到这里,你大概能想象这里头有多少工作量了。
王老师,你做了那么多测试,还把最终的技能文件和分享文档都准备好…… 这一宿是不是干脆没睡啊?
好问题,但是实际上没有那么悲惨。我那天晚上睡得很好。