调用 WorkBuddy 科研专家团写论文,如何把操作和演示制作自动化?

托付

2026 年 8 月,我在中山大学图书馆猫头鹰工作坊,带着学员们做 AI 文献综述。

做完了自己的 Skill 演示,我又给大伙儿展示了得到大脑专家版写作团队的效果。看得大伙儿跃跃欲试。不过不少人听了一下价格(每年 2999 元),就决定忍了。

这时候有学员提出,在 WorkBuddy 专家团里面浏览,发现了一个类似的功能「科研专家团」。

看起来也是多个 Agent 配合,那它能不能平替得到大脑专家版呢?

于是我鼓励大家课后测试一下。第二天大家纷纷反馈结果,表示似乎这个工具不大适合做文献综述。

因为明明给的要求是综述某几个方向的文献,它却非得要列公式、做图表,搞得不伦不类。

为什么?

因为这个「科研专家团」不是用来写文献综述的,而是更适合进行实证研究,尤其是数据驱动类的。

为了测试在它适合干的领域,「科研专家团」究竟能做啥,我决定找一个现成的公开数据集来试一试。

数据本身不用太复杂,但得有据可查、字段规整。于是我让 ChatGPT 帮我找个合适的数据。

它很快选了帕尔默群岛企鹅数据集 penguins.csv

如果好奇原始数据长什么样,你可以去 Palmer Penguins 数据主页 看看。

企鹅本身并不是重点,反正这也不是我的研究领域。咱们只是要看看,「科研专家团」能用它做出啥来。

在 WorkBuddy 的二级菜单里找到「科研专家团」,进入对应的功能入口并唤出团队交互窗口。

咱们把数据文件直接作为附件挂载上去,并且附上完整的中文任务指令:

请基于附件 penguins.csv 完成真实数据分析,并撰写一篇完整中文学术论文,约 6000–8000 字,必须包含:摘要、引言、方法、结果、讨论。数字与口径须来自本次计算,禁止编造。完成后请交付终稿全文,并做稳健性审核与查验,给出审核结论。正文必须充分展开,不能用大纲、摘要或进度报告代替终稿。

任务正式提交之后,研究总编排(也就是下文说的主理人)就开始了思考。

派工

如果你常用各种对话式大模型,大概习惯了那种一敲回车就劈里啪啦往外吐字的节奏。很多人可能以为,专家团既然接了这么大的任务,怎么也得先列个提纲给我过目吧?

结果并不是。

界面上先是弹出了主理人的一句回应,表示已经收到附件,正在查看数据并组建对应的执行团队。紧接着,屏幕上刷出来的第一个可见工作状态,既不是引言,也不是目录框架,而是一张清清楚楚的派工单与任务依赖队列。

主理人在后台把整篇论文的产出拆成了四个环环相扣的阶段,而且明确锁定了先后顺序。排在最前头的是数据准备,后续的建模、复核和长文撰写全部处于等待状态。主理人在进度信息里给出了一句明确交代:

数据工程师「洗澄明」已开始执行 Task #1(数据清洗与描述统计)。待其回传后,我将把产出转交计量建模阶段。

先由数据工程师处理并生成清洗后的数据文件,后续的计量建模与长文撰写再接着使用这些实际写出的文件,形成清晰可见的接力关系。

负责数据工程的「洗澄明」率先开工,其他几位专家各就各位、按兵不动。这种把依赖关系明确摊在台面上的派工方式,给人的第一印象不再是一个随口乱编故事的聊天框,而是一个真正准备干活的项目小组。

只不过,「洗澄明」这种命名方式,我好像在哪儿见过来着?🤔

审计

「洗澄明」在后台忙碌了一阵子,随后向主理人回传了第一批处理成果,是一整套实实在在的文件。

这套产出包括清洗之后的独立数据表格、完整的样本处理日志、描述统计表、基础图件以及跑这套处理的完整脚本。下游成员拿到的不是他的嘴上汇报,而是磁盘上实实在在的文件路径。

主理人拿到这些产出后,立刻打包推进到第二个环节,把清洗后的文件路径、样本诊断与建模指令派发给了负责计量建模的「顾因果」。

「顾因果」接手后开始读取数据并构建模型。更有意思的细节发生在制图阶段。当他跑完代码并生成第一版可视化图表时,系统并没有直接把图甩给下游就草草了事。「顾因果」在核对图形时发现了一个视觉布局问题:

图基本正常,但 Gentoo 体重差异点(约 +37%)可能被右侧图例遮挡或贴近边缘,我调整一下 x 轴范围和图例位置后重跑。

你看,他自己注意到右侧图例有可能会压到图中的关键数据点,于是主动调整了横坐标轴的显示范围,挪动了图例位置,重新跑了一次脚本。等图表确认完整无遮挡之后,才将整套建模系数与图形结果回传给主理人。

紧接着出场的是负责质量审计的「严复核」。很多时候我们总以为,所谓复核大概就是看一眼格式对不对、公式有没有漏写。但「严复核」的动作要扎实得多,他把「洗澄明」最初清洗好的数据重新读取了一遍,自己独立做了一遍计算与比对。

这一比对,果然抓出了一个跨阶段的口径偏差。「严复核」向主理人提交了一处关键的审计提醒:

一处口径提醒:team-lead 任务书中 "排除 11 条 sex 缺失" 应为 9 条(清洗后样本口径)

原始的企鹅数据表里确实有 11 条缺失性别的记录;但在前一步「洗澄明」进行数据清洗时,有两只企鹅因为身体尺寸的其他关键测量值缺失,早就已经被剔除出去了。也就是说,在当前清洗后的样本盘子里,性别缺失实际上只剩下 9 条。

可是主理人在向下传达的任务简报里,却依然沿用了最初那份未经清洗的原始旧口径,写成了 11 条。名单变了,账目却还拿着旧底单。「严复核」在这一步及时指出了口径偏差,主理人迅速核准了这条勘误,并在后续的任务书中正式纠正为 9 条。这种不同工序负责人之间的核查与碰撞,才是多角色协同最该体现出来的价值。

核验

前面几位把数据洗清了、模型跑通了、审计也把漏洞揪出来了,接下来该轮到学术写作专家「文锦成」出场了。

「文锦成」拿到主理人整理好的写作任务简报、数据结果表格以及审核结论。按照一般的想法,负责文笔的成员大概率会直接顺着简报内容铺陈开写。但「文锦成」做的事情恰恰相反,他第一步没有动笔写正文,而是先打开了底层的计算结果文件,把简报里的关键结论逐项做了比对。

这一对照,「文锦成」反过来抓住了主理人简报里的严重数字错位。简报摘要里列出的一串数字与底层的计算结果对不上,他并没有盲目采纳,而是直接回查原表,向主理人回报:

我将以计算结果文件(table2b_all_traits.csv)为准,并在交付时向 team-lead 说明。

这几处偏差其实在上游建模阶段回传的消息里就已经错位了,主理人起草简报时顺着带了过来。下游负责文字输出的成员,并没有因为简报来自主理人就照单全收,而是回溯到最底层的 CSV 文件进行核验。发现矛盾后,他果断以实际计算出来的表格文件为准,并向主理人说明了情况。

确认好数字依据之后,「文锦成」开始组织长文写作。第一轮正文全部写完并落盘保存后,字数统计显示为 5926 字。

由于我最初设定的硬性要求是六千到八千字,「文锦成」在审视自己的产出时非常清醒:

正文 5926 字,略低于 6000 字下限,需要扩充实质内容。分几处补充:

面对 5926 字与 6000 字下限的差距,「文锦成」没有选择敷衍交卷,而是按照可见的规划分几处补充实质内容,并在随后的操作中逐步落实扩充,回查确保修改到位。

在这一轮扩写过程中,还发生了一个非常典型的技术插曲。「文锦成」对同一个正在编辑的文件进行了多处并行修改,结果在保存和合流时遇到了写冲突,导致其中有 4 处修改在第一遍并没有成功合入文件。

「文锦成」在自查全文时敏锐地捕捉到了这一点:

发现并行编辑导致 4 处修改丢失(同文件并行 Edit 竞争)。现逐个串行重新应用:

这属于同一份文档在多处并行编辑时出现的写入竞争与覆盖。「文锦成」随即改为串行方式逐处重新应用,把先前丢失的 4 处修改重新补入文档中。重新核对无误后,首份完整成稿的字数定格在 7005 字。

纠偏

7005 字的首稿交付出来,有图有表,结构齐整。但初稿出来之后,事情并没有到此结束。

随后我反馈给团队的修改要求里,列出了七项需要精细校正的具体问题。这些问题主要针对文稿中的局部细节,例如在某些段落里将表格记录条数误称为独立的方法数量,或是部分结论语句表述偏强,需要结合实际统计显著性适当收敛。

面对这样一份挑剔的外部反馈,主理人并没有手忙脚乱地推翻重来,也没有盲目指挥所有人把数据重新洗一遍。在快速核实了反馈中指出的关键问题后,主理人给出了明确的调度安排:

再把修订规格下发给学术写作专家执行,最后以磁盘全文复查交付。

他没有另起炉灶,而是直接把这套定点修改的具体要求,派发回已经完全拥有上下文的写作专家「文锦成」。

这体现了一种务实高效的任务策略:尽可能保留前序阶段已经生成的可用数据表、模型结果与图件,只针对被指出的具体文稿位置做定向修订,而不盲目重跑那些与修改点无关的计算步骤。

「文锦成」收到任务后同样条理清晰:

收到修订任务。先建立任务并核对 table3 行数与 spec 标签数,然后通读全文再逐条修订。

他按顺序串行处理了这七项修改,把每一处涉及口径、用词和引用的段落做了修补,并重新通读扫描全文以确保没有遗留冲突。

在这之后,文稿又经历了几处针对现稿的定点修正。而最后收到的图注修改反馈指出,图 2 描述把多性状模型误写成了多规范(模型设定),主理人便直接对图注涉及的那句话完成了文本替换,依然没有去触碰不受影响的其他章节。

最终交付在磁盘上的学术论文完整定格在 7627 字。

整篇文章从摘要、引言、数据预处理、计量模型回归,一直到稳健性检验与讨论,各主要章节结构完整,内嵌规范的正文、数据表格与可视化图件。

而各阶段执行的计算脚本与原始数据结果,则整整齐齐地留存在项目目录中,随时可供回查与复现。

委托

看到这里,你大概能够看明白整个专家团收到任务后的运作方式了。从一份完全公开的原始 CSV 开始,主理人拆解依赖,数据工程清洗留痕,计量专家算图调轴,质量审计回查抓虫,文字作者核查底表并扩充字数,最后在面对外部反馈时定点修补再交付。

整个儿操作过程,我做成了视频,你可以打开这个链接查看

看完之后,相信你已经知道专家团究竟能帮你做什么,也知道怎么在它们跑偏时给出一针见血的要求了。

但是,我猜你心里大概正盘算着另一个更大的疑问:

从最初在电脑上打开这个软件、准确输入整段中文任务并挂上附件,到中途面对漫长等待中的计算、审计与长文修改,再到最后把这长达几十个步骤的操作现场,连同软件界面、鼠标轨迹、高亮聚焦,剪辑配音做成一部三分多钟流畅生动的演示视频,这整套操作与演示究竟是怎样一步步做完的?难道每一步都需要人亲自搬个小板凳坐在屏幕前面寸步不离吗?

如果真要这样全程人工肉眼盯守,那效率其实并没有高到哪儿去。

下面我来给你讲讲,我实际是怎么做的。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论