不写一行代码,怎么搭出一个每天自动盯文献的科研雷达?

缘起

前段时间,一位做智慧农业节水灌溉研究的朋友找到我,倒了一肚子苦水。

他想实时盯紧领域里的 4 个前沿方向:节水灌溉技术、灌溉决策建议模型、肥料利用率影响因素、作物表型应用,外加 5 本核心期刊和 3 位顶尖学者。可这些文献散落在各个数据库和期刊官网上。靠人工去翻,别说每天刷一遍,就是每周雷打不动过一次,也得搭进去大半天时间,累得眼冒金星。

你或许也有过类似经历。不管是做课题开题、写文献综述,还是在图书馆做学科情报服务,「盯文献」都是绕不开的基本功,却常常沦为最折磨人的机械劳动。隔三差五把同样的关键词敲一遍,再一条条人肉过筛。

市面上现成的商业情报平台功能虽好,但按年收费的昂贵价格对个人或初创小团队实在不够友好;而提到自己动手搭一个,大多数人的第一反应往往是:「我又不是计算机专业的,代码都不会写,怎么可能?」

于是,这件事往往就卡在了愿望和现实的夹缝里。

我帮这位朋友搭了一套低成本的自动化监测系统。从今年春末起步,到 8 月 20 日,这个系统已经默默收录了 5200 多篇论文,其中近五千篇由 AI 逐篇提炼成了中文摘要卡片,还配上了带知识图谱和趋势预警的可视化看板,每天清晨准时更新。

最近我在给中山大学图书馆的馆员们做工作坊。课前问卷一收上来,大家最迫切想要的恰好就是这个形态:持续积累论文、可视化看板、深度数据分析。在随后的现场教学与练习实操中,大家不仅跑通了原型,更碰撞出了许多意想不到的实战经验与反思。

今天,咱们就把这套系统的构建逻辑、踩坑教训、进阶演化以及我为你封装好的开箱即用工具完整拆解开来。

门槛

很多朋友一听自动化文献追踪,脑子里立刻浮现出爬虫框架、向量数据库、分布式调度等一堆让人头皮发麻的技术术语。

如果放在几年前,这确实是一道难以逾越的高墙。但到了大模型时代,真正的门槛早已挪了位置:难的不是「做出来」,而是「说清楚你要盯什么」

我和朋友花在梳理「关注面」上的精力,远比搭建系统本身要多得多。哪 4 个细分方向?跟踪哪 5 本期刊?盯哪 3 位学者?这些专业判断,只有真正沉浸在领域里的专家才给得出来。把这些想透彻之后,它们被写进一个简单的配置文件,就成了整个系统的「大脑皮层」。

至于底层的技术支撑,说出来你可能都觉得不可思议:免费的学术数据接口、一个单文件数据库、一个被当成函数调用的大模型、一堆静态网页,再加一个定时执行的闹钟。

没有租用昂贵的服务器,也没有复杂的分布式架构。五个平平无奇的常用小件拼装在一起,就组装成了一台每天全自动运转的科研雷达。

积累

搭建雷达的第一步,是要解决底层源头问题:论文从哪里抓,抓回来存到哪。

数据源方面,我们选了 OpenAlex 作为主力。它是一个开放、免费的学术元数据平台,不仅覆盖面极广,而且标题、摘要、作者、引用数等字段都可以通过开放 API 获取。注册一个免费的 API key 就能用,免费额度对个人监测场景绰绰有余。朋友指定的 5 本期刊里有 4 本能在 OpenAlex 中按期刊号直接订阅;4 个研究方向则可以在全库中按检索词实时获取。

剩下的一本中文期刊《智慧农业》,OpenAlex 暂时没有收录,我们通过 DOAJ(开放获取期刊目录)顺利把它补齐了。

可能有人会问:为什么不去爬那些更权威的商业数据库,或者直接爬期刊官网?

答案很实在,合规与稳定性是自动化的生命线。以 Web of Science 的所有者和运营方 Clarivate 为例,其使用条款明确禁止未经许可的程序化抓取;而一些国内期刊官网反爬机制严格,脚本一访问就会触发 403 错误。对于个人和科研团队来说,免费、合规且开放的数据接口,才是能长期安稳运行的最优解。

数据存放在哪里?整个系统只用了一个 SQLite 单文件数据库。

我教了很多年数据库课,一直跟管理类专业的同学们讲:做个人或课题组级别的小型系统,真的不必大费周章去搭复杂的数据库服务。你想想看,手机里不少 App 在本地存数据,用的就是 SQLite。一个单文件数据库,免安装、零配置,拷贝一下就是全量备份,极其皮实。

更关键的是设计原则:抓取环节坚决不碰 AI。抓取就是纯粹的拉取数据、记账入库。让流水线的前端保持足够的简单与纯粹,就算后面的大模型服务偶尔超时或报错,也不会影响前端文献的稳定入库。

处理

当数据源源不断进入数据库后,第二步是让 AI 协助消化。

以往很多人用 AI 读文献,习惯打开网页对话框,把 PDF 或摘要扔进去,一问一答地聊。这种方式适合对重点文献做精读,但面对每天源源不断涌入的新文献,如果还靠人工对话,人和钱包都吃不消。

我们的解法是:把大模型当成一个确定的「处理函数」来调用

所谓函数调用,就是把输入和输出格式彻底定死:输入固定是「论文标题 + 摘要」,输出必须是严格符合规范的 5 字段 JSON 格式,分别提取核心速览(tldr)、关键方法(method)、主要发现(finding)、归属方向(direction)以及延伸机会点(opportunity)。什么时候启动、每天处理多少篇、处理完写回数据库哪个字段,全由代码自动化串联,中间不需要人工介入。

我们在系统里真实使用的提示词模板非常精炼。下面就是原样模板,只把领域词换成了「XX」之类,方便你直接替换成自己的方向:

​
你是 XX 方向的科研助理。下面是一篇论文的标题与摘要。
​
请用简体中文输出严格的 JSON,字段如下:
- tldr: 一句话讲清这篇论文做了什么(不超过 50 字)
- method: 用了什么关键方法 / 数据 / 技术(不超过 40 字)
- finding: 最关键的发现或结论(不超过 50 字)
- direction: 从 [”XX 技术”,”XX 决策建议方法与模型”,”XX 利用率影响因素”,”XX 应用”,”其他”] 中选最贴切的 1 个
- opportunity: 对寻找研究方向有价值的一句话 —— 可延伸的研究空白 / 机会点(不超过 60 字)
只输出 JSON 对象,不要多余文字。
​
标题:{title}
​
摘要:{abstract}
​

每篇论文经过这道流水线清洗,就变成了一张结构清晰的卡片。

模型后端我们接入了智谱的 GLM 系列(近期已经升到订阅套餐支持的最新 5.3 版本)。不过这一层完全不挑模型,你手头订阅了哪家大模型 API,直接接入即可。

除了单篇卡片提炼,系统还会定期把同一方向近期的论文聚合起来,让大模型撰写一段百余字的「趋势速览」:当前研究聚焦在哪些具体子问题?主流方法有何演进?有哪些尚待填补的空白?单篇卡片帮你决定「要不要细读」,趋势速览则帮你建立「宏观态势感知」。

看板

数据处理好了,怎么让它以赏心悦目的方式呈现出来?

看板的演进过程,生动诠释了信息系统开发里的原型思维

我在讲授信息系统开发课程时,常跟学生强调:千万不要上来就闭门造车规划一个庞大复杂的系统,跟用户签了需求就消失半年,等期末交货时用户往往一脸茫然。更稳妥的做法是:先搭出一个最小可用原型(MVP),让数据先跑起来,就着看得见摸得着的东西持续迭代

这个系统的最初版本,其实简陋得很 —— 只有一个按方向分栏的卡片列表。随着数据库里文献数量破千,我们才逐步在看板上生长出 4 个深度分析模块:数据统计概览、包含 42 个节点的关键词共现图谱、近半年快速升温的热点词挖掘,以及 AI 归纳的趋势预警简报。

在技术实现上,看板采用的是纯静态网页方案。流水线每天跑完分析脚本,直接生成嵌好数据的 HTML 文件。这种架构不需要后台服务器常驻监听,极其轻量,也为接下来的零成本部署打下了基础。

部署

本地跑通只是自娱自乐,只有让科研人员随时随地能在手机和电脑上打开,系统才真正产生价值。

很多类似教程往往卡在部署环节:推荐的国外托管平台虽然好用,但在国内直连往往访问困难。我们采取的策略是「一次构建,双轨发布」:

一路推到 Cloudflare Pages,利用其全球 CDN 的稳定分发;另一路发到阿里开源的 魔搭社区(ModelScope)「创空间」,在上面免费创建一个静态空间,把网页文件传上去,就能拿到国内高速直连的公开访问链接。

配合自动化调度工具,每天早上 7 点半定时触发整个管线。抓取新文献、调用大模型、更新图谱看板、双轨推送到托管平台,顺便把当日简报推送到移动端。

咱们算一笔账:数据接口在免费额度内够用,数据库免维护,静态托管零费用,真金白银的开销只剩大模型的日常 Token,而我们这边复用已有订阅,增量为零。真正贵的其实不是钱,是前面梳理关注面花掉的那些时间。不过那件事你只做一次,而商业平台的年费,是年年都要交的。

用下文我分享给你的方法,你也能轻松部署一个自己的文献监测网站。这里有个样例,你可以点击这个链接 或扫描下方二维码查看。

翻车

讲到这里看似顺风顺水,但在两个多月的真实运行中,系统结结实实地给我们上了三课:

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论