E253|谁在给大模型出题、卖题、判卷?聊聊AI数据行业的野蛮生长

随着AI模型能力提升,训练需求更复杂,一批为模型公司提供训练数据的新公司正在快速增长:AfterQuery今年4月宣布A轮融资时,估值为3亿美元,到了9月,据媒体报道,新一轮融资已经将其估值推至32亿美元。另一家提供训练数据与智能体环境的公司Bespoke Labs,也在今年7月宣布,种子轮与A轮融资合计达到4000万美元。
虽然估值水涨船高,AI数据行业对外界来说却极其不透明。问题来了:这些公司究竟在卖什么?
过去提到数据标注,我们容易想到给图片打标签、给模型回答打分。但随着AI从回答问题走向执行任务,数据公司的交付物也在变化:从专家写出的评分标准,到包含任务、工具和验证机制的强化学习环境。它们需要找到懂行的人,获得真实的行业资料,再把专业知识与工作经验转化成模型能够学习的训练信号。
与此同时,新的AI评测层出不穷。榜单分数提高了,究竟代表哪些能力变强了?针对评测生产数据,什么时候能改善真实用户体验,什么时候又会变成单纯的刷分?对于每天训练模型的研究员来说,他们最需要的数据,到底是什么?
本期节目,我们邀请到在Scale AI负责后训练与评测研究的何允中,以及加州大学伯克利分校博士后、Agents’ Last Exam项目研究者孙一铀,从产业与研究两个视角,拆解这门透明度不高、又变化极快的生意。
我们聊了Scale、Mercor、Surge等数据公司的不同背景,也讨论了小团队在合成环境与垂直领域中的机会。从采购一份游戏源码,到验证专家提交的任务,再到设计让人愿意交出经验的激励机制,好数据的难点,往往藏在榜单之外。
【主播】
Yiwen,硅谷101主持人
【嘉宾】
何允中,Scale AI研究总监(后训练与评估方向)
孙一铀,加州大学伯克利分校博士后
【你将听到】
拆解数据生意和玩家
05:03 数据公司之间的区别:招聘平台、众包标注、合成数据
08:27 从预训练到后训练,模型需要的数据发生了哪些变化?
09:32 Rubric数据:把专业判断变成评分标准
10:46 强化学习(RL)环境:从回答问题到动手干活
12:18 从vibe coding,到vibe everything:详解Agents’ Last Exam
14:10 游戏好不好玩、作品好不好看,主观判断能被量化吗?
17:33 Rubric 与环境如何配合:人与Agent协作
评测与模型真实能力
20:05 从做评测到卖数据:benchmark的生意
23:25 什么样的评测值得刷?核心能力与真实场景
27:29 没上热门榜单的评测,也可能带来真实的数据需求
31:39 模型公司如何权衡内部评测、公开榜单与用户反馈
什么是好数据:采购、版权与小众行业工作流
33:30 两三个人的数据创业公司,为什么也能找到机会?
38:56 模型越来越会自己造数据,外部供应商的机会还能持续多久?
40:48 模型公司为什么仍然需要外部数商?研发周期与行业采购的难题
有了数据,之后呢?
44:04 数据买回来之后怎么用?从 SFT、强化学习到模型训练模型
47:03 训练数据不是越难越好:为不同模型匹配难度与解题轨迹
48:22 SWE-bench Verified 的争议:测试缺陷与数据污染
50:04 专家交来的数据也可能造假,如何验证真实的工作过程?
54:03 数据行业的下一步:收购企业、获取数据,还是持续投入研发?
【感谢科沃斯对本期节目的大力支持】
这期我们聊了很多验证和评测:写代码跑一遍沙盒就知道对错,家务却是每天都在变的开放任务,对机器人来说,真实家庭环境就是最严格的评测现场。
科沃斯在服务机器人领域已扎根28年,连续11年稳居国内线上扫地机器人销售额第一,产品销售全球150多个国家和地区,拥有超过1200项全球专利。
从全能清扫的扫地机器人,到解放高空与双手的擦窗机器人,再到割草、泳池清洁,科沃斯让每个场景都有对应的专职选手,为人清空琐碎,让生活的每一刻都“无难事”。
数据来源:北京奥维云网大数据科技股份有限公司;统计时间:2015年-2025年;统计范围:中国扫地机器人市场全渠道(线上、线下)监测数据
欢迎了解更多,复制淘口令打开淘宝:48¥ CZ001 mBdFTN9ipmh¥ https://m.tb.cn/h.8EbY9YU 【新品】科沃斯X12S PRO扫地机器人滚筒活洗3.0全自动扫拖一体
京东链接
本期福利:下单备注【硅谷101】额外加赠抗菌滚筒拖布一个
把家务交给科技,享受属于你自己的惬意生活吧!
【硅谷AI视频黑客松招募】
最懂内容的影视团队,与最懂AI的一群科学家,在硅谷相遇,会碰撞出如何的火花?
今年,硅谷101把一次现场创作实验带到 Alignment 2026:STORY101 LAB — AI Storytelling Challenge。我们邀请你用AI,完成一部不超过三分钟的视频作品。
比赛设【探索组】与【专业组】双赛道,资深AI影片团队与零基础新手皆可参与。我们提供免费workshop培训,优胜者更可获丰厚奖金与千人线下展映机会。
时间:2026年10月10–11日
地点:Sunnyvale, California
报名入口
【硅谷101年会来了,线下见】
10月10日—11日,我们将在【硅谷】举办Alignment 2026年度大会,从大模型、Agent、机器人到AI Infra,从实验室里的突破,到真实世界的商业化,我们直击AI变化最剧烈的前沿。来自OpenAI、Anthropic、NVIDIA、Meta、Google DeepMind、SemiAnalysis、Cerebras等公司的研究者、创业者与投资人将齐聚现场,分享正在发生的机遇和挑战。
点击报名入口 ,使用折扣码【FANS15】注册,还可以获得15%折扣。
【相关阅读和名词解释】
Rubric(评分标准):针对具体任务制定的一组评价条件,用来判断回答或工作成果是否达到要求。它可以包含正确性、完整性、指令遵循等维度,也可以融入专家判断。
RL Environment(强化学习环境):让模型通过行动和反馈进行学习的环境。在本期讨论的Agent训练中,通常包括任务、可操作的软件与工具,以及判断任务是否完成、完成质量如何的验证和奖励机制。
Benchmark(评测基准):通过一组任务与评价规则,衡量模型或智能体在特定能力和场景中的表现。评测数据与训练数据需要保持适当隔离,才能有效检验模型面对新问题的能力。
Reward Hacking(奖励投机):模型利用评分机制的漏洞获得高分,却没有真正完成预期任务。例如,绕过正常操作修改结果,让验证程序误以为任务已经成功。
Agents’ Last Exam(ALE):由Berkeley RDI与行业专家共同构建的智能体评测项目,关注具有经济价值、需要多步骤执行且结果可验证的专业任务。
Humanity’s Last Exam(HLE):由Center for AI Safety与Scale AI共同组织推出的评测,覆盖数学、人文、自然科学等领域的高难度专家问题。
SWE Atlas:Scale推出的软件工程智能体评测套件,覆盖代码库问答、测试编写和代码重构。
SWE-bench Verified:经过人工审核的软件工程评测,让模型修复真实开源项目中的问题。OpenAI于2026年2月宣布停止报告其分数,指出测试设计缺陷与数据污染影响了它衡量前沿模型能力的有效性。
【硅谷101听友群】
在这里,和同好一起深聊科技、商业与未来,期待你的声音,也期待更多有趣的讨论。
扫码加入,即刻相遇!
【监制】
泓君
【后期】
Amei
【运营】
朱婕
【BGM】
Mindscape - Lennon Hutton
Light-Footed - Bonnie Grace
Smiling Neighborhood - Claude Signet
Ruffles and Rust - Fabien Tell
Reclaim - Megan Wofford
【在这里找到我们】
公众号:硅谷101
收听渠道:Apple Podcast|Spotify|小宇宙|喜马拉雅|蜻蜓FM|荔枝FM|网易云音乐|QQ音乐
其他平台:YouTube|Bilibili 搜索「硅谷101播客」
联系我们:podcast@sv101.net
Special Guests: 何允中 and 孙一铀.