穷人共识:两项预注册LLM研究
作者 Andryo Marzuki 预注册了两项 LLM 研究,把"多模型一致性"当作被测试的测量工具本身。研究 1 发现同一冻结聚合协议在不同三模型面板上对合成推理链给出相反结论(−0.159 vs +0.122 nats),诊断出校准映射缺截距、语料几乎不含错误命题两个仪器缺陷;修复后两项预测在共享面板-语料配置上通过。 研究 2 基于修复后的仪器(Pauper Consensus 协议):12 个 3–4B 本地模型陪审团对 200 篇真实新闻的 8000 条标注断言投票(96000 票,13.2h 单台 Mac Studio),用 Dawid-Skene 模型加冻结校准映射聚合,预注册能力门通过(+0.20289 nats log-loss),系统门在更便宜的 27B 单模型支路以 0.781× 长度调整成本通过。 核心论点:LLM 验证的最小诚实核算单位是整套仪器——协议、语料、校准、硬件、成本——而非单个假设。 
