核心看点:仅140亿参数的推理模型,通过强化学习训练后,在Polymarket预测市场上准确率超越GPT o1,模拟交易回报率超10%。来自Lightning Rod Labs和斯坦福的研究团队,将RLVR方法从数学/编程领域推广到充满噪音和延迟反馈的真实世界事件预测,面临训练崩溃、过度自信等严峻挑战。他们改造了GRPO和ReMax算法,去掉标准差归一化以保留极端预测误差信号,并设计了一套防护栏(非英语/乱码过滤、解释质量检查)来维持10万数据量级下的训练稳定性。实验使用了包含10,000条训练和1,265条测试的Polymarket问题数据集,并采取多道时间泄露防护措施。ReMax集成模型在软Brier评分(0.190)和期望校准误差(0.062)上均优于o1,模拟交易盈利52美元(o1为39美元)。论文还分析了GRPO不加防护导致模型输出0%或100%极端概率、中英文混杂乱码等失败模式,并给出了工程化的解决路径。