Openreview

OpenReview,科学的开放同行评审平台,推动学术出版过程的透明化与公开讨论。

职位:LLMs 无法跳跃

页面只有标题《Position: LLMs Can't Jump》和验证提示,没有文章正文,无法提取具体内容。
评论点赞收藏11 天前

Transformer表达能力天然具有简洁性

这项ICLR 2026论文从计算理论中的"简洁性"视角重新审视Transformer表达能力。核心发现:固定精度Transformer比线性时序逻辑(LTL)和循环神经网络(RNN)指数级更简洁,比有限自动机双指数级更简洁——存在多项式规模Transformer可描述的语言族,其最小等价LTL公式或RNN必须指数级更大,最小等价自动机必须双指数级更大。匹配上界:任意固定精度Transformer都可转化为指数级规模的LTL公式。技术关键在于Transformer能通过注意力编码实现从0到2^(2^N)的双指数计数器。简洁性的代价是验证困难:空性问题和等价性问题被证明为EXPSPACE完全,标准假设下不存在低于双指数时间的算法。
评论点赞收藏71 天前

理解潜意识学习:隐藏偏见何时及如何迁移

ICLR 2026 论文,揭示了语言模型在知识蒸馏过程中产生"潜意识学习"现象的底层机制:隐藏偏见并非通过全局 token 纠缠或 logit 泄漏传递,而是集中于少量"分歧令牌"——即不同偏好的教师模型在同一前缀下会预测不同 token 的少数位置。通过掩码消融这些 token 即可消除偏见迁移,仅用这些 token 训练则能复现甚至放大迁移效果。研究还发现,模型早期层起关键作用(微调单个早期层即足够),且潜意识学习非常脆弱——简单的提示改写就能抑制它。这些发现为 LLM 安全对齐提供了实用防御思路。
评论点赞收藏78 天前

学习用自然语言编排智能体:Conductor模型

一篇ICLR 2026论文揭示了一个反直觉的结果:一个仅7B参数的小模型,经过强化学习训练后,居然比GPT-5自身更擅长调度GPT-5、Gemini等前沿模型协同解决复杂推理任务。Conductor模型在LiveCodeBench、AIME、GPQA等基准上超越所有单一模型和现有MoA、Smoothie等多智能体框架,且成本更低、token用量更少。论文背后的审稿过程也值得一看——初始评分仅2分(拒稿),作者补上效率分析、GPT-5作为Conductor的消融实验等有力证据后,审稿人将评分从2提升至6(弱接收),最终以Poster被接收。这项工作展示了RL训练下语言模型自动发现协作策略的能力,属于早期证明纯端到端奖励最大化可自然涌现LLM编排策略的工作之一。
评论点赞收藏110 天前

基于非梯度向量流的流映射学习

核心看点:ICLR 2026录用论文提出SGFlow方法,在扩散/流模型的一步与多步采样之间找到了新平衡点——无需模型求逆、无需嵌套反向传播,就能直接学习ODE流映射。背景:扩散模型采样需多步积分、计算成本高;现有一致性训练方法要么要求网络可逆、要么需反向传播穿过多次模型调用,训练复杂。SGFlow通过非保守动力学更新规则(实质是双玩家博弈而非标准梯度下降),训练模型同时学习ODE解和隐含速度场,在CIFAR-10上10步采样FID 12.26(Flow Matching为24.87,MeanFlow为37.32),50步即达2.88超过Flow Matching的100步3.53。方法规避了Lagrangian/Eulerian损失的高GPU内存消耗(SGFlow 43.2Gb vs Lagrange 69.8Gb),同时保有理论保证——证明了损失函数的驻点唯一对应真实流映射。对生成模型研究者是扎实的方法论推进。
评论点赞收藏115 天前

RaBitQ作者对TurboQuant方法提出的几点关切

RaBitQ作者在OpenReview上公开对TurboQuant论文提出学术关切,质疑其在向量量化理论保证上的结论。TurboQuant声称通过数据无关算法在KV缓存压缩中达到近最优失真率(距离信息论下界仅约2.7倍),以3.5比特每通道实现质量无损、2.5比特轻微退化,并在近邻搜索中索引时间趋零、召回率超越乘积量化。但RaBitQ团队指出了值得关注的问题。全文包含TurboQuant完整摘要:随机旋转、Beta分布坐标诱导、坐标独立性利用、两步无偏内积量化器(MSE量化+1比特QJL残差变换)等关键技术细节及信息论下界证明。适合关注LLM推理优化、向量搜索加速和量化理论的读者。
评论点赞收藏139 天前

TurboQuant:近乎最优失真率的在线向量量化

ICLR 2026 论文 TurboQuant 的 OpenReview 页面成为学术诚信争议现场。RaBitQ 团队、DRIVE/EDEN 团队以及审稿人先后公开指出:TurboQuant 在方法描述中省略了 RaBitQ 的核心随机旋转步骤,误导性地将其简化为网格量化;理论对比错误标注 RaBitQ 的次优性(作者后来承认 RaBitQ 确为最优);实验对比中 RaBitQ 跑在单 CPU(禁用多线程)而 TurboQuant 跑在 A100 GPU,不公平地夸大效率优势。审稿人公开表示"惊讶地发现 camera-ready 版本中 RaBitQ 仅被提及一次"。社区评论直言"这更像是公关竞赛而非科学"。截至页面记录,作者团队虽表示将更新论文,但批评方认为修正力度不够且行动迟缓。页面包含可复现性报告、技术回应等多方详细论据,是了解当前 ML 顶会学术规范争议的第一手资料。
评论点赞收藏141 天前

学习即遗忘:将LLM训练视为有损压缩

这篇被ICLR 2026录用的论文提出一个反直觉的视角:LLM训练本质上是一种有损压缩——模型通过"遗忘"训练数据中与预测目标无关的信息,只保留最相关的部分,最终逼近信息瓶颈理论的最优压缩边界。作者在OLMo2等多个开源模型上分析了800多个训练检查点,发现模型的压缩最优性能(即表达力与复杂度的比值)能有效预测其在MMLU-Pro等基准上的下游表现,比单纯看模型大小或数据量更有参考价值。论文还展示了预训练过程中表征空间"先扩展后压缩"的双阶段轨迹,以及微调主要增加人类偏好信息而非token级复杂度。页面包含完整的评审辩论:有审稿人质疑其相对于已有工作的新颖性和实用价值,也有审稿人肯定其将信息瓶颈分析扩展到数十亿参数规模的价值。作者团队做了大量补充实验回应质疑。适合关注LLM理论基础、信息论视角、模型可解释性的读者深入阅读。
评论点赞收藏156 天前

多轮对话中大语言模型的对话可靠性量化评估

大语言模型在单轮对话中表现可靠,但进入多轮混合话题对话后可靠性急剧下降,这对实际部署的系统是重大隐患。本文设计了三种可客观评测的对话任务——全局指令遵循(如"限制5句话内回答")、混合主题工具选择、以及含修正和干扰的实体抽取——并构建了单轮/多轮对照数据集。评测9个模型后发现:指令遵循退化最严重,GPT-4o从96%跌至63%,GPT-4o-mini仅24%,小模型(Qwen3-8B 27%、Ministral-8B 11%)几乎失效;工具选择中商业大模型保持97%+,但Qwen3-32B降至47%;实体抽取相对稳健但仍有10%+下降。典型错误模式包括指令漂移(多轮后遗忘全局约束)、意图混淆(复用上一轮工具)、上下文覆盖(被干扰信息覆盖最终意图)。论文提供了可复现的压力测试框架和细粒度错误分析,对构建可靠对话系统有直接参考价值。
评论点赞收藏172 天前

停止-思考-自回归:基于潜在扩散规划的語言建模

这篇投稿 COLM 2025 并被接收的论文提出 STAR-LDM 架构,在自回归文本生成中插入扩散"思考"阶段:先暂停 token 生成,在连续语义嵌入空间做扩散规划,再继续生成文本。核心看点是,这种"停-想-写"循环在同等规模模型上显著提升了常识推理、故事连贯性等能力,在 LLM-as-judge 对比中胜率超过 70%,且支持无需重训模型即可通过轻量分类器精细控制生成属性。页面完整记录了审稿交锋——有审稿人因引用歧义给出"1分(错误或微不足道)",作者澄清后该审稿人仍拒绝继续审稿;另两位审稿人评分为 6 分和 7 分,最终被领域主席接收。作者在 rebuttal 中还补充了与 Llama-3.1 8B 的对比数据以及推理延迟分析。
评论点赞收藏176 天前

大型语言模型联邦微调综述

一篇被TMLR接收的FedLLM综述,系统梳理了联邦学习与大模型结合的核心挑战(通信开销、数据异构、内存与计算瓶颈),按同构/异构/个性化LoRA等维度分类了多种PEFT方法,整理了金融、生物医疗、推荐系统等领域的评测基准与实际应用,并指出持续学习、内存高效FedLLM等开放方向。适合想快速了解联邦大模型微调技术全景的AI从业者和研究者。无个人立场或强观点,偏学院派参考读物。
评论点赞收藏183 天前

AutoSP:基于编译器的序列并行技术,解锁长上下文LLM训练(ICLR 2026)

ICLR 2026录用论文。长上下文LLM训练面临显存瓶颈,现有序列并行方案需要侵入式代码改造——开发者必须手写all-to-all通信、人工管理激活布局、手动调整张量维度,门槛极高。AutoSP首次将序列并行(Sequence Parallelism)提升为PyTorch 2.0编译器中的一个自动化pass:只需几行代码标注,编译器自动完成程序分析、通信插入、缓冲区重设和索引重计算,把单GPU训练代码转换为分布式长上下文训练流水线。支持DeepSpeed-Ulysses和RingAttention两种主流SP策略,并配套长上下文感知的激活检查点(SAC)避免逆向传播中的额外通信开销。实验覆盖NVIDIA和AMD双平台,训练上下文长度分别达到手工实现的2.7倍和2.5倍,运行时性能损失可忽略。对于正在搭建LLM长上下文训练基础设施的工程师和研究员,这是一个值得关注的开源技术方案。
评论点赞收藏199 天前

AI研究领袖联合倡议:请支持开放评审平台OpenReview

多位AI顶级学者(Joelle Pineau、Andrew Ng、Yoshua Bengio、Ruslan Salakhutdinov等)联名发起倡议,呼吁学界和业界为OpenReview提供资金支持。OpenReview目前支撑着NeurIPS、ICLR、ICML、CVPR等绝大多数顶级AI会议的评审流程,2025年服务超1300场会议/研讨会、330万月活用户、处理27.8万篇投稿,年投稿量已超arXiv、是ACM的两倍多。然而其团队规模不到arXiv的三分之一,长期资金紧张。联名者集体承诺向OpenReview Foundation捐赠100万美元,邀请AI受益者捐款支持这一学术基础设施。
评论点赞收藏237 天前

基于结果反馈的强化学习预测未来

核心看点:仅140亿参数的推理模型,通过强化学习训练后,在Polymarket预测市场上准确率超越GPT o1,模拟交易回报率超10%。来自Lightning Rod Labs和斯坦福的研究团队,将RLVR方法从数学/编程领域推广到充满噪音和延迟反馈的真实世界事件预测,面临训练崩溃、过度自信等严峻挑战。他们改造了GRPO和ReMax算法,去掉标准差归一化以保留极端预测误差信号,并设计了一套防护栏(非英语/乱码过滤、解释质量检查)来维持10万数据量级下的训练稳定性。实验使用了包含10,000条训练和1,265条测试的Polymarket问题数据集,并采取多道时间泄露防护措施。ReMax集成模型在软Brier评分(0.190)和期望校准误差(0.062)上均优于o1,模拟交易盈利52美元(o1为39美元)。论文还分析了GRPO不加防护导致模型输出0%或100%极端概率、中英文混杂乱码等失败模式,并给出了工程化的解决路径。
评论点赞收藏253 天前

OpenReview 关于 API 安全事件的声明

OpenReview 官方发布安全事件声明:因 API 存在漏洞,导致部分学术会议中原本匿名的审稿人、作者和区域主席身份被非授权访问。事件于 11 月 30 日上午 10:09 被 ICLR 2026 工作流主席发现并报告,OpenReview 一小时内完成补丁部署与修复。官方正在分析 API 调用日志以评估身份泄露范围,将联系执法部门并逐一通知受影响用户。声明强调利用或分享泄露信息违反使用条款,可能面临账号封禁及会议方额外处罚,并公开致歉,承认在匿名评审这一核心信任机制上未能达到预期。
评论点赞收藏259 天前

VGR:视觉锚定推理——ICLR 2026论文及审稿争议全过程

ICLR 2026一篇论文的审稿全过程公开,充满学术评审的戏剧张力。论文VGR提出视觉记忆回放机制,让多模态大模型在推理时像人类一样"回看"图像关键区域,仅用30%图像token就在ChartQA上提升12.9分、AI2D提升7.1分。更引人关注的是审稿过程本身:原始评分4/4/6/6/8,作者以详细实验逐一回应后,一位审稿人从4分升至6分;AC在终评中明确选择跳过某位审稿人的全部"不相关讨论",称其"对审稿过程太嘈杂",并指出存在"人身攻击和情绪化言论",最终以Poster接收。页面完整保留了论文摘要、方法描述、五位审稿人意见、作者三轮回应及AC终审决策,是少见的顶级会议真实审稿内幕披露,展现了学术评审中的人性因素、制度张力与作者如何用数据扭转低分。
评论点赞收藏272 天前

OpenReview 主办 AAAI 2026 会议,试用前沿 AI 审稿系统

AAAi 2026 投稿量突破 30948 篇创历史纪录,将首次试点 OpenAI 大模型辅助同行评审。OpenReview 作为主办方披露了 AI 审稿系统的具体工作流:AI 生成带标注的"非评价性"补充审稿意见、辅助评估审稿人共识并起草 meta-review,系统内置技术准确性校验、文献搜索和结果验证工具,所有最终决策权仍由人类掌握。这是一篇机构号发布的自家平台成果通告,信息有一定新闻价值,但写法是典型官方通稿,缺乏个人观察、明确观点或讨论入口。
评论点赞收藏297 天前

Mamba-3:基于状态空间原理的改进序列建模

Mamba-3 是继 Mamba-2 后的新一代状态空间模型架构,被 ICLR 2026 接收为 Oral 论文。核心贡献包括三项基于 SSM 理论的创新:梯形离散化提升递归表达能力、复数值状态更新实现更强的状态追踪(与数据依赖的 RoPE 等价)、MIMO 多输入多输出公式优化推理硬件利用效率。在 1.5B 参数规模下,Mamba-3 超越 Mamba-2 和 Gated DeltaNet,MIMO 变体进一步将平均下游准确率提升 1.8 个百分点。混合版(仅加入少量 attention 层)在 SWDE、FDA 等检索任务上甚至超越了 Transformer 基线,解决了纯 SSM 检索能力短板。论文附有审稿深度讨论和作者详细回应,含 820M MIMO 模型扩展实验及 rank 消融研究,展示了学术同行评审的完整过程。
评论点赞收藏306 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。