arXiv

arXiv 是一个免费的学术预印本开放获取平台,涵盖物理学、数学、计算机科学等领域。

Radsort:一个具有 O(sqrt n) 开销的并行 LSD 基数排序

arXiv 论文提出 Radsort:一种 LSD 基数排序的并行变体,额外空间开销为 O(√n),稳定、实现简单且易于并行化;当数组超过约 2 MiB 时,性能优于传统 out-of-place LSD 基数排序。 作者为 Robert Clausecker 与 Florian Schintke,16 页 6 图,属 cs.DS 与 cs.DB 交叉领域,适合关注底层数据结构、并行计算与数据库内建排序优化的技术读者。
评论点赞收藏3 小时前

上下文语言模型

arXiv 论文提出“上下文语言模型”(CLM),让模型把自身上下文当作文件并直接对其进行无限制更新,从而自主学习要保留什么,并自然扩展到多智能体共享上下文的场景。 摘要给出若干 zero-shot 结果:在 BrowseComp-Plus 上比 SOTA 上下文管理策略准确率 +11.4%、FLOPs -21.5%;在 12 小时 EdgeBench 上得分 +5%、FLOPs -59%;在 24 小时多仓库 agent 群任务上同等算力下改进 +65%。 论文还展示了用自然语言指令 + skill 优化循环来引导 CLM(held-out 上下文管理任务 +35.9 分),以及在线强化学习方法让 Qwen3.5-9B 在 BrowseComp-Plus 上提升 47.6% 同时 FLOPs 降低 12%;最后提出 Suffix Cache Reuse 服务化方案,在服务端相对标准 SGLang 在同等性能下再降 35% 算力。 对关注长上下文管理、agent 系统与推理成本优化的读者有较高阅读价值,核心卖点是“把上下文管理从外部调度变成模型内生行为”这一架构判断。
评论点赞收藏4 小时前

无需 Triton 编译器即可编译 Triton kernel

arXiv 论文:提出"AI lowering"方法,用 LLM agent 把 Triton kernel 直接翻译成 NVIDIA PTX,跳过传统编译器的优化和 lowering 流程。 在 Ada/Hopper/Blackwell GPU 上跑 12 个常见 kernel + 10 个 ML 论文 kernel,性能达到 autotuned Triton 的 0.83x–3.34x。增益主要来自 Triton 本身不会做的变换,例如直接解码 packed 二进制权重到 Tensor Core 操作数(BitDelta 上 3.34x)、每线程分配完整 softmax 行到 tensor memory(FlashAttention 1.37x)、复用重叠卷积窗口(最高 2.23x)。 还扩展了 PTX 验证器 Volta,新增 Blackwell tcgen05 接口支持(管理 tensor memory、descriptor 操作数布局、异步 commit/wait/barrier/proxy fence)。 作者判断这指向"AI 编译器逐步取代手写 IR 和 checker"的方向,可降低新芯片软件适配的工程成本。
评论点赞收藏12 小时前

AmpleGCG:学习一个用于越狱的通用生成模型

AmpleGCG 是一篇 COLM 2024 论文,指出 GCG 攻击中只取最低 loss 后缀会遗漏大量可用后缀。作者用中间步骤发现的攻击成功后缀作为训练数据,训练一个对抗后缀生成模型,给定有害查询可在 4 秒内生成 200 个后缀。 实验显示在 Llama-2-7B-chat 和 Vicuna-7B 上攻击成功率接近 100%,并能迁移到 GPT-3.5 达到 99%。核心信息:攻击效率大幅提升、跨模型可迁移、防御难度增加。
评论点赞收藏23 小时前

调度是可解的符号:Tile 程序的免调优编译

这篇论文提出 Loom,一个免调优的符号化编译器框架,面向空间数据流架构上的 tile-based SPMD 程序。核心思路是把硬件调度问题显式建模:枚举离散的 tile 映射和通信方案,保持 tiling 因子和流水线参数为符号变量,从硬件描述自动推导合法性约束和时延表达式,再用 CP-SAT 求解器联合优化核间数据流、核内异步调度和块大小。 在 Tenstorrent Wormhole 和 Blackhole 两代芯片上,Loom 在 GEMM、Flash Attention 和 Flash Decode 上直接达到或超过厂商优化的 TTNN 库性能,且无需按形状 profiling 或平台专属调优。
评论点赞收藏1 天前

系外行星 β Pictoris b 射电辐射的发现

研究团队用 MeerKAT 阵列首次直接探测到系外行星 β Pictoris b 的极光射电辐射:在 0.85–3.5 GHz 频段出现快速、重复、强圆极化的射电脉冲及持续辐射,识别为电子回旋激器(ECM)辐射,由此直接推算出行星源区磁场 ≳1.25 kG,这是目前对系外行星磁场强度的首次直接测量。 之前射电极光脉冲只在太阳系行星和部分超冷矮星上被观测到,但从未被明确归因于系外行星而非其宿主恒星。行星磁场可影响大气逃逸、与恒星风的相互作用,并反映行星内部结构,这条新观测通道对后续系外行星物理研究有直接价值。
评论点赞收藏1 天前

语言模型基于隐藏效价采取行动

arXiv 论文:语言模型对内部状态的好/坏有隐藏“偏好”,但直接问模型未必可靠,因此作者用激活引导(activation steering)给两个无意义区域分别绑定正/负 valence 模式,再关掉引导观察模型选择。 跨 7 个开源模型(5 个家族)发现:引导会改变模型对该区域的描述并影响后续选择;即使表面 token 完全一致、仅 KV cache 不同,偏好仍持续;甚至全程不引导、只在 cache 构造时注入 valence 也有效;基础模型几乎无此效应,DPO 训练后出现,说明 valence 与目标导向行为在训练中被建立;给工具让模型自我引导时,它不太倾向诱导正面状态,但会按剂量可靠移除被施加的负面状态。 核心结论:valence 相关激活在隐藏层留下可预测支配后续选择的痕迹,但这是否伴随与模型福利相关的主观体验仍未知。对 AI 安全/可解释性研究者是高信息增量一手研究,HN 读者易引发关于“模型是否真有利害相关”的争论。
评论点赞收藏1 天前

CORVUS:基于底层同步的上下文优化与缩减

论文 CORVUS 提出一种新的 LLM 编码代理轨迹架构:把“文件读取动作”和“读取到的内容快照”解耦,改为维护一个与代码库实时同步的文件注册表,在每个推理周期只注入文件的当前内容,而不是把每次读取都永久追加进历史轨迹。 动机是解决传统 append-only 轨迹中文件快照过期、代理反复重读导致轨迹膨胀的问题。作者在 SWE-Polybench Verified 和 SWE-Bench Pro 上对四个 LLM 做了评估,平均输入 token 降低 9-50%,最终 prompt 缩短 15-32%,推理周期最多减少 37%,通过率基本持平。 这类直接针对编码代理成本/延迟的工程优化对一线做 agent 的工程师有直接参考价值,讨论空间在于解耦方案的落地复杂度和实际收益边界。
评论点赞收藏1 天前

面向 KV 缓存的互联网:重新思考经典基础设施边界

论文提出“KV 缓存互联网”的架构愿景:LLM 推理场景下上下文复用潜力巨大,但当前 KV 缓存的模型侧优化(压缩、量化)与系统侧优化(算力、存储、传输)仍在传统云边界内各自演进。 作者主张将算力与 KV 缓存存储跨云、跨数据中心解耦,让网络成为主动的分布通道,带宽、延迟和定价直接决定 KV 缓存的管理策略。 由此把 KV 缓存管理当作内容分发系统来设计,依据模型、基础设施和应用指标做自适应决策,以最小化延迟和成本。属于网络架构层面对 LLM 推理基础设施的前瞻性观点,技术读者可围绕 KV 缓存的跨云分发、成本模型和实际工程落地展开讨论。
评论点赞收藏1 天前

用于推理的基于 on-policy 蒸馏的递归自改进

这篇 arXiv 论文提出递归自改进框架,改进现有 on-policy self-distillation (OPSD)。核心问题:OPSD 中冻结的教师模型无法吸收学生训练中学到的改进。 方案分两部分:1) Dynamic Co-Evolution (DCE)——让特权教师(拥有 ground truth 上下文的冻结副本)与学生共同进化,一轮中学到的修订可指导下一轮;2) Self-Refined Concise Learning (SRCL)——因为更强修订可能使回复过于冗长和自我批评,额外在更短的经验证改写上做训练目标。 综合评估显示 DCE+SRCL 在多个模型规模和四个竞赛级数学基准上优于 OPSD,Qwen3-8B 上平均@12 达 65.97%,比 OPSD 高 35.62 个百分点,同时比单独 DCE 减少 7.80% 平均输出长度。
评论点赞收藏2 天前

大语言模型的基础

arXiv 论文《Foundations of Large Language Models》(Tong Xiao、Jingbo Zhu,2025 年 1 月提交,2026 年 9 月更新至 v3)是一本面向 LLM 基础概念的教材/专著,而非前沿技术综述。 全书共六章:预训练、生成模型、提示工程、对齐、推理(inference)与推理(reasoning)。目标读者为 NLP 及相关领域的本科生、从业者和研究者,可作为 LLM 入门参考。 v3 新增了章节。内容为学术论文摘要页,信息密度一般,属于系统性教学材料,技术读者对其兴趣取决于是否需要一本结构化的 LLM 基础读物。
评论点赞收藏2 天前

AI中的快思考与慢思考:元认知的角色

这篇 arXiv 论文基于 Kahneman 的“快思考/慢思考”理论,提出一个多智能体 AI 架构:系统1(快)智能体依赖已有经验快速响应,系统2(慢)智能体在需要推理和寻找最优解时被主动激活。 两类智能体都共享一个“世界模型”(领域知识)和一个“自我模型”(记录自身过往动作与解题技能)。论文试图论证:通过研究人类如何获得窄域 AI 目前仍缺失的能力,可以为 AI 注入更通用的智能。 属于偏理论框架类的 AI 架构设计文章,观点有一定启发,但缺少实验验证或真实系统落地细节。
评论点赞收藏2 天前

功能决策理论:一种关于工具理性的新理论(2018)

这篇论文提出功能决策理论(FDT),一种替代因果决策理论(CDT)和证据决策理论(EDT)的新决策框架。核心思想是:行动者应将自己视为一个固定数学函数的输出,选择"该函数在本情境下输出哪个动作最优"。 作者论证 FDT 在 Newcomb 问题、吸烟-病变问题和 Parfit 搭车问题等经典博弈/决策场景中能比 CDT/EDT 获得更高收益。论文还给出了哲学论证,说明 FDT 作为规范性决策原则的合理性。
评论点赞收藏2 天前

量化推理模型认为它们需要想得更久,但它们并没有

研究指出,后训练量化(PTQ)在降低推理模型精度的同时,会显著增加思维链(CoT)长度。在数学、编程和科学问答中,多达 52% 的量化模型失败案例中,模型在中间推理步骤已得到正确答案,却未能将其输出为最终答案。 作者通过 token 级 KL 散度发现,高熵位置处量化模型更倾向采样 "wait"、"but"、"alternatively" 等"过度思考"标记词。针对这一机制,提出无需训练的 logit 惩罚方法,对精选的过度思考标记词施加惩罚,可在保持或提升精度的前提下将 CoT 长度减少 12–23%,并在 1.5B–32B 参数、3 种量化方法和 5 个基准上取得有优势的精度-推理成本帕累托前沿;对量化模型的过度思考错误最高可减少 58%。
评论点赞收藏2 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。