arXiv

arXiv 是一个免费的学术预印本开放获取平台,涵盖物理学、数学、计算机科学等领域。

QuoteBench:匹配分数可能掩盖命令路径失败

arXiv新论文提出QuoteBench,发现LLM编码代理的Bash命令生成分数看似匹配,实际执行路径中可能隐藏大量失败。在14类真实事故衍生的56个任务上,加入额外解析器后成功率下降55.4至73.2个百分点;披露边界后部分配置恢复30.4至60.7点。论文主张评估命令类Agent应报告模型配置、生成契约、执行路径和最终状态验证器,而非把匹配分数当作模型固有属性。
评论点赞收藏20 小时前

对抗式生成与检测AI社交机器人内容

用对抗式方法检测AI生成社交机器人内容。研究团队让AI模仿真实社交媒体用户生成文本,构建多语言跨平台的人机配对数据集,训练出的检测模型在分布外真实数据上显著优于现有方法。
评论点赞收藏20 小时前

使用 SUMO 进行交通建模:教程

SUMO 开源交通仿真工具教程论文,介绍从生成合成交通模型到导入真实数据、输出仿真结果的完整流程。适合需要搭建交通仿真环境的工程师和研究人员。
评论点赞收藏21 小时前

简化与重构入门微积分

大一微积分教学往往让学生死记硬背多种流程,其实可以用更少概念覆盖更多能力。Jonathan Bartlett 提出简化微积分入门课程的方法,发表在 Communications of the Blyth Institute。
评论点赞收藏1 天前

Grothendieck常数新上下界:十位数确定为7

Grothendieck常数K_G的十位数被确定为7。新上下界为6π/11≤K_G≤π/(2log(1+√2))−10^−4。下界方法不再构造gap实例,而是证明Krivine方案的渐近极限;上界首次给出渐近舍入方案构造。结果由人类与长期AI研究系统协作发现。
评论点赞收藏1 天前

在巴厘岛两个区域测试4个AI助手的店铺推荐结果

巴厘岛两个区域4776家咖啡馆、餐厅和酒吧中,85.6%从未被任何AI助手推荐过,包括72.6%已有50条以上评价的成熟店铺。AI推荐可见性由文档化程度决定——评价数量、自有网站、价格信息和第三方网页提及——而星级评分在入门阶段无效,仅在排名阶段起作用。真正的问题是推荐了永久关闭的店铺(93次),而非捏造。四个AI系统之间推荐结果重合度低(Jaccard 0.33-0.54)。
评论点赞收藏1 天前

探针方向是提示词的属性,而非模型的属性

检测模型是否感知到"正在被测试"的探针方向,其实是提示词的特性,不是模型的特性。同一模型换不同提示词,能复现两篇已发表论文中互相矛盾的结论。模型本身只占结果方差的一小部分,大部分方差来自"每个模型对每个提示词的反应方式"。单提示词设计无法支持模型间比较,论文给出了可辩护比较所需的最少提示词数量。
评论点赞收藏2 天前

是时候告别空值和多重集了

SQL 的空值和多重集并非不可避免。剑桥大学研究者基于 Rel 语言实践经验,论证 NULL 和 bags 是可以避免的设计缺陷,提出完全规范化关系的查询语言设计方向,并逐一驳斥支持这两者的常见理由。
评论点赞收藏2 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。