Agent评测漫谈 —— 由浅入深讲解Agent评测本篇博客是一篇科普文章,由浅入深的介绍Agent评测。其中前两章系统介绍了评测是什么,以及如何建立评测体系;其中第二章是美团图灵Agent评测团队深入美团各业务团队BP总结出的实践经验,是我们在两年实践过程中逐步打磨出来的认知。第三章重点介绍了龙虾/爱马仕这类长程Agent框架的出现对评测带来的变化。 本篇博客在美团内部发表之后获得了较多的关注,我们发现大家对Agent评测的热情非常高,因此我们决... 评论点赞收藏6 天前
美团发布 CatPaw 全场景 AI Agent 平台,赋能个人与企业智能化本月,美团 LongCat 2.0 已 正式开源,总参数 1.6T,平均激活约 48B,动态范围 33B 到 56B,原生支持 1M 超长上下文。这是首个在五万张国产算力卡上完成全流程训练与推理的万亿参数模型。开源只是第一步,让 LongCat 2.0 在真实的工作任务中成为可靠的“工作伙伴”,才是真正的考验。 现在,搭载 LongCat 2.0 的美团全场景 AI Agent 平台 CatPaw... 评论点赞收藏18 天前
美团开源LoHoSearch:用知识图谱自动生成高难度搜索智能体评测基准过去一年,我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上,顶尖模型准确率从最初的30%区间迅速攀升至90%以上。然而,当基准迅速饱和,其区分模型能力的价值也随之递减。 BrowseComp 的题目由人工设计,局限在于只能基于标注者已知的实体和关系构思,无法站在全局知识网络视角判断:哪些条件真的难检索?哪些约束的候选空间足够大?正是这种局限,让我们开始思考另... 评论点赞收藏20 天前
让AI离开温室,走向动态世界:MineExplorer揭示顶级多模态大模型被忽视的能力断层假如你出生在一片未知的森林,太阳即将下山,饥肠辘辘,前方一只蜘蛛正向你缓慢爬来。——这是来自《我的世界》最经典的开局。 此时如果你按下暂停,把截图发给所有顶级的多模态大模型,它们都能完美回答你:“黄昏、有怪物,面临威胁。” 我们发现,多模态大模型能看懂图像、解析视频、在复杂场景里推理,然而一旦它们被丢进一个实时变化、需要持续探索的开放世界又会发生什么? 为了深入探索,美团 LongCat 团队构建... 评论点赞收藏20 天前
美团 LongCat-2.0 正式开源:1.6T 参数模型支持国产卡推理美团 LongCat-2.0 总参数 1.6T,平均激活约 48B,为真实的 Agentic Coding 任务而生,架构上创新性引入 LongCat 稀疏注意力和 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力的同时,结合动态激活进一步强化了代码理解、生成以及执行的表现。 评论点赞收藏34 天前
美团 AI 顶会论文回放:含 ACL'26 杰出论文 32 篇精讲如果你正在关注 AI 前沿,这篇内容值得收藏。2026 年,美团技术团队数十篇论文被 ACL、SIGIR、ICML、KDD 等顶会收录。我们精选 32 篇,进行了 5 大专场直播。 评论点赞收藏34 天前
美团技术团队顶会论文分享:搜索推荐ASX专场美团业务研发平台/搜推 ASX (Agentic System X)团队聚焦构建大模型为基础的 Agent 技术体系,在大模型后训练、Agentic 强化学习以及多模态理解等核心前沿方向持续深耕,已在 ICLR、NeurIPS、CVPR、AAAI 等 AI 领域的国际顶会发表数十篇高质量研究成果。 本文精选了6篇进行解读,希望对大家有所帮助或启发。 评论点赞收藏44 天前
ACL 2026 精选论文分享:美团履约团队前沿技术专场美团业务研发平台/履约 AI 算法团队,聚焦构建大模型为基础的 Agent 技术体系,用 AI 赋能美团履约业务, 构建 Agent 自进化的运营系统。在大模型 CPT、Post-training、Agentic RL 以及多模态理解等核心前沿方向持续深耕,已在 ACL、EMNLP 等AI领域的国际顶会发表数十篇高质量研究成果。 本文分享了美团履约团队专场聚焦 ACL 会议论文以及前沿技术实践。 评论点赞收藏44 天前
美团发布LongCat-2.0:基于五万卡国产算力的万亿参数模型作为业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型(总参数 1.6 T,平均激活约 48 B,动态范围 33B~56B),LongCat-2.0 从零开始预训练,原生支持 1M 超长上下文,其架构设计自始至终围绕一个核心目标:让模型在真实的 Agentic Coding 任务中,更高效、更稳定地完成代码理解、生成与执行。 评论点赞收藏46 天前
ICML 2026 美团技术团队学术论文精选ICML是机器学习领域最具影响力的国际顶级学术会议之一。 大会旨在探讨机器学习未来发展所面临的关键挑战与核心问题,并通过征集和评估具有重要理论价值和实际影响的前沿研究成果, 推动领域发展并引领未来研究方向。 评论点赞收藏47 天前
LongCat 开源 VitaBench 2.0:长期动态智能体评测基准VitaBench 2.0 是首个真实生活场景下面向长期动态用户建模的智能体评测基准,它系统性地评测大语言模型在长期、 真实、动态的用户互动中个性化与主动性的能力。 评论点赞收藏47 天前
美团海报生成 AIGC 技术创新与实践美团智能创作团队围绕海报生成 AIGC 构建了完整技术体系,打造「生成-编辑-评判」技术闭环,目前在美团外卖、品牌 IP 等场景落地,已全部开源。 评论点赞收藏47 天前
从月球漫步到赛博都市:WBench 评测世界模型的交互边界美团 LongCat 团队提出并开源 WBench,它是首个面向交互式视频世界模型的系统性多轮评测基准。 它就像一台“CT 扫描仪”,能精准定位当前世界模型在从“被动观看”到“主动交互”的过程中, 到底卡在了哪里。。 评论点赞收藏61 天前
美团ACL 2026论文精选:从能力评测到推理优化,构建生成新范式ACL是计算语言学和自然语言处理(NLP)领域的国际顶级学术会议,本文解读了被 ACL 顶会收录的其中 6 篇论文,技术方向覆盖大模型评测、复杂流程推理、竞赛级数学思维优化、强化学习优化、 生成式推荐等领域。 评论点赞收藏69 天前
从高拟真到真可用,LongCat-Video-Avatar 1.5 正式开源LongCat-Video-Avatar 1.5是一款从开源 SOTA 迈向商业级应用的数字人视频模型。在唇形同步、物理合理性、长视频稳定性、多人互动和高效推理上实现了全面跃升。 LongCat-Video-Avatar 1.5 即便在复杂商业场景里,也能稳定、自然地输出高质量内容,让数字人视频生成从彩排室的完美演练, 走向千人千面的真实舞台。 评论点赞收藏83 天前
美团 LongCat 开源 General 365:树立推理评测新标尺美团 LongCat 团队正式发布 General 365。我们发现,在对 26 款主流模型的实测中,目前地表最强的 Gemini 3 Pro 准确率仅为 62.8%,而绝大多数模型甚至没能摸到 60 分的及格线。 评论点赞收藏93 天前
用Agent评测思路管理AI Coding —— 31万行代码AI重构的实践当 90% 以上代码由 AI 生成,决定系统走向的不是谁写得更快,而是约束 AI 的能力。没有统一规范,AI 只会成倍放大混乱。本文基于 31 万行代码重构实践,分享我们如何用 Agent 评测思路管理 AI Coding——通过技术债梳理、建设Rule、重构 SOP 和 Pre-PR 机制,把重构从高成本专项变成随迭代持续推进的日常动作。 评论点赞收藏101 天前
LARYBench 发布:定义具身动作表征 ImageNet,首次度量从人类视频学习的泛化表征LARYBench (Latent Action Representation Yielding Benchmark),一个指引从大规模的视觉数据学习到通用的隐式动作表征的系统化评测基准。 实验结果表明:在动作泛化和控制精度上,通用视觉模型的表现均显著优于专门为具身智能设计的动作专家模型, 具身动作表征可以从大规模人类视频数据中涌现。 评论点赞收藏111 天前
突破零样本 TTS 音色克隆上限:LongCat-AudioDiT 的声音克隆艺术能不能让 AI 直接学会声音本身的规律,跳过中间环节? 为破解这一技术瓶颈,美团 LongCat 团队正式发布 LongCat-AudioDiT。在该模型中,彻底抛弃梅尔谱等中间表示, 直接在波形潜空间进行基于扩散模型的文本转语音(Text-to-Speech, TTS),从根源阻断数据转换的级联误差。 评论点赞收藏118 天前
LongCat-Flash-Prover:AI攻克数学定理证明,不仅要“算得对”,更要“证得严”在常规的数学解题中,模型只需要“答对最终数值”即可,但数学定理证明不同, 它要求极度严苛的逻辑链条,任何一句自然语言的模棱两可,都可能导致整个证明的崩塌。 那么,如何让 AI 从“猜答案”走向“严谨证明”,成为复杂推理具有挑战的课题。 为了解答这个问题,我们开源了专门用于数学形式化与定理证明的模型 —— LongCat-Flash-Prover。 评论点赞收藏131 天前
美团发布原生多模态 LongCat-Next:当视觉和语音成为AI的母语LongCat-Next 是我们在通往物理世界 AI 道路上的一次探索。今天,我们把研究思路的核心——LongCat-Next 模型和它的离散分词器全部开源,希望更多开发者能基于它,构建真正能感知、理解并作用于真实世界的 AI。 评论点赞收藏136 天前
美团 BI 在指标平台和分析引擎上的探索和实践美团数据平台构建了以指标平台为核心的新一代 BI 架构,通过自动语义和增强计算两种核心能力的建设,部分解决了传统 BI 平台在个性化数据集驱动下产生的数据口径混乱、查询性能差等问题。 评论点赞收藏149 天前