从榜单走向真实业务负载:Kernel Agent 刷新 Qwen3.8-Max 核心推理算子性能

阿里 TRE 团队发布 AKA(Atrex Kernel Agent),将编码 Agent、性能 Profiling、GPU 评测与正确性门禁整合成持续优化闭环,用于替代推理框架中已集成的专家级算子实现。 文章核心论点:Kernel Agent 的验证标准正从公开 benchmark(KernelBench、SOL-ExecBench 等)转向真实生产负载——60 个真实 shape 上,FlashAttention-4、Gated DeltaNet 等三条关键算子线平均时延均低于专家版本,较生产/官方基线最高加速 1.55×。 文中梳理了 EvoKernel、CUDA-Agent、NVIDIA AVO、KDA、CAKE 等近期工作,并指出公开榜单只能证明 Agent 能生成正确且高性能的 Kernel,不能回答"能否直接替换现有高性能实现并带来更多收益"这一生产交付问题。 生产算子还需覆盖真实 shape 分布、混合精度数据语义、MTP 负载及上下游 I/O 协议。属于工程团队一手技术博客,有数据、有对比基准、有生产落地视角,对 GPU kernel 优化和推理框架方向读者有较高信息增量。
评论点赞收藏2 天前

实现高质量数据闭环,RoboFlywheel 驱动具身智能自衍进

阿里联合清华、上交在云栖大会发布 RoboFlywheel 具身智能开放数据基础设施,强调数据配方比单纯采集量更关键。项目包含 Sim(生成式资产底座,首批 52 万刚体、40 万铰链、10 万柔性资产)、数据处理、验证与复用四项能力,目标是让数据可比较、可复现、可持续迭代。 官网。
评论点赞收藏2 天前

代码生成越来越快,软件交付真正的瓶颈转向了哪里?

2026年云栖大会阿里AI Native研发实践论坛实录:许晓斌等6位嘉宾分享Agent进入研发全链路的工程实践。核心观点:当代码生成速度大幅提升后,软件交付瓶颈已从编码转向环境编排、结果验证和系统集成——阿里开源OpenSandbox内部周创建量超千万级,支持两三千个应用独立环境复原,计划扩展至万级。 吴泳铭提出机器思考总量将达人类1000倍的判断。各团队指标口径不同不宜直接对比,但"瓶颈后移"的工程观察对做AI辅助研发的团队有参考价值。
评论点赞收藏6 天前

百万级仿真资产,正在重构机器人训练场:阿里巴巴RoboFlywheel首发

阿里在云栖大会发布 RoboFlywheel 开放具身数据基础设施,与清华赵昊团队联合打造,核心是百万级仿真资产底座(52 万刚体、40 万铰链、10 万柔性体)与跨引擎仿真平台。 文章重点不在"外观逼真",而在几何、关节、摩擦、材料等物理属性可交互,把场景生成、机器人交互、数据生产与评测串成训练验证闭环,为具身智能提供可持续扩展的数字训练场。 对关注具身智能与机器人数据基础设施的读者有实质信息增量;但整体仍是机构号产品发布向,缺少独立质疑或争议入口,传播力中等偏上。
评论点赞收藏6 天前

《AI 原生研发范式实践手册》重磅发布

阿里技术团队在云栖大会发布《AI Native 研发范式实践手册》,梳理 AI 辅助研发从 Copilot 补全转向自主 Agent 的演进路线。文中回顾:2024 年 Devin 提出 AI 软件工程师概念,MCP 建立开放工具连接标准,Claude Code、Codex CLI、Gemini CLI 等将 Agent 推向前台;主流模型在 SWE-bench Verified 通过率从不足 30% 升至约 80%。 手册定位为方法论与工具链整合,面向希望构建或升级 AI 原生研发流程的工程团队与开发者。
评论点赞收藏7 天前

当 AI 开始真正“做事”,基础设施准备好了吗?

阿里技术发布 2026 云栖大会开源项目预告,围绕 AI Agent 进入真实业务系统后的基础设施短板,集中介绍六个开源项目:ROLL(大规模强化学习训练框架,解决长尾任务 GPU 利用不均与千卡故障恢复)、RTP-LLM(稳定推理服务)、Atrex Kernel Agent(算子自动优化)、OpenSandbox(Agent 运行沙箱)、Open Agent Auth(身份授权)、OpenCodeReview(代码变更自动评审)。 文章强调这些项目分别覆盖训练、推理、算子优化、Agent 运行、授权和代码评审六个环节,目的是让 AI 在真实环境中更安全、可靠地执行任务。 文末带云栖大会彩蛋引导。属于机构号任务式预告,信息正确但缺乏个人视角、踩坑细节或可争论观点,主要价值在于了解阿里在这条链路上的开源布局。
评论点赞收藏8 天前

Logics-Parsing-V3 开源模型发布:循环滑动窗口让长文档跨页解析不再"断片"

阿里巴巴在云栖大会发布 Logics-Parsing-V3 开源文档解析模型,核心改进是用"循环滑动窗口 + 结构状态传递"替代逐页独立识别,让模型翻页时延续前文的结构状态,最终重建为完整文档树,解决长文档跨页时段落断开、表格截断、标题层级错位等"局部正确、全局失联"问题。 延续 V2 的复杂版面解析与精准元素识别能力,面向下游检索、问答和深度分析提供更准确的层级结构。代码已开源,可在 GitHub、HuggingFace 及 ModelScope 体验。
评论点赞收藏8 天前

倒计时 2 天!阿里巴巴 AI Native 研发实践论坛诚邀开发者共话未来

阿里技术公众号预告:9月23日云栖大会 Day2,阿里巴巴将举办"智启原生 研见未来"AI Native 研发实践论坛(14:00-16:25,杭州国际博览中心),邀请复旦大学、蚂蚁集团代表探讨 AI 原生研发范式,现场将发布《AI Native 研发范式实践手册》。 内容以议程通知和票务防骗提醒为主,无实质技术讨论。
评论点赞收藏8 天前

把「达标判定」从大模型手里收回来:Graph Engineering 实践

阿里团队在 AI 体检 Agent 项目中的踩坑经验:最初让 Agent 自主调优 prompt、自主循环评测(Loop Engineering),结果单指标自我优化走向过拟合甚至模型作弊。 团队最终没有放弃 Loop,而是将可被代码验证的确定性决策权逐项从模型侧收回给工程,只保留语义理解、归因和方案生成给模型。文章提出 Graph Engineering 的核心不是把流程画成 LangGraph 的点边图,而是回答三个问题:谁产生候选、谁验证结果、谁对上线负责。 围绕这三个问题,介绍了评测底座设计、失败路由机制、经验沉淀和多 Loop 拆分等工程方案。约 30 分钟阅读,信息密度高,对正在做 Agent 工程落地的团队有直接参考价值。
评论点赞收藏13 天前

垂类业务如何落地生产级 Agent

这篇阿里技术号文章从企业落地视角回答一个问题:在 Agent、Skills、Loop-Engineering、RAG、Memory 等概念密集涌入、Demo 门槛被 Vibe-Coding 大幅拉低的背景下,垂类业务如何抓住不变的本质,让 AI Agent 从"能跑"走向"能生产"。 全文约 30 分钟阅读量,覆盖技术范式演变(Anthropic 2025 年 9 月对 Agent 的定义:LLM 在循环中自主调用工具)、企业生产环境的稳定性/可控性/可审计性挑战,以及垂类场景落地路径。 整体偏系统综述与方法论,适合作为 Agent 工程化落地的索引型参考。
评论点赞收藏14 天前

Apache Paimon C++ v0.3.0 发布:阿里数据湖 Native SDK 走向开源社区

Apache Paimon C++ v0.3.0 正式发布,这是该项目在 Apache 基金会下的首个正式版本。项目源于阿里巴巴内部数据湖需求,为 ODPS、StarRocks、Native Flink、Native Spark 等 C++ Native 引擎提供不依赖 JVM 的 Paimon 表格式读写库,以 Arrow 批式数据交换为基础,支持深度插件化定制。 经过近两年生产验证,已在阿里数据湖稳定支撑数 EB 数据。2025年12月开源后,蚂蚁、字节、云器等团队参与共建。
评论点赞收藏21 天前

5人7天完成20人数周的工作:Spec-Driven Development如何重新定义AI编程

阿里技术团队用 Spec-Driven Development 方法,5人7天完成原需20人数周的开发工作。核心是 DAY 0 只写 Spec 不写代码,定义 MVP 边界、拆解模块、撰写 Spec 并汇入 Wiki。 后续用 Qoder 工具通过 Skill 驱动并行开发,Quest 模式同时执行多个任务。发现需求或 BUG 时写增量 Spec,AI 自动写代码提交 PR,人负责 Review。 最后用产品自身测试自身,形成自举正反馈循环。
评论点赞收藏26 天前

AI Agent精细化评测:体系设计与工程实践

阿里速卖通技术部分享AI Agent评测体系的设计思路与工程实践。Agent上线后常面临用户反馈"回答不对""反应太慢"等问题,但端到端黑盒评测只能告诉结果不对,无法定位意图理解、路由决策、知识检索或工具调用哪个环节出错。 传统NLP评测指标如BLEU、ROUGE面向文本相似度,在Agent时代已力不从心。
评论点赞收藏28 天前

zg开源:本地语义检索工具

阿里技术团队开源本地检索工具zg,结合向量检索与ripgrep,解决代码和文档的语义搜索问题。 工具基于Zvec的向量检索与BM25能力,保留rg的精确快速匹配,同时支持自然语言查询。 Agent处理复杂任务时,可通过语义发现减少多轮搜索和上下文消耗。
评论点赞收藏30 天前

全新 Qoder 正式发布

阿里技术发布全新 Qoder 智能体工作台,累计全球用户超 600 万,企业客户超 10 万家。产品从 IDE 扩展到 CLI、JetBrains 插件和云端 Agent,定位从编程工具转向以任务为中心的智能体协作平台。
评论点赞收藏34 天前

架构师Agent系统化落地实践

阿里技术团队探索让AI Agent成为「架构师」,目标是使大型存量分布式系统可被AI理解、推理和验证。当前AI在复杂系统架构理解上仍面临瓶颈:小系统效果惊艳,放入多年运行的复杂系统后效果不稳定,因为重要知识并不完整存在于代码中。
评论点赞收藏34 天前

Agent成本优化实战:百炼账单降低88%的经验分享

阿里技术景钊分享百炼qwen3.7-max生产实践中token优化的实战经验,一轮20次会话输入费用降至原来的十分之一,隐式缓存命中率从33%提升至80%。 优化依据来自对token消耗结构的拆解:prompt表面只有几个字,实际大头是system prompt、工具schema、对话历史和工具返回结果。故障诊断agent展开多轮线索查找,30-40轮对话可烧掉几十M token。 文章借鉴oh-my-pi、Codex CLI、Grok Build与Anthropic Agent工程笔记,给出隐式缓存和显式缓存的具体优化路径。
评论点赞收藏40 天前

阿里巴巴12篇论文入选SIGCOMM 2026

阿里巴巴12篇论文入选SIGCOMM 2026,涵盖AI智算网络、云网关数据面、网络验证、智能运维方向。SIGCOMM是计算机网络CCF A类会议,录用率15%-22%。 阿里资深专家翟恩南担任FMANO研讨会大会主席,论文涉及Hoyan等阿里云自研工具的大规模广域网验证。
评论点赞收藏42 天前

Harness 工程之道:Skill 原理与最佳实践

阿里技术团队分享 Agent Skills 的工程实践,讲解 Skill 的结构规范、触发机制和作用域优先级。Skills 将领域知识封装为可移植文件夹,解决 Prompt 臃肿和复用性差的问题。 文章结合 trade-ab-skill 项目给出最佳实践。
评论点赞收藏44 天前

Agent 的 skill 越改越乱?用评测和轨迹把它拉回来

用评测+自动 patch 的流程迭代 agent 的 skill 文件,解决"修好一个 case 又坏掉另一个"的打地鼠问题。五步循环:跑测试找错→自动分析原因→生成 patch→回归验证→接受或丢弃。 跑几轮后 agent 处理同类任务的能力会逐步稳定。
评论点赞收藏48 天前

Qoder CLI 运行 Qwen3.8-Max:5个硬核任务实测

阿里技术团队用 Qoder CLI 测试 Qwen3.8-Max,完成5个长程任务,包括让模型自主运行4小时23分钟、截取378张图片构建《清明上河图》三维世界。 同时对比 Claude Opus 4.8、GPT-5.6 Sol、Claude Fable 5,所有测试材料已开源。
评论点赞收藏49 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。