从榜单走向真实业务负载:Kernel Agent 刷新 Qwen3.8-Max 核心推理算子性能
阿里 TRE 团队发布 AKA(Atrex Kernel Agent),将编码 Agent、性能 Profiling、GPU 评测与正确性门禁整合成持续优化闭环,用于替代推理框架中已集成的专家级算子实现。 文章核心论点:Kernel Agent 的验证标准正从公开 benchmark(KernelBench、SOL-ExecBench 等)转向真实生产负载——60 个真实 shape 上,FlashAttention-4、Gated DeltaNet 等三条关键算子线平均时延均低于专家版本,较生产/官方基线最高加速 1.55×。 文中梳理了 EvoKernel、CUDA-Agent、NVIDIA AVO、KDA、CAKE 等近期工作,并指出公开榜单只能证明 Agent 能生成正确且高性能的 Kernel,不能回答"能否直接替换现有高性能实现并带来更多收益"这一生产交付问题。 生产算子还需覆盖真实 shape 分布、混合精度数据语义、MTP 负载及上下游 I/O 协议。属于工程团队一手技术博客,有数据、有对比基准、有生产落地视角,对 GPU kernel 优化和推理框架方向读者有较高信息增量。




