在消费级 Blackwell GPU 上优化 FlashAttention:从 3.23% 到 94.6% Roofline
RTX 5090 上跑 FlashAttention 前向传播,两周 profiling 迭代从 3.23% 提升到 94.6% roofline。FA3/FA4 依赖的 wgmma 和 tcgen05 指令在消费级 sm_120 上不存在,只能用 mma.sync 和 ldmatrix。前 60% 提升来自修复硬件空闲,中间 30% 来自减少指令和隐藏延迟,最后阶段需要校准测量工具本身。