谁偷走了 5090 的算力和显存:一步 Transformer 训练的 roofline 侦查

我在一张 RTX 5090 上把一步 Transformer 训练拆开,分别量了时间和显存。结果和预想的不太一样:拖慢速度的不是矩阵乘,占显存最多的也不是权重。两边查到最后,都落在 attention 里的两个 seq × seq 矩阵上,一个是分数矩阵 S = QKᵀ(每个 query 对每个 key 的打分),一个是 S 按行过 softmax 之后的注意力权重 P,最后输出是 PV。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论