MoE路由本质上就是分支预测

如果你同时涉足系统编程和机器学习基础设施领域,读到关于 Transformer 推理的内容时,就会产生一种奇妙的似曾相识之感。
术语是新的:KV 缓存、专家路由、分页注意力机制。但问题的本质却并无二致。
三十年前,CPU 架构师就遇到了同样的瓶颈:你必须在弄清需求之前就采取行动。
本文将探讨 Transformer 推理流程中两个几乎原封不动地重现这一难题的环节。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论