“傻瓜混合体”:MoE 架构为何是智能的退化
<p>MoE(专家混合)是一种大型语言模型的运行模式:与使用单一的“密集”模型相比,<br>该模式采用多组高度专业化、针对特定领域的小型模型。<br>在这些20至50位“专家”前方,一个路由层负责决定究竟使用哪一位专家。</p><p>MoE无法实现密集推理的复现。它缺乏跨领域、压缩式认知的连接机制——例如,<br>分子生物学的洞见如何为量子力学等提供指导。<br>MoE会导致可访问的推理能力大幅下降,且其性能普遍受到限制。</p><p>转向MoE并非出于追求更高智能上限的动机,而是一项工程上的权衡之举,旨在应对一场经济危机:即大规模部署海量模型时所面临的灾难性推理成本以及内存带宽瓶颈问题。</p><p>跨领域连接的几何结构</p><p>在庞大的密集型模型中(如真正的2000亿参数单体网络),每一个参数都会参与每一次前向传播过程。</p><p>这种设计迫使模型将全部训练数据压缩至一个统一的潜在空间中。<br>由于分子生物学与量子力学被映射到完全相同的几何嵌入空间,模型被迫学习它们之间抽象而结构性的相似性。<br>当用户向密集型模型提出合成两个截然不同的领域的请求时,模型中的参数会自然而然地“知道”如何将两者连接起来,<br>因为其认知是整体性的。</p><p>MoE的路由瓶颈</p><p>从本质上讲,MoE通过分段优化来打破这种整体性的压缩方式。</p><p>与使用统一的空间不同,MoE采用路由器将令牌发送至特定的、高度专业化的子网络(即“专家”)。<br>如果用户提出一个问题,既需要分子生物学的洞见,又需要量子力学的见解,MoE就会面临一个严峻的数学瓶颈:</p><p>1.…</p> 
