Awesome-Mixture-of-Experts-Papers路由策略全盘点:Top-k、Expert Choice与Hash Layers对比
2026/8/20 20:05:53 网站建设 项目流程

Awesome-Mixture-of-Experts-Papers路由策略全盘点:Top-k、Expert Choice与Hash Layers对比

【免费下载链接】Awesome-Mixture-of-Experts-PapersA curated reading list of research in Mixture-of-Experts(MoE).项目地址: https://gitcode.com/gh_mirrors/aw/Awesome-Mixture-of-Experts-Papers

在混合专家模型(Mixture-of-Experts,简称 MoE)成为大模型规模化训练主流方案的今天,**路由策略(Routing Strategy)**直接决定了每个 token 该交给哪些专家处理,是影响模型精度、训练效率与稳定性的核心机制。Awesome-Mixture-of-Experts-Papers正是一份帮你系统掌握 MoE 研究的精选论文清单,按算法、系统与应用三大板块收录了近年所有关键工作。本文基于这份清单,带你一次看懂三种最具代表性的路由策略——Top-k、Expert Choice 与 Hash Layers,并给出横向对比与入门学习路线。

为什么说路由策略是 MoE 的灵魂?

MoE 的核心思想是"稀疏激活":将一个大模型拆成多个专家网络(Expert),由路由器(Router / Gate)为每个输入 token 挑选少数几个专家参与计算。这样既能把参数量做到万亿级,又能保持单次推理的算力开销可控。

路由策略要同时回答三个问题:

1️⃣谁来算:这个 token 交给哪几个专家? 2️⃣算多重的权重:每个专家的输出如何加权合并? 3️⃣怎么不"挤爆":如何避免所有 token 都涌向同一批热门专家,造成负载不均与训练崩溃?

在 README.md 的 Algorithm 板块中,收录了 2017 年至 2022 年间几乎所有路由策略的代表性论文,从经典门控到最新的 Expert Choice 一应俱全,是理解这一领域的最佳地图。

Top-k 路由:经典门控,开启稀疏时代

Top-k 是最早、也是最广为人知的路由策略,思路非常直观:让每个 token 主动去"竞选"专家,得分最高的 k 个专家胜出

  • **2017 年《Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer》**提出了带噪声的 Top-k 稀疏门控,首次把 MoE 层应用到百万级词汇的语言模型上,被视为 MoE 的开山之作,收录于 README.md。
  • 2021 年 Switch Transformers将 k 简化到 1(Top-1 路由),用"简化到极致"的思路把稀疏激活模型推向万亿参数,收录于 README.md。
  • GShard则采用 Top-2 路由,并引入辅助负载均衡损失,让 token 在专家间的分布更均匀,收录于 README.md。

优点:可学习、自适应性强,能根据数据分布动态调整专家分工,理论表达力高。 ❌缺点:负载不均衡是老大难问题;当 token 被路由到的专家过载时,部分 token 会被直接丢弃(Token Dropping),且训练过程对超参数敏感、稳定性欠佳。

Expert Choice 路由:让专家反向挑选 Token

2022 年提出的《Mixture-of-Experts with Expert Choice Routing》(收录于 README.md)彻底反转了决策方向:不再由 token 挑选专家,而是让每个专家反向挑选亲和度最高的 top-k 个 token

这个看似简单的"换位思考"带来了三个显著收益:

  • 负载完美均衡:每个专家处理的 token 数量完全一致,无需辅助损失即可消除负载不均;
  • 零 token 丢弃:所有 token 都会被至少一个专家处理,信息不丢失;
  • 训练吞吐大幅提升:实验表明训练速度可达传统 Top-1 路由的 2 倍以上。

缺点:一个 token 可能被多个专家重复处理,导致"计算放大",因此不适合自回归解码等对实时性要求高的推理场景,更适用于编码器或训练阶段。

Hash Layers 路由:零参数、确定性的"笨办法"

2021 年 NeurIPS 论文《Hash Layers For Large Sparse Models》(收录于 README.md)提供了另一种极致简洁的思路:不学习任何路由参数,直接用哈希函数把 token 的特征(如 token id + 层号)映射到某个专家

优点

  • 完全确定性,可复现、训练极其稳定;
  • 无路由参数,省显存、省训练开销;
  • 天然避免负载不均衡与 token 丢弃问题。

缺点:哈希映射与数据分布无关,不具备自适应性,专家容量利用率与最终精度通常不如可学习路由,更适合作对比基线与大规模基线实验。

三大路由策略横向对比表

对比维度Top-k 路由Expert Choice 路由Hash Layers 路由
代表论文Sparsely-Gated MoE(2017)、Switch(2021)Expert Choice Routing(2022)Hash Layers(2021)
决策方向Token 选专家专家选 Token哈希函数指定
是否可学习✅ 可学习✅ 可学习❌ 零参数
负载均衡差,需辅助损失完美均衡天然均衡
Token 丢弃可能发生不会发生不会发生
训练稳定性较弱最强
推理友好度低(不适用自回归)
适用场景通用大模型预训练编码器、训练提速基线对比、超大规模扩展

一句话总结:要精度选 Top-k,要吞吐选 Expert Choice,要稳定与简单选 Hash Layers

扩展阅读:还有哪些值得关注的路由研究?

除了三大主流策略,这份清单还收录了不少重要变体,值得顺藤摸瓜:

  • BASE Layers(ICML 2021):把路由问题转化为线性分配问题,实现全局最优的负载均衡,见 README.md;
  • StableMoE(ACL 2022):提出稳定路由策略,让训练与推理时的路由保持一致,见 README.md;
  • DSelect-k(NeurIPS 2021):可微分的专家选择方法,面向多任务学习场景,见 README.md;
  • ST-MoE(2022):系统性地解决了稀疏专家模型的训练稳定性与迁移性问题,见 README.md;
  • GLaM(2021):Google 的 1.2 万亿参数 MoE 语言模型,展示了稀疏激活在效率上的巨大优势,见 README.md。

结合开源系统的高效学习路线

只看论文还不够,README 末尾的Open-Source System板块(见 README.md)还收录了Tutel、FastMoE、DeepSpeed-MoE、HetuMoE等主流开源实现,建议按以下三步走:

  1. 入门:精读 Sparsely-Gated MoE(2017)与 Switch Transformers(2021),理解 Top-k 门控与负载均衡损失;
  2. 进阶:对比 BASE Layers、Hash Layers 与 Expert Choice,亲手复现一张上述对比表;
  3. 实践:用 Tutel 或 FastMoE 跑一个小规模 MoE 模型,把三种路由策略替换上去,直观感受吞吐与精度的差异。

想本地查阅全部论文条目,只需克隆仓库:

git clone https://gitcode.com/gh_mirrors/aw/Awesome-Mixture-of-Experts-Papers

小结

路由策略是 MoE 从"能用"走向"好用"的关键一环:Top-k 奠定了稀疏激活的基础,Expert Choice 用方向反转换来了负载均衡与训练加速,Hash Layers 则以零参数换取了极致的简单与稳定。Awesome-Mixture-of-Experts-Papers 把这一演化脉络完整地收纳在一份清单中,无论你是刚接触 MoE 的新手,还是想跟进最新路由研究的进阶者,都值得把它当作案头的第一份参考资料。

【免费下载链接】Awesome-Mixture-of-Experts-PapersA curated reading list of research in Mixture-of-Experts(MoE).项目地址: https://gitcode.com/gh_mirrors/aw/Awesome-Mixture-of-Experts-Papers

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询