Awesome-Mixture-of-Experts-Papers路由策略全盘点:Top-k、Expert Choice与Hash Layers对比
【免费下载链接】Awesome-Mixture-of-Experts-PapersA curated reading list of research in Mixture-of-Experts(MoE).项目地址: https://gitcode.com/gh_mirrors/aw/Awesome-Mixture-of-Experts-Papers
在混合专家模型(Mixture-of-Experts,简称 MoE)成为大模型规模化训练主流方案的今天,**路由策略(Routing Strategy)**直接决定了每个 token 该交给哪些专家处理,是影响模型精度、训练效率与稳定性的核心机制。Awesome-Mixture-of-Experts-Papers正是一份帮你系统掌握 MoE 研究的精选论文清单,按算法、系统与应用三大板块收录了近年所有关键工作。本文基于这份清单,带你一次看懂三种最具代表性的路由策略——Top-k、Expert Choice 与 Hash Layers,并给出横向对比与入门学习路线。
为什么说路由策略是 MoE 的灵魂?
MoE 的核心思想是"稀疏激活":将一个大模型拆成多个专家网络(Expert),由路由器(Router / Gate)为每个输入 token 挑选少数几个专家参与计算。这样既能把参数量做到万亿级,又能保持单次推理的算力开销可控。
路由策略要同时回答三个问题:
1️⃣谁来算:这个 token 交给哪几个专家? 2️⃣算多重的权重:每个专家的输出如何加权合并? 3️⃣怎么不"挤爆":如何避免所有 token 都涌向同一批热门专家,造成负载不均与训练崩溃?
在 README.md 的 Algorithm 板块中,收录了 2017 年至 2022 年间几乎所有路由策略的代表性论文,从经典门控到最新的 Expert Choice 一应俱全,是理解这一领域的最佳地图。
Top-k 路由:经典门控,开启稀疏时代
Top-k 是最早、也是最广为人知的路由策略,思路非常直观:让每个 token 主动去"竞选"专家,得分最高的 k 个专家胜出。
- **2017 年《Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer》**提出了带噪声的 Top-k 稀疏门控,首次把 MoE 层应用到百万级词汇的语言模型上,被视为 MoE 的开山之作,收录于 README.md。
- 2021 年 Switch Transformers将 k 简化到 1(Top-1 路由),用"简化到极致"的思路把稀疏激活模型推向万亿参数,收录于 README.md。
- GShard则采用 Top-2 路由,并引入辅助负载均衡损失,让 token 在专家间的分布更均匀,收录于 README.md。
✅优点:可学习、自适应性强,能根据数据分布动态调整专家分工,理论表达力高。 ❌缺点:负载不均衡是老大难问题;当 token 被路由到的专家过载时,部分 token 会被直接丢弃(Token Dropping),且训练过程对超参数敏感、稳定性欠佳。
Expert Choice 路由:让专家反向挑选 Token
2022 年提出的《Mixture-of-Experts with Expert Choice Routing》(收录于 README.md)彻底反转了决策方向:不再由 token 挑选专家,而是让每个专家反向挑选亲和度最高的 top-k 个 token。
这个看似简单的"换位思考"带来了三个显著收益:
- ✅负载完美均衡:每个专家处理的 token 数量完全一致,无需辅助损失即可消除负载不均;
- ✅零 token 丢弃:所有 token 都会被至少一个专家处理,信息不丢失;
- ✅训练吞吐大幅提升:实验表明训练速度可达传统 Top-1 路由的 2 倍以上。
❌缺点:一个 token 可能被多个专家重复处理,导致"计算放大",因此不适合自回归解码等对实时性要求高的推理场景,更适用于编码器或训练阶段。
Hash Layers 路由:零参数、确定性的"笨办法"
2021 年 NeurIPS 论文《Hash Layers For Large Sparse Models》(收录于 README.md)提供了另一种极致简洁的思路:不学习任何路由参数,直接用哈希函数把 token 的特征(如 token id + 层号)映射到某个专家。
✅优点:
- 完全确定性,可复现、训练极其稳定;
- 无路由参数,省显存、省训练开销;
- 天然避免负载不均衡与 token 丢弃问题。
❌缺点:哈希映射与数据分布无关,不具备自适应性,专家容量利用率与最终精度通常不如可学习路由,更适合作对比基线与大规模基线实验。
三大路由策略横向对比表
| 对比维度 | Top-k 路由 | Expert Choice 路由 | Hash Layers 路由 |
|---|---|---|---|
| 代表论文 | Sparsely-Gated MoE(2017)、Switch(2021) | Expert Choice Routing(2022) | Hash Layers(2021) |
| 决策方向 | Token 选专家 | 专家选 Token | 哈希函数指定 |
| 是否可学习 | ✅ 可学习 | ✅ 可学习 | ❌ 零参数 |
| 负载均衡 | 差,需辅助损失 | 完美均衡 | 天然均衡 |
| Token 丢弃 | 可能发生 | 不会发生 | 不会发生 |
| 训练稳定性 | 较弱 | 强 | 最强 |
| 推理友好度 | 高 | 低(不适用自回归) | 高 |
| 适用场景 | 通用大模型预训练 | 编码器、训练提速 | 基线对比、超大规模扩展 |
一句话总结:要精度选 Top-k,要吞吐选 Expert Choice,要稳定与简单选 Hash Layers。
扩展阅读:还有哪些值得关注的路由研究?
除了三大主流策略,这份清单还收录了不少重要变体,值得顺藤摸瓜:
- BASE Layers(ICML 2021):把路由问题转化为线性分配问题,实现全局最优的负载均衡,见 README.md;
- StableMoE(ACL 2022):提出稳定路由策略,让训练与推理时的路由保持一致,见 README.md;
- DSelect-k(NeurIPS 2021):可微分的专家选择方法,面向多任务学习场景,见 README.md;
- ST-MoE(2022):系统性地解决了稀疏专家模型的训练稳定性与迁移性问题,见 README.md;
- GLaM(2021):Google 的 1.2 万亿参数 MoE 语言模型,展示了稀疏激活在效率上的巨大优势,见 README.md。
结合开源系统的高效学习路线
只看论文还不够,README 末尾的Open-Source System板块(见 README.md)还收录了Tutel、FastMoE、DeepSpeed-MoE、HetuMoE等主流开源实现,建议按以下三步走:
- 入门:精读 Sparsely-Gated MoE(2017)与 Switch Transformers(2021),理解 Top-k 门控与负载均衡损失;
- 进阶:对比 BASE Layers、Hash Layers 与 Expert Choice,亲手复现一张上述对比表;
- 实践:用 Tutel 或 FastMoE 跑一个小规模 MoE 模型,把三种路由策略替换上去,直观感受吞吐与精度的差异。
想本地查阅全部论文条目,只需克隆仓库:
git clone https://gitcode.com/gh_mirrors/aw/Awesome-Mixture-of-Experts-Papers小结
路由策略是 MoE 从"能用"走向"好用"的关键一环:Top-k 奠定了稀疏激活的基础,Expert Choice 用方向反转换来了负载均衡与训练加速,Hash Layers 则以零参数换取了极致的简单与稳定。Awesome-Mixture-of-Experts-Papers 把这一演化脉络完整地收纳在一份清单中,无论你是刚接触 MoE 的新手,还是想跟进最新路由研究的进阶者,都值得把它当作案头的第一份参考资料。
【免费下载链接】Awesome-Mixture-of-Experts-PapersA curated reading list of research in Mixture-of-Experts(MoE).项目地址: https://gitcode.com/gh_mirrors/aw/Awesome-Mixture-of-Experts-Papers
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考