TAG

#Token丢弃

共 1 篇文章

MoE 专家容量因子与 Token 丢弃:容量溢出如何影响训练质量与推理一致性

训练稀疏 MoE 时,专家容量因子决定每个专家能接收的 token 上限,超出的 token 会被丢弃或经残差绕过。本文以多语言翻译训练为贯穿场景,解释容量因子、负载均衡损失与丢弃率的耦合关系,对比 GShard 与 Switch Transformer 的容量设计,并讨论丢弃对长尾 token 学习、推理期行为差异和可观测指标的影响。