MoE 路由的 z-loss 与 logit 钳制:路由器 logits 爆炸如何引发专家塌缩
稀疏 MoE 训练常在数千步后突然发散,根源往往不是任务本身,而是路由器 logits 数值膨胀导致 softmax 饱和、梯度消失与专家塌缩。文章以在线多语言训练服务为贯穿场景,解释 z-loss 如何惩罚 logits、logit 钳制与 float32 路由器精度各自修正了什么,并对比仅用负载均衡损失的方案。
共 2 篇文章
稀疏 MoE 训练常在数千步后突然发散,根源往往不是任务本身,而是路由器 logits 数值膨胀导致 softmax 饱和、梯度消失与专家塌缩。文章以在线多语言训练服务为贯穿场景,解释 z-loss 如何惩罚 logits、logit 钳制与 float32 路由器精度各自修正了什么,并对比仅用负载均衡损失的方案。
围绕大规模 MoE 模型的专家路由机制,解释 Token 如何通过 Top-K Router 只激活少量专家,并分析负载均衡、Shared Expert、Expert Parallelism、All-to-All 通信以及真实推理流量下的热点与部署边界。