MoE 专家并行的 All-to-All 通信瓶颈:专家越多推理延迟为何反而上升
多卡部署稀疏 MoE 时,专家数量增加并不总带来延迟下降。文章以在线推理服务为场景,拆解 token 经 All-to-All 分发与回收的过程,分析跨卡通信量、负载不均和容量因子如何抵消稀疏计算收益,并给出可观测指标与调优边界。
共 1 篇文章
多卡部署稀疏 MoE 时,专家数量增加并不总带来延迟下降。文章以在线推理服务为场景,拆解 token 经 All-to-All 分发与回收的过程,分析跨卡通信量、负载不均和容量因子如何抵消稀疏计算收益,并给出可观测指标与调优边界。