TAG

#分布式训练

共 1 篇文章

环注意力机制:分布式长序列训练中的通信与计算重叠

当序列长度超出单卡显存时,如何在不引入近似误差的前提下训练超长上下文模型?本文以训练百万级 token 的 Transformer 为场景,分析 Ring Attention 如何将序列维度分片到多个设备,通过环形通信与分块计算的重叠实现线性扩展。文章从标准自注意力的内存瓶颈出发,逐步拆解在线 softmax、KV 块环传与计算-通信流水线,并对比序列并行、Ulysses 等替代方案,讨论负载均衡、通信拓扑与部署边界。