注意力头剪枝:为什么删除部分注意力头反而能提升模型性能?
本文以机器翻译模型压缩为场景,解释注意力头剪枝如何通过识别冗余头减少计算量,分析剪枝后性能提升的机制,对比结构化剪枝与稀疏剪枝,讨论推理部署中的收益与风险。
共 5 篇文章
本文以机器翻译模型压缩为场景,解释注意力头剪枝如何通过识别冗余头减少计算量,分析剪枝后性能提升的机制,对比结构化剪枝与稀疏剪枝,讨论推理部署中的收益与风险。
本文以企业知识库问答为场景,分析 Transformer 中检索头(Retrieval Heads)的机制:它们如何通过注意力模式从长上下文中提取信息,与普通注意力头的差异,以及如何通过头消融实验验证其功能。同时讨论在 RAG 和长上下文模型中的应用与局限性。
围绕在线大模型推理中的固定深度计算开销,解释 Mixture-of-Depths 如何用固定容量路由让部分 Token 跳过 Transformer Block,并分析它与 MoE、Early Exit、KV Cache、Gather/Scatter 和 GPU 规则计算之间的工程权衡。
从 Self-Attention 不具备天然顺序感这一问题出发,解释 RoPE 如何通过旋转 Query 和 Key 注入位置关系,并梳理 Position Interpolation、YaRN、LongRoPE 等上下文扩展方法的机制、工程边界与长文本系统中的真实瓶颈。
从 GPU 内存层级与 Attention 中间矩阵的数据流出发,解释 FlashAttention 如何通过分块计算、online softmax 和片上数据复用减少 HBM 读写,并分析 FlashAttention-2、长上下文训练、prefill 与逐 Token 解码中的实际收益和工程边界。