AI 推理系列(十):MLA 如何用低秩压缩重构 KV Cache:从 DeepSeek-V2 到 FlashMLA
围绕长上下文推理中的 KV Cache 容量与带宽瓶颈,解释 Multi-head Latent Attention 如何通过低秩 KV 联合压缩只缓存潜在表示,并分析 Decoupled RoPE、GQA/量化差异、Kernel 融合以及训练与推理路径中的工程权衡。
共 1 篇文章
围绕长上下文推理中的 KV Cache 容量与带宽瓶颈,解释 Multi-head Latent Attention 如何通过低秩 KV 联合压缩只缓存潜在表示,并分析 Decoupled RoPE、GQA/量化差异、Kernel 融合以及训练与推理路径中的工程权衡。