KV Cache 量化如何压缩长上下文推理:从 KIVI 到混合精度缓存
围绕长上下文和高并发推理中的显存瓶颈,解释 KV Cache 量化为何需要区别处理 Key 与 Value,分析 KIVI、KVQuant 等方案的量化粒度、离群值处理与运行时开销,并讨论它与 GQA、PagedAttention、Prefix Caching 的组合边界。
共 2 篇文章
围绕长上下文和高并发推理中的显存瓶颈,解释 KV Cache 量化为何需要区别处理 Key 与 Value,分析 KIVI、KVQuant 等方案的量化粒度、离群值处理与运行时开销,并讨论它与 GQA、PagedAttention、Prefix Caching 的组合边界。
从 GPU 内存层级与 Attention 中间矩阵的数据流出发,解释 FlashAttention 如何通过分块计算、online softmax 和片上数据复用减少 HBM 读写,并分析 FlashAttention-2、长上下文训练、prefill 与逐 Token 解码中的实际收益和工程边界。