KV Cache 量化如何压缩长上下文推理:从 KIVI 到混合精度缓存
围绕长上下文和高并发推理中的显存瓶颈,解释 KV Cache 量化为何需要区别处理 Key 与 Value,分析 KIVI、KVQuant 等方案的量化粒度、离群值处理与运行时开销,并讨论它与 GQA、PagedAttention、Prefix Caching 的组合边界。
共 1 篇文章
围绕长上下文和高并发推理中的显存瓶颈,解释 KV Cache 量化为何需要区别处理 Key 与 Value,分析 KIVI、KVQuant 等方案的量化粒度、离群值处理与运行时开销,并讨论它与 GQA、PagedAttention、Prefix Caching 的组合边界。