KV Cache 驱逐策略:从 LRU 到 H2O 的注意力感知淘汰机制
长上下文在线服务中,KV Cache 随序列增长迅速膨胀,成为显存与延迟瓶颈。本文以企业知识库问答为场景,对比 LRU、滑动窗口与 H2O 等驱逐策略,解释注意力感知淘汰为何更有效,分析其对生成质量、显存和延迟的影响,并讨论适用边界与实现复杂度。
共 1 篇文章
长上下文在线服务中,KV Cache 随序列增长迅速膨胀,成为显存与延迟瓶颈。本文以企业知识库问答为场景,对比 LRU、滑动窗口与 H2O 等驱逐策略,解释注意力感知淘汰为何更有效,分析其对生成质量、显存和延迟的影响,并讨论适用边界与实现复杂度。