TAG

#Attention Sink

共 2 篇文章

注意力沉没 Token 的数值离群:低比特 KV Cache 量化为何在首 Token 上误差最大

长上下文在线推理中,逐 Token 均匀量化 KV Cache 往往在首 Token 附近误差最大。文章从 Attention Sink 与极端激活离群出发,解释 Key 向量为何在首 Token 出现数值尖峰,比较离群通道保留、分组量化与混合精度三种处理方式,并给出可观测指标与失效边界。

AI 推理系列(十二):Attention Sink——为什么删除最早几个 Token,会让大模型突然“失忆”?

围绕长期 Agent 与流式推理中 KV Cache 持续增长的问题,解释 Attention Sink 为何使纯滑动窗口在删除初始 Token 后出现质量退化,以及 StreamingLLM 如何保留少量 Sink Token 与最近窗口,在固定缓存预算下持续处理数据流,并分析它与真正长上下文和长期记忆的边界。