TAG

#StreamingLLM

共 1 篇文章

注意力沉没与流式大模型:如何让无限长文本生成保持稳定

流式大模型在超长对话中常因注意力崩溃而输出混乱,滑动窗口方案虽节省显存却会引发困惑度飙升。本文以对话机器人为场景,解释注意力沉没现象及其成因,分析 StreamingLLM 如何通过保留初始 token 的 KV 缓存来稳定注意力分布,并对比滑动窗口、长度外推等方法的权衡,帮助读者理解在无限长流式生成中保持模型稳定的工程决策。