WIBLOG · Technological & Life

聊技术,也聊那些值得认真琢磨的生活小事。

127篇文章6个内容分类
RECENT NOTES

最近更新

查看归档

KV Cache 驱逐策略:H2O 如何通过注意力分数识别重要 Token 并压缩缓存

长上下文在线服务中,KV Cache 随序列长度线性增长,成为显存瓶颈。本文聚焦 H2O 方法,解释其如何基于注意力分数识别 Heavy Hitter Token 并动态驱逐低价值 KV 对,对比 LRU、StreamingLLM 等策略,分析对生成质量、显存与延迟的影响,并讨论适用边界与实现复杂度。

第三方脚本如何阻塞主线程:解析器阻塞与长任务对 Core Web Vitals 的影响

本文以新闻门户页面为例,分析第三方脚本如何通过阻塞 HTML 解析、执行长任务和占用网络带宽,拖慢 LCP 与 TBT。文章将解释 async/defer 的局限,并比较按需加载、iframe 隔离、资源提示等缓解措施的收益与代价,帮助开发者做出有依据的工程决策。

DeepSeek-V3 的多 Token 预测:额外预测头如何提升训练效率并支持投机解码

本文以训练 DeepSeek-V3 为场景,解析多 Token 预测(MTP)的机制:如何通过串行预测头让模型同时学习多个未来 token,共享嵌入与输出头以控制开销,并在推理时用于投机解码。文章对比 MTP 与单 Token 预测、并行多头方案,分析其样本效率、推理加速收益及实现复杂度。

查看全部文章 ↗