WIBLOG · Technological & Life

聊技术,也聊那些值得认真琢磨的生活小事。

131篇文章6个内容分类
RECENT NOTES

最近更新

查看归档

G1 GC 字符串去重:哈希表维护与并发去重的性能边界

本文聚焦 G1 GC 的字符串去重功能,解释其如何通过共享字符数组降低堆内存占用,并分析并发去重线程与 SATB 的交互、哈希表维护机制,以及 -XX:+UseStringDeduplication 和 -XX:StringDeduplicationAgeThreshold 参数。读者将获得根据内存收益和 CPU 开销决定是否启用去重的判断方法。

CUDA Graph 如何消除大模型推理中的 Kernel 启动开销

本文以在线大模型服务为场景,深入解析 CUDA Graph 通过捕获并重放 GPU Kernel 序列来减少 CPU 启动开销和内核间延迟的机制。文章分析了其与动态形状、批处理大小变化、PagedAttention 等技术的兼容性,讨论了捕获成本、内存占用和适用边界,并通过对比表格和流程图帮助读者理解何时使用 CUDA Graph 能获得显著收益。

KV Cache 驱逐策略:H2O 如何通过注意力分数识别重要 Token 并压缩缓存

长上下文在线服务中,KV Cache 随序列长度线性增长,成为显存瓶颈。本文聚焦 H2O 方法,解释其如何基于注意力分数识别 Heavy Hitter Token 并动态驱逐低价值 KV 对,对比 LRU、StreamingLLM 等策略,分析对生成质量、显存与延迟的影响,并讨论适用边界与实现复杂度。

查看全部文章 ↗