WIBLOG · Technological & Life

聊技术,也聊那些值得认真琢磨的生活小事。

136篇文章6个内容分类
RECENT NOTES

最近更新

查看归档

CSS content-visibility 如何跳过离屏渲染:长商品列表滚动不再卡顿的机制与边界

本文以长商品列表为例,解析 content-visibility 如何通过布局、样式、绘制包含与交集观察跳过离屏元素的渲染,从而降低初始渲染与滚动时的布局绘制成本。同时说明它与 contain 的区别、auto 的失效条件、对滚动条和可访问性的影响,以及何时应该使用。

提示注入如何穿透 RAG 检索上下文:从间接注入到防御性提示的失效边界

本文以企业知识库问答为场景,剖析间接提示注入如何通过检索到的文档内容劫持模型行为,对比其与直接注入的差异,拆解攻击载荷的构造原理,并解释提示隔离、输入过滤、权限控制等现有防御为何失效,最后给出可操作的检测与缓解策略。

Cordis 的时空可组合机制:以 DeepSeek Harness 为例解析插件化 Agent 运行时

本文以 DeepSeek Harness 作为贯穿案例,解析 Cordis 元框架如何通过共享 context、插件、可逆 effects、reactive coeffects、服务注册、事件和配置组合实现空间与时间组合。文章区分了 Cordis 通用机制、Harness 已实现内容和合理推断,并通过对比表格与 Mermaid 流程图展示一次代码任务中数据与状态的流动,以及可逆 effect 在卸载、热更新、错误恢复中的价值。

G1 GC 字符串去重:哈希表维护与并发去重的性能边界

本文聚焦 G1 GC 的字符串去重功能,解释其如何通过共享字符数组降低堆内存占用,并分析并发去重线程与 SATB 的交互、哈希表维护机制,以及 -XX:+UseStringDeduplication 和 -XX:StringDeduplicationAgeThreshold 参数。读者将获得根据内存收益和 CPU 开销决定是否启用去重的判断方法。

CUDA Graph 如何消除大模型推理中的 Kernel 启动开销

本文以在线大模型服务为场景,深入解析 CUDA Graph 通过捕获并重放 GPU Kernel 序列来减少 CPU 启动开销和内核间延迟的机制。文章分析了其与动态形状、批处理大小变化、PagedAttention 等技术的兼容性,讨论了捕获成本、内存占用和适用边界,并通过对比表格和流程图帮助读者理解何时使用 CUDA Graph 能获得显著收益。

查看全部文章 ↗