Prefill-Decode 分离:为何将长提示词计算与生成计算拆分到不同实例能提升在线服务吞吐
在线大模型服务中,预填充与解码阶段在资源需求上差异显著,混合部署常导致GPU利用率失衡与延迟不稳定。本文以企业知识库问答为场景,解析PD分离架构如何将两阶段分配到不同实例,消除相互干扰,并讨论KV Cache传输、调度策略、适用边界及与未分离方案的权衡。
共 3 篇文章
在线大模型服务中,预填充与解码阶段在资源需求上差异显著,混合部署常导致GPU利用率失衡与延迟不稳定。本文以企业知识库问答为场景,解析PD分离架构如何将两阶段分配到不同实例,消除相互干扰,并讨论KV Cache传输、调度策略、适用边界及与未分离方案的权衡。
在线聊天服务中,静态批处理因输出长度差异导致GPU利用率低下。本文以聊天场景贯穿,解释连续批处理如何通过迭代级调度动态加入和完成请求,分析其对TTFT和TPOT的影响,并讨论最大批大小、队列策略等参数如何权衡吞吐与延迟,以及适用边界。
本文以在线大模型服务为场景,深入解析 CUDA Graph 通过捕获并重放 GPU Kernel 序列来减少 CPU 启动开销和内核间延迟的机制。文章分析了其与动态形状、批处理大小变化、PagedAttention 等技术的兼容性,讨论了捕获成本、内存占用和适用边界,并通过对比表格和流程图帮助读者理解何时使用 CUDA Graph 能获得显著收益。