vLLM 多 LoRA 适配器混批解码:Punica 内核、批内碎片与吞吐下降
在线服务同时托管多个 LoRA 适配器时,把不同适配器的请求混进同一批为什么反而拖慢解码?文章从 vLLM 的 LoRA 请求路由、Punica 分组内核与 max_loras 显存预留讲起,分析适配器数量增长带来的批内碎片,并给出可观测指标、失败模式与部署边界。
共 1 篇文章
在线服务同时托管多个 LoRA 适配器时,把不同适配器的请求混进同一批为什么反而拖慢解码?文章从 vLLM 的 LoRA 请求路由、Punica 分组内核与 max_loras 显存预留讲起,分析适配器数量增长带来的批内碎片,并给出可观测指标、失败模式与部署边界。