Skip to content

技术对比总结

3.7.1 调度策略对比

系统调度粒度PD关系核心优化适用场景
vLLM迭代级同GPUContinuous Batching通用
Orca迭代级同GPUIteration-level Scheduling通用
FasterTransformer请求级同GPUDecode优先低延迟
Sarathi-Serve迭代级融合Chunked Prefill高吞吐+低延迟
DistServe请求级分离独立优化严格SLO
Mooncake请求级分离全局KV调度大规模部署

3.7.2 KV Cache 管理对比

系统复用范围存储层级传输优化开源
vLLM Prefix Caching单实例GPU-
InfiniGen单实例GPU+CPU重要性预取
Mooncake全局GPU+CPU+SSD+RemoteRDMA+NVLlink
LMCache全局GPU+CPU+SSD+Remote流水线+零拷贝
IMPRESS全局多层重要性加载-

3.7.3 投机推理对比

系统Draft方式验证方式额外训练加速比
Speculative Decoding小模型序列1.5-2×
SpecInfer多drafter树形1.5-2.8×
Medusa多头解码器并行2-3×
Lookaheadn-gram并行1.3-1.8×

用心记录,持续成长