技术对比总结
3.7.1 调度策略对比
| 系统 | 调度粒度 | PD关系 | 核心优化 | 适用场景 |
|---|---|---|---|---|
| vLLM | 迭代级 | 同GPU | Continuous Batching | 通用 |
| Orca | 迭代级 | 同GPU | Iteration-level Scheduling | 通用 |
| FasterTransformer | 请求级 | 同GPU | Decode优先 | 低延迟 |
| Sarathi-Serve | 迭代级 | 融合 | Chunked Prefill | 高吞吐+低延迟 |
| DistServe | 请求级 | 分离 | 独立优化 | 严格SLO |
| Mooncake | 请求级 | 分离 | 全局KV调度 | 大规模部署 |
3.7.2 KV Cache 管理对比
| 系统 | 复用范围 | 存储层级 | 传输优化 | 开源 |
|---|---|---|---|---|
| vLLM Prefix Caching | 单实例 | GPU | - | √ |
| InfiniGen | 单实例 | GPU+CPU | 重要性预取 | √ |
| Mooncake | 全局 | GPU+CPU+SSD+Remote | RDMA+NVLlink | √ |
| LMCache | 全局 | GPU+CPU+SSD+Remote | 流水线+零拷贝 | √ |
| IMPRESS | 全局 | 多层 | 重要性加载 | - |
3.7.3 投机推理对比
| 系统 | Draft方式 | 验证方式 | 额外训练 | 加速比 |
|---|---|---|---|---|
| Speculative Decoding | 小模型 | 序列 | 否 | 1.5-2× |
| SpecInfer | 多drafter | 树形 | 否 | 1.5-2.8× |
| Medusa | 多头解码器 | 并行 | 是 | 2-3× |
| Lookahead | n-gram | 并行 | 否 | 1.3-1.8× |