性能数据和优化效果
6.9.1 请求处理能力提升59%~498%
Mooncake 在不同场景下的性能提升:
| 场景 | 基线吞吐量 | Mooncake吞吐量 | 提升 |
|---|---|---|---|
| 短输入 (1K) | 1000 req/s | 1200 req/s | +20% |
| 中输入 (8K) | 300 req/s | 500 req/s | +67% |
| 长输入 (32K) | 80 req/s | 200 req/s | +150% |
| 超长输入 (128K) | 20 req/s | 100 req/s | +400% |
| 混合负载 | 500 req/s | 1000 req/s | +100% |
测试条件:
- 模型:LLaMA2-70B兼容模型
- 硬件:A800 GPU集群
- 指标:满足SLO的有效吞吐量(Goodput)
6.9.2 A800 上多处理115%请求
在真实生产负载下,Mooncake在A800集群上的表现:
测试方法:
- 使用真实trace数据回放
- 对比基线方法和Mooncake
- 保证相同的SLO要求
结果:
- Mooncake能够处理115%更多的请求
- TTFT和TPOT均满足SLO
- 资源利用率显著提升
6.9.3 H800 上多处理107%请求
在H800集群上的性能表现:
结果:
- Mooncake能够处理107%更多的请求
- 更高的计算密度带来更好的扩展性
- 能效比优于A800
6.9.4 延迟分析
Mooncake 的延迟特性分析:
TTFT ( Time To First Token ):
- 短输入( <1K ): < 100ms
- 中输入( 1K-8K ): 100-500ms
- 长输入(8K-32K):500ms-2s
- 超长输入(>32K):2-10s
TPOT ( Time Per Output Token ):
- 基础延迟: 10-50ms/token
- 受 batch size 影响:batch越大,TPOT越高
- PD分离后:Decode节点专注于TPOT优化
优化效果:
- PD分离使 TTFT和 TPOT可以独立优化
- Prefix Caching显著降低长输入的TTFT
- 异步传输隐藏传输延迟