Skip to content

性能数据和优化效果

6.9.1 请求处理能力提升59%~498%

Mooncake 在不同场景下的性能提升:

场景基线吞吐量Mooncake吞吐量提升
短输入 (1K)1000 req/s1200 req/s+20%
中输入 (8K)300 req/s500 req/s+67%
长输入 (32K)80 req/s200 req/s+150%
超长输入 (128K)20 req/s100 req/s+400%
混合负载500 req/s1000 req/s+100%

测试条件:

  • 模型:LLaMA2-70B兼容模型
  • 硬件:A800 GPU集群
  • 指标:满足SLO的有效吞吐量(Goodput)

6.9.2 A800 上多处理115%请求

在真实生产负载下,Mooncake在A800集群上的表现:

测试方法:

  • 使用真实trace数据回放
  • 对比基线方法和Mooncake
  • 保证相同的SLO要求

结果:

  • Mooncake能够处理115%更多的请求
  • TTFT和TPOT均满足SLO
  • 资源利用率显著提升

6.9.3 H800 上多处理107%请求

在H800集群上的性能表现:

结果:

  • Mooncake能够处理107%更多的请求
  • 更高的计算密度带来更好的扩展性
  • 能效比优于A800

6.9.4 延迟分析

Mooncake 的延迟特性分析:

TTFT ( Time To First Token ):

  • 短输入( <1K ): < 100ms
  • 中输入( 1K-8K ): 100-500ms
  • 长输入(8K-32K):500ms-2s
  • 超长输入(>32K):2-10s

TPOT ( Time Per Output Token ):

  • 基础延迟: 10-50ms/token
  • 受 batch size 影响:batch越大,TPOT越高
  • PD分离后:Decode节点专注于TPOT优化

优化效果:

  • PD分离使 TTFT和 TPOT可以独立优化
  • Prefix Caching显著降低长输入的TTFT
  • 异步传输隐藏传输延迟

用心记录,持续成长