实际部署案例
6.8.1 Kimi 的底层推理平台
Mooncake是Kimi智能助手的底层推理平台,支撑着数千万用户的日常服务:
部署规模:
- 数千个GPU节点
- 每天处理超过1000亿token
- 支持超长上下文(200万汉字)
架构特点:
latex
┌─────────────────────────────────────────────────────────────────┐
│ Kimi推理平台架构 │
├─────────────────────────────────────────────────────────────────┤
│ │
│ ┌─────────────────────────────────────────────────────────┐ │
│ │ 接入层 │ │
│ │ Load Balancer + API Gateway │ │
│ └─────────────────────────────────────────────────────────┘ │
│ │ │
│ ▼ │
│ ┌─────────────────────────────────────────────────────────┐ │
│ │ Conductor (全局调度器) │ │
│ │ - 请求路由 │ │
│ │ - KV Cache 感知调度 │ │
│ │ - SLO 保证 │ │
│ │ - 预测性早期拒绝 │ │
│ └─────────────────────────────────────────────────────────┘ │
│ │ │
│ ┌──────────────────┼──────────────────┐ │
│ ▼ ▼ ▼ │
│ ┌─────────────┐ ┌─────────────┐ ┌─────────────┐ │
│ │ Prefill │ │ Decode │ │ Mooncake │ │
│ │ Pool │ │ Pool │ │ Store │ │
│ │ (A800/H800) │ │ (A800/H800) │ │ (DRAM/SSD) │ │
│ └─────────────┘ └─────────────┘ └─────────────┘ │
│ │
└─────────────────────────────────────────────────────────────────┘6.8.2 数千节点规模
Mooncake在Kimi生产环境中部署的规模:
集群规模:
- GPU 节点:数千台
- GPU 型号: NVIDIA A800 、 H800 、 H200
- 网络:InfiniBand + RDMA
资源池化:
- GPU HBM:用于活跃 KV Cache
- CPU DRAM:用于温数据缓存
- NVMeSSD:用于冷数据存储
- RDMA网络:用于高速数据传输
6.8.3 每天1000亿token
Mooncake 处理的生产负载:
流量特征:
- 日均 token处理量: 1000亿 +
- 峰值 QPS:数万
- 平均上下文长度:数万token
- 最大上下文长度:200万汉字
负载特点:
- 高度异质性:输入长度从几十到数百万token
- 突发流量:存在明显的峰值和低谷 - 长上下文占比高:大量文档分析、代码理解任务
6.8.4 A800/H800 集群性能
Mooncake在不同GPU集群上的性能表现:
A800 集群:
- 相比上一代系统,多处理 115% 的请求
- 在长上下文场景下,吞吐量提升59%~498%
H800集群:
- 相比上一代系统,多处理107%的请求
- 更高的计算密度,更好的能效比
H200集群( Kimi K2部署):
- 128 H200 GPU
- Prefill吞吐量: 224k tokens/sec
- Decode吞吐量:288k tokens/sec