Skip to content

实际部署案例

6.8.1 Kimi 的底层推理平台

Mooncake是Kimi智能助手的底层推理平台,支撑着数千万用户的日常服务:

部署规模:

  • 数千个GPU节点
  • 每天处理超过1000亿token
  • 支持超长上下文(200万汉字)

架构特点:

latex
┌─────────────────────────────────────────────────────────────────┐
│                         Kimi推理平台架构                       │
├─────────────────────────────────────────────────────────────────┤
│                                                                 │
│     ┌─────────────────────────────────────────────────────────┐ │
│     │                     接入层                               │ │
│     │           Load Balancer + API Gateway                    │ │
│     └─────────────────────────────────────────────────────────┘ │
│                                      │                         │
│                                      ▼                         │
│     ┌─────────────────────────────────────────────────────────┐ │
│     │                   Conductor (全局调度器)                │ │
│     │    - 请求路由                                            │ │
│     │    - KV Cache 感知调度                                   │ │
│     │    - SLO 保证                                            │ │
│     │    - 预测性早期拒绝                                       │ │
│     └─────────────────────────────────────────────────────────┘ │
│                                 │                            │
│              ┌──────────────────┼──────────────────┐           │
│              ▼                  ▼                  ▼          │
│     ┌─────────────┐     ┌─────────────┐       ┌─────────────┐   │
│     │ Prefill     │     │ Decode      │       │ Mooncake    │   │
│     │ Pool        │     │ Pool        │       │ Store       │   │
│     │ (A800/H800) │     │ (A800/H800) │       │ (DRAM/SSD)  │   │
│     └─────────────┘     └─────────────┘       └─────────────┘   │
│                                                                 │
└─────────────────────────────────────────────────────────────────┘

6.8.2 数千节点规模

Mooncake在Kimi生产环境中部署的规模:

集群规模:

  • GPU 节点:数千台
  • GPU 型号: NVIDIA A800 、 H800 、 H200
  • 网络:InfiniBand + RDMA

资源池化:

  • GPU HBM:用于活跃 KV Cache
  • CPU DRAM:用于温数据缓存
  • NVMeSSD:用于冷数据存储
  • RDMA网络:用于高速数据传输

6.8.3 每天1000亿token

Mooncake 处理的生产负载:

流量特征:

  • 日均 token处理量: 1000亿 +
  • 峰值 QPS:数万
  • 平均上下文长度:数万token
  • 最大上下文长度:200万汉字

负载特点:

  • 高度异质性:输入长度从几十到数百万token
  • 突发流量:存在明显的峰值和低谷 - 长上下文占比高:大量文档分析、代码理解任务

6.8.4 A800/H800 集群性能

Mooncake在不同GPU集群上的性能表现:

A800 集群:

  • 相比上一代系统,多处理 115% 的请求
  • 在长上下文场景下,吞吐量提升59%~498%

H800集群:

  • 相比上一代系统,多处理107%的请求
  • 更高的计算密度,更好的能效比

H200集群( Kimi K2部署):

  • 128 H200 GPU
  • Prefill吞吐量: 224k tokens/sec
  • Decode吞吐量:288k tokens/sec

用心记录,持续成长