Skip to content

技术演进脉络分析

3.6.1 从Colocation到Disaggregation

3.6.2 KV Cache 管理技术的演进

latex
  2023: PagedAttention (vLLM)
  ├─ 解决KV Cache内存碎片问题
  ├─ 页面化管理,动态分配
  └─ 局限:单实例内管理,无法跨请求复用


  2024.01: Prefix Caching (vLLM v0.3+)
  ├─ 支持相同prompt前缀的KV复用
  ├─ 减少重复计算
  └─ 局限:仅在GPU内存中,容量有限


  2024.06: Mooncake Global KV Pool
  ├─ 跨实例、跨请求的KV复用
  ├─ 分层存储:GPU → CPU → SSD → Remote
  └─ 全局调度器优化KV位置


  2024.06: InfiniGen
  ├─ 重要性感知的KV管理
  ├─ 只加载重要token的KV
  └─ 长文本场景优化


  2025.02: IMPRESS
  ├─ 重要性感知的多层存储
  ├─ 磁盘存储时优先加载重要KV
  └─ 降低TTFT


  2025.10: LMCache
  ├─ 企业级KV Cache层
  ├─ 多引擎支持(vLLM, SGLang)
  └─ 开源生态

3.6.3 投机推理技术的演进

latex
  2022: Speculative Decoding
  ├─ 小模型生成 + 大模型验证
  ├─ 序列方式逐个验证
  └─ 加速比受限于接受率


  2023.05: SpecInfer
  ├─ 树形验证机制
  ├─ 单次验证多个候选token
  └─ 加速比1.5-2.8×


  2023.09: Medusa
  ├─ 训练多头解码器
  ├─ 无需额外小模型
  └─ 加速比2-3×


  2024: Lookahead Decoding, EAGLE
  ├─ 更高效的draft策略
  ├─ 更准确的候选生成
  └─ 持续优化中

用心记录,持续成长