技术演进脉络分析
3.6.1 从Colocation到Disaggregation
3.6.2 KV Cache 管理技术的演进
latex
2023: PagedAttention (vLLM)
├─ 解决KV Cache内存碎片问题
├─ 页面化管理,动态分配
└─ 局限:单实例内管理,无法跨请求复用
2024.01: Prefix Caching (vLLM v0.3+)
├─ 支持相同prompt前缀的KV复用
├─ 减少重复计算
└─ 局限:仅在GPU内存中,容量有限
2024.06: Mooncake Global KV Pool
├─ 跨实例、跨请求的KV复用
├─ 分层存储:GPU → CPU → SSD → Remote
└─ 全局调度器优化KV位置
2024.06: InfiniGen
├─ 重要性感知的KV管理
├─ 只加载重要token的KV
└─ 长文本场景优化
2025.02: IMPRESS
├─ 重要性感知的多层存储
├─ 磁盘存储时优先加载重要KV
└─ 降低TTFT
2025.10: LMCache
├─ 企业级KV Cache层
├─ 多引擎支持(vLLM, SGLang)
└─ 开源生态3.6.3 投机推理技术的演进
latex
2022: Speculative Decoding
├─ 小模型生成 + 大模型验证
├─ 序列方式逐个验证
└─ 加速比受限于接受率
2023.05: SpecInfer
├─ 树形验证机制
├─ 单次验证多个候选token
└─ 加速比1.5-2.8×
2023.09: Medusa
├─ 训练多头解码器
├─ 无需额外小模型
└─ 加速比2-3×
2024: Lookahead Decoding, EAGLE
├─ 更高效的draft策略
├─ 更准确的候选生成
└─ 持续优化中