本章小结(第三章)
本章系统性地分析了2024-2025年间AI基础设施领域的顶级会议论文,重点关注LLM推理
优化技术。核心发现包括:
- PD分离成为主流架构:从 DistServe的理论验证到 Mooncake的生产部署, PD分离架构已被证明是提升大规模LLM服务效率的关键技术。
- KV Cache 中心设计:以 KV Cache 为核心的系统架构正在形成, Mooncake 和LMCache等产品推动了这一趋势。
- 分层存储的重要性:,实现了存储与计算的有效权衡。
- 调度算法的精细化:从简单的 FCFS到全局优化的请求调度,调度算法正在变得越来越智能。
- 开源生态的形成:Mooncake、LMCache等项目的开源推动了整个行业的技术进步。对于即将加入Mooncake团队的新人,理解这些技术演进脉络和核心思想,将有助于快速融入团队并为项目做出贡献。
参考文献
- Agrawal, A., et al. (2024). Taming Throughput-Latency Tradeoff in LLM Inference with
Sarathi-Serve. OSDI 2024. - Qin, R., et al. (2025). Mooncake: Trading More Storage for Less Computation. FAST
- Miao, X., et al. (2024). SpecInfer: Accelerating LLM Serving with Tree-based
Speculative Inference. ASPLOS 2024. - Zhong, Y., et al. (2024). DistServe: Disaggregating Prefill and Decoding for Goodput-
optimized LLM Serving. arXiv:2401.09670. - Lee, W., et al. (2024). InfiniGen: Efficient Generative Inference with Dynamic KV
Cache Management. OSDI 2024. - Chen, C., et al. (2024). Centauri: Enabling Efficient Scheduling for Communication-
Computation Overlap. ASPLOS 2024. - Cheng, Y., et al. (2025). LMCache: An Efficient KV Cache Layer for Enterprise-Scale
LLM Inference. arXiv:2510.09665. - Chen, W., et al. (2025). IMPRESS: Importance-Informed Multi-Tier Prefix KV Storage.
FAST 2025. - Kwon, W., et al. (2023). Efficient Memory Management for Large Language Model
Serving with PagedAttention. SOSP 2023.
本章由AI系统领域论文分析专家撰写,旨在帮助Mooncake实习新人快速了解LLM推理优化的前沿技术。