Skip to content

本章小结(第三章)

本章系统性地分析了2024-2025年间AI基础设施领域的顶级会议论文,重点关注LLM推理

优化技术。核心发现包括:

  1. PD分离成为主流架构:从 DistServe的理论验证到 Mooncake的生产部署, PD分离架构已被证明是提升大规模LLM服务效率的关键技术。
  2. KV Cache 中心设计:以 KV Cache 为核心的系统架构正在形成, Mooncake 和LMCache等产品推动了这一趋势。
  3. 分层存储的重要性,实现了存储与计算的有效权衡。
  4. 调度算法的精细化:从简单的 FCFS到全局优化的请求调度,调度算法正在变得越来越智能。
  5. 开源生态的形成:Mooncake、LMCache等项目的开源推动了整个行业的技术进步。对于即将加入Mooncake团队的新人,理解这些技术演进脉络和核心思想,将有助于快速融入团队并为项目做出贡献。

参考文献

  1. Agrawal, A., et al. (2024). Taming Throughput-Latency Tradeoff in LLM Inference with
    Sarathi-Serve. OSDI 2024.
  2. Qin, R., et al. (2025). Mooncake: Trading More Storage for Less Computation. FAST
  3. Miao, X., et al. (2024). SpecInfer: Accelerating LLM Serving with Tree-based
    Speculative Inference. ASPLOS 2024.
  4. Zhong, Y., et al. (2024). DistServe: Disaggregating Prefill and Decoding for Goodput-
    optimized LLM Serving. arXiv:2401.09670.
  5. Lee, W., et al. (2024). InfiniGen: Efficient Generative Inference with Dynamic KV
    Cache Management. OSDI 2024.
  6. Chen, C., et al. (2024). Centauri: Enabling Efficient Scheduling for Communication-
    Computation Overlap. ASPLOS 2024.
  7. Cheng, Y., et al. (2025). LMCache: An Efficient KV Cache Layer for Enterprise-Scale
    LLM Inference. arXiv:2510.09665.
  8. Chen, W., et al. (2025). IMPRESS: Importance-Informed Multi-Tier Prefix KV Storage.
    FAST 2025.
  9. Kwon, W., et al. (2023). Efficient Memory Management for Large Language Model
    Serving with PagedAttention. SOSP 2023.

本章由AI系统领域论文分析专家撰写,旨在帮助Mooncake实习新人快速了解LLM推理优化的前沿技术。

用心记录,持续成长