AI Infra 入门到前沿
面向工程师的 AI 基础设施学习笔记:从 GPU/网络/存储基础,到 LLM 训练与推理、PD 分离、KV Cache、Mooncake 与 AI Serving Stack、核心算法与技术图表。
开篇
第一章:AI 基础设施(AI Infra)基础入门
第二章:LLM 训练与推理基础
第三章:AI Infra 最新前沿论文分析(2024-2025)
- 引言:LLM 推理优化的核心挑战
- OSDI 2024 论文深度分析
- FAST 2025 最佳论文:Mooncake 深度解析
- ASPLOS 2024 论文深度分析
- 其他重要工作
- 技术演进脉络分析
- 技术对比总结
- 对 Mooncake 实习新人的建议
- 本章小结(第三章)
第四章:Prefill-Decode (PD) 分离技术详解
- 为什么需要 PD 分离
- PD 分离的基本架构
- Chunked Prefill vs PD Disaggregation
- Mooncake 的 PD 分离实现
- vLLM Disaggregated Prefilling
- DistServe 的设计
- PD 分离中的 KV Cache 传输优化
- 调度策略和负载均衡
- 实际部署的挑战和解决方案
- 总结与展望(第四章)
第五章:KV Cache 存储与网络传输优化
- KV Cache 的基本原理
- KV Cache 的内存占用分析
- PagedAttention 机制
- Prefix Caching 技术
- KV Cache 的压缩和量化
- 分层存储架构
- KV Cache 的网络传输优化
- Mooncake KV Cache-centric 架构
- LMCache 的设计
- InfiniStore 等 KV Cache 存储系统
- 最佳实践与优化建议
- 本章小结(第五章)