用动画讲清 LLM 推理引擎里的机制——RadixAttention、Continuous Batching、PD 分离、推测解码与并行。
配合 zero-to-sglang:先看动画,再读正文。浏览器打开即可,不用 GPU。
请求从入口到返回:经过哪些模块,KV 放哪。
打开 → 2 · 连续批 如何平衡长短请求的处理速度短请求常被长 Prefill 堵住。对比静态批、Continuous Batching、chunk。
打开 → 3 · Paged KV 如何改进attn减少显存碎片按最长序列占满显存浪费大。看逻辑块如何映射到物理页。
打开 → 4 · KV 调度 如何调度KV优化显存占用分页后仍可能装不下。对比 Swap 到 CPU,与 Recompute 再算。
打开 → 5 · Radix Prefill如何复用前缀减少重算前缀相同却重复算。看前缀树如何命中、拆开、淘汰。
打开 → 6 · 推测解码 Decode如何一次猜多token普通 Decode 一次一个 token。看 draft 先猜再校验,一步收下多个。
打开 →权重一张卡装不下时怎么切(TP),以及 DP / EP 各管什么。
打开 → 8 · PD 分离 Prefill 与 Decode如何高效配合Prefill 与 Decode 分到不同机器,KV 怎么交接。
打开 → 9 · 路由 如何调度多组PD改善性能多组 Prefill / Decode,请求如何动态调度改善整体性能。
打开 → 10 · Ring / CP 如何增加上下文能力上下文单卡放不下时,KV 如何环传、注意力如何分段算。
打开 → 11 · 部署 集群部署的整体结构集群里服务怎么布局,Mooncake 全局 KV 怎么接入。
打开 →主线按上面 1→11 看。若你在跟 zero-to-sglang,可以用 README 里的章节对照跳到对应动画;对照表不当学习顺序。
完整映射见 README · 课程映射。
建议:先把「一、单机」看完,再进「二、拆开与集群」。 许可 CC BY-NC-SA 4.0。