llm-engine-viz

用动画讲清 LLM 推理引擎里的机制——RadixAttention、Continuous Batching、PD 分离、推测解码与并行。

配合 zero-to-sglang:先看动画,再读正文。浏览器打开即可,不用 GPU。

一、单机:请求进来之后怎么越跑越快

1 · 全链路 请求怎么走

请求从入口到返回:经过哪些模块,KV 放哪。

打开 →
2 · 连续批 如何平衡长短请求的处理速度

短请求常被长 Prefill 堵住。对比静态批、Continuous Batching、chunk。

打开 →
3 · Paged KV 如何改进attn减少显存碎片

按最长序列占满显存浪费大。看逻辑块如何映射到物理页。

打开 →
4 · KV 调度 如何调度KV优化显存占用

分页后仍可能装不下。对比 Swap 到 CPU,与 Recompute 再算。

打开 →
5 · Radix Prefill如何复用前缀减少重算

前缀相同却重复算。看前缀树如何命中、拆开、淘汰。

打开 →
6 · 推测解码 Decode如何一次猜多token

普通 Decode 一次一个 token。看 draft 先猜再校验,一步收下多个。

打开 →

二、机器不够:拆卡、拆 Prefill/Decode、上集群

7 · 并行 权重一张卡装不下

权重一张卡装不下时怎么切(TP),以及 DP / EP 各管什么。

打开 →
8 · PD 分离 Prefill 与 Decode如何高效配合

Prefill 与 Decode 分到不同机器,KV 怎么交接。

打开 →
9 · 路由 如何调度多组PD改善性能

多组 Prefill / Decode,请求如何动态调度改善整体性能。

打开 →
10 · Ring / CP 如何增加上下文能力

上下文单卡放不下时,KV 如何环传、注意力如何分段算。

打开 →
11 · 部署 集群部署的整体结构

集群里服务怎么布局,Mooncake 全局 KV 怎么接入。

打开 →
按课程章节找页面(对照表)

主线按上面 1→11 看。若你在跟 zero-to-sglang,可以用 README 里的章节对照跳到对应动画;对照表不当学习顺序。

完整映射见 README · 课程映射

建议:先把「一、单机」看完,再进「二、拆开与集群」。 许可 CC BY-NC-SA 4.0