一张卡干不完:看 Token 怎么被切开

8 张卡、2 个节点。逐步看一层:QKV 切片 → AllReduce, 再 MoE Router + All-to-All dispatch / combine + Residual Add,最后 DP 再开一组。 Ring Attention 在 ring_attention.html

STEP 0

8 张卡待命。点下一步,一条请求进 GPU0。

本步算子
集合通信
α–β 模型
Hockney:T = α + n/β。α 是与消息大小无关的 startup latency。
节点 A · NVLink 域
GPU 0
空闲
GPU 1
空闲
GPU 2
空闲
GPU 3
空闲
节点 B · 跨节点要走网卡
GPU 4
空闲
GPU 5
空闲
GPU 6
空闲
GPU 7
空闲
在算 AllReduce(TP) All-to-All dispatch / combine(EP) 热专家,别人在等 DP 组之间几乎不通信