2026/8/14 20:13:49 MoE 框架(如 DeepSpeed-MoE、Megatron-LM、vLLM 或 Triton 自定义 Kernel)在底层 GPU 显存和通信层面的完整生命周期
1. 为什么需要“计数、排序、Prefix Sum、Permute”?
在做 Dispatch 通信之前,显存里的向量是按原始 Token 顺序(t0,t1,t2...t_0, t_1, t_2...t0,t1,t2...)乱序排列的。GPU 无法高效传输这种不连续的数据,所以必…