导言
DeepEP V2 把 MoE 的高吞吐与低延迟通信统一到 ElasticBuffer。V2.5 又改了什么?我关心的不是版本号多了半级,而是它把一个越来越通用的通信缓冲拆成了各司其职的接口,并补上冗余专家与批量集合通信所需的原语。本文沿一次 MoE 计算的前后顺序解释这些变化,也给出迁移时要检查的条件。
导言
DeepEP V2 把 MoE 的高吞吐与低延迟通信统一到 ElasticBuffer。V2.5 又改了什么?我关心的不是版本号多了半级,而是它把一个越来越通用的通信缓冲拆成了各司其职的接口,并补上冗余专家与批量集合通信所需的原语。本文沿一次 MoE 计算的前后顺序解释这些变化,也给出迁移时要检查的条件。
导言
all-to-all 要让每个参与者给其他参与者发送数据,为什么还要分 group?分组可以控制同时争用有限资源的请求,让通信更接近硬件能稳定处理的速度;但它是否能“防止阻塞”,取决于分的是什么,以及阻塞发生在哪一层。本文从四个 rank 的调度例子出发,解释限流、错峰、接收许可和拓扑分层,再区分 NCCL group 的并发推进语义。目标是看懂通信实现的设计动机,并知道怎样验证收益;文中的容量与规模例子均为推导,没有集群性能实测。
导言
我最初从外部技术资料了解到 Data-as-Flag 时,直觉上把它理解为三种省掉独立完成通知的方法:把 flag 塞进数据块、用数据校验值确认整批到达,或者先用特殊值填满接收区,再观察它是否被真实数据覆盖。
顺着这三个方向检查 NVIDIA 的公开资料后,答案很明确:NVIDIA 不但有相同思路,NCCL 的 LL/LL128 已经长期使用内嵌 flag;NCCL 2.31.2 的 LLA2A 又把它做成了面向低时延 All-to-All 的 payload + epoch 原子槽位。不过,公开实现更偏好显式 epoch,而不是让任意 payload 或 checksum 单独承担正确性。
FuseLink Multi-NIC Communication
导言
一台服务器装有八张 400 Gbps NIC,不等于任意一张 GPU 都能拿到八张网卡的总带宽。现有 GPU 集群通常把 GPU 与“最近的”NIC 静态绑定;当 LLM 推理请求、MoE token 或推荐模型 embedding 产生不均衡流量时,热点 GPU 会堵在一张 NIC 上,旁边的 NIC 却可能空闲。
OSDI 2025 论文 FuseLink 的核心思想,是把 NVLink/NVSwitch 从“服务器内部的 GPU 互连”重新解释为“跨服务器网络的数据路径延伸”:流量先经 NVLink 到达更适合访问空闲 NIC 的中继 GPU,再通过 RDMA 发往远端。本文沿论文 Figure 1、2、3、4、5、8 还原这条设计链,并用其余实验结果说明收益、代价与边界。
导言
“GPU-aware” 很容易让人产生一个错觉:只要通信库能够接收 GPU buffer,数据就会完全绕开 CPU,通信也已经由 GPU 自主推进。现实并没有这么整齐。API 可能从 CPU 发起,数据却直接流向 NIC;GPU 也可能负责触发传输,但报文仍由 CPU 预先构造。
The Landscape of GPU-Centric Communication 给出的关键视角,是把通信拆成 API、报文构造、触发和数据路径,再观察每项责任究竟落在 CPU、GPU 还是 NIC。沿着这套坐标回看二十年演进,会发现主线不是“带宽越来越高”,而是先消除冗余拷贝,再缩短数据路径,最后把控制权逐步迁到 GPU。
导言
Echo 是一个面向大规模分布式训练的混合性能模拟器:它先在少量真实 NVIDIA GPU 上逐 Rank 执行和计时,再用 NCCL 白盒公式、离散事件时间线以及 XGBoost 重叠减速模型,预测目标集群的单步时间。它模拟的是执行时序,不是张量数值、loss 或收敛过程。
截至本文固定的公开版本,Echo 已公开 workload tracer 与 slowdown predictor,但论文中的集成通信估算器和 timeline composer 尚未在仓库中找到;代码明显绑定 CUDA、NCCL 和 Nsight,没有开箱即用的 Ascend 支持。论文在 NVIDIA 测试域内给出 91.4% 平均预测准确率,以及 GPT-175B、96 张 H800 上约 8% 的单步时间误差,但这些数字不能直接外推到 Ascend。
导言
SimAI 不是把上千张 GPU 在软件里逐晶体管复刻一遍,也不是实际训练一个没有数据的模型。它把训练框架、算子耗时、集合通信和网络拆成不同精度的模型,再用事件依赖重建一次迭代的时间线。本文基于 NSDI 2025 论文与固定版本源码,回答五个问题:它是什么、架构如何组织、是不是仿真、精度证据有多强,以及公开版是否支持 Ascend。