RDMA、NCCL 与链路测试:AI 集群验收不能只看端口 Up
建立从物理链路、PCIe、RDMA 到 NCCL 和真实业务的分层验收方法,并给出故障定位和扩容回归边界。

端口显示 Up 只说明物理链路和基础协商完成。PCIe 降速、误码、NUMA 跨越、RDMA 配置、路由热点和通信库绑定错误,都可能在端口正常的情况下造成训练性能下降。
AI 集群验收应按层次推进:物理和设备、主机路径、RDMA、网络并发、集合通信、存储和真实业务。每一层都有基线和证据,出现问题才能快速缩小范围。
第一层:物理链路与设备健康
这一层没有通过,不应直接运行 NCCL。上层工具可能把物理或 PCIe 问题表现为通信超时,反而增加定位难度。
- 核对交换机端口、网卡、模块或线缆、目标速率、分拆和固件。
- 检查链路状态、FEC、误码、丢包、模块温度和光功率或线缆状态。
- 检查 PCIe 实际代际、通道宽度、AER 错误和设备重置记录。
- 检查 GPU、NIC、CPU 的 NUMA 和 PCIe 拓扑与设计一致。
第二层:RDMA 基础能力
确认 RDMA 设备、端口和 GID/地址选择,验证服务端与客户端使用预期接口。按小消息和大消息、单向和双向测试带宽、时延和消息率。
测试结果需要与同型号节点基线比较。单个节点显著偏低时,优先检查插槽、NUMA、CPU 绑定、PCIe 和固件,不要立即调整整网参数。
| 验收层 | 工具目标 | 主要问题范围 |
|---|---|---|
| 物理/设备 | 链路、误码、PCIe 和拓扑 | 模块线缆、端口、插槽和固件 |
| RDMA | 点对点时延、带宽和消息率 | 主机配置、接口和基础网络 |
| 并发网络 | 多对一、多对多、长稳 | 拥塞、路径、缓冲和故障域 |
| NCCL | GPU 集合通信 | GPU/NIC 绑定、通信库和拓扑 |
| 业务 | 训练步时、推理时延和稳定性 | 端到端系统与应用 |
第三层:并发和拥塞
点对点达标不代表交换网络达标。需要构造跨 Leaf、跨 Spine、多对一、多对多和双向流量,观察路径均衡、ECN、PFC、丢包和尾部抖动。
测试持续时间要足以暴露温度、误码和周期性抖动。只运行几秒的峰值测试,无法代表长时间训练。
第四层:NCCL 集合通信
NCCL 测试应覆盖单机多 GPU、同交换域多机、跨 Leaf 和目标最大规模,并使用多个消息尺寸。记录算法带宽、总线带宽、错误日志和每节点差异。
如果 NCCL 异常而 RDMA 正常,重点检查 GPU/NIC/NUMA 拓扑、接口选择、容器设备映射、通信库版本和环境变量。不要用单个最优消息尺寸替代完整曲线。
第五层:真实业务和验收阈值
使用代表性模型、数据和并行策略运行训练或推理,记录 GPU 利用率、训练步时、通信占比、数据等待、失败重试和检查点。基础测试达标但业务不达标时,问题可能在数据、算子、调度或并行策略。
阈值应在项目开始前约定,包括允许节点差异、错误计数、持续时长、故障恢复和性能下限。验收不能在看到结果后再选择对项目最有利的指标。
故障排查和扩容回归
排障遵循从单节点、单链路到多节点,从物理到应用的顺序。每次替换线缆、换槽、升级版本或调整参数只改变一个变量,并保存前后数据。
新增服务器、交换机、rail 或固件版本后,至少回归物理、RDMA、并发、NCCL 和代表性业务。扩容不是简单重复上架,它可能改变路径、拥塞和作业布局。