Spectrum-X 以太网 AI 网络怎么验收:从 SuperNIC 到交换机的端到端基线
给出 Spectrum-X 以太网 AI 网络从服务器拓扑、SuperNIC、交换机、RoCE 配置、拥塞测试到 NCCL 业务基线的分层验收方法。

Spectrum-X 是面向 AI 基础设施的端到端以太网平台,不应把验收缩减为交换机端口 Up。服务器 PCIe 与 NUMA、SuperNIC 固件和驱动、交换网络、RoCE 参数、遥测以及多节点通信库共同决定最终表现。
一个可复用的验收基线应从物理链路开始,逐层验证主机、RDMA、拥塞行为和真实业务。每层都要保留配置与测试条件,出现性能波动时才能判断问题在服务器、网络还是作业模型。
先冻结验收对象
验收前记录服务器型号、CPU/GPU 配置、SuperNIC OPN、PCIe 拓扑、交换机型号、网络操作系统、驱动、固件、CUDA 与 NCCL 版本。任何一个版本在测试中变更,都应重新标记基线。
NVIDIA 将 Spectrum-X 定位为由 Spectrum 交换系统、以太网 SuperNIC 和软件能力协同的 AI 以太网平台。仅购买交换机并不等于端到端配置已经完成。
五层验收顺序
| 层级 | 主要检查 | 通过标准的表达方式 |
|---|---|---|
| 物理与主机 | 链路、PCIe、NUMA、温度、错误计数 | 所有目标端口状态一致,无持续错误增长 |
| RDMA 基础 | 设备识别、GID、MTU、基础吞吐与时延 | 按服务器和端口记录稳定区间 |
| 拥塞控制 | 优先级、PFC、ECN、DCQCN、队列和遥测 | 并发流量下无异常 pause 扩散或持续拥塞 |
| 集合通信 | NCCL 多节点、多消息尺寸和多并发 | 结果与同配置基线比较,不只看单次峰值 |
| 业务与故障 | 长稳、链路故障、节点恢复和扩容回归 | 恢复路径和性能变化在事先定义的范围内 |
主机侧先于网络调参
在调整交换机缓冲或拥塞参数前,先确认 SuperNIC 所在 PCIe 链路的宽度和速率、网卡与 GPU 的拓扑距离、CPU 亲和性和中断分布。主机拓扑错误会造成带宽不足或抖动,继续修改网络参数只会掩盖根因。
每台服务器应执行相同的设备识别、PCIe、NUMA 和 RDMA 基础检查,并把异常节点从集群测试中单独隔离。不要用多节点平均值覆盖少数性能明显偏低的主机。
拥塞测试必须制造可观察的竞争
空闲网络上的点对点测试无法证明 RoCE 在并发训练中的稳定性。需要设计多对一、多作业并发和存储流量混跑等场景,观察 ECN 标记、PFC pause、队列、丢包、重传和端口利用率。
PFC、ECN 和 DCQCN 的参数应作为一套端到端配置管理。若只在交换机开启 PFC,没有同步检查网卡优先级、ECN 和速率控制,网络可能在压力下出现 pause 扩散或公平性问题。
NCCL 结果要带完整上下文
记录节点数、每节点 GPU 数量、消息尺寸、算法、并发作业、运行时长和绑定方式。单次峰值适合快速排障,不适合作为交付基线。基线应包含中位表现、低位表现、波动范围和重复运行结果。
当 RDMA 测试正常而 NCCL 偏低时,继续检查 GPU/网卡拓扑、容器设备映射、通信库配置、路由散列和作业放置。网络端口 Up 只能排除最基础的链路故障。
交付时保留可回归的证据
后续升级只改变一个变量,并复用同一组测试比较。没有保存测试条件的“验收通过”无法用于定位版本回归,也无法判断扩容后性能变化是否来自网络。
- 硬件、驱动、固件和网络配置清单。
- 服务器拓扑、端口表和线缆对应关系。
- 各层测试命令、参数、原始结果和时间。
- 遥测截图或导出数据,以及异常节点处理记录。
- 故障注入、恢复和扩容后的回归结果。