部署与验收 中科新远技术团队

RDMA、NCCL 与链路测试:AI 集群验收不能只看端口 Up

建立从物理链路、PCIe、RDMA 到 NCCL 和真实业务的分层验收方法,并给出故障定位和扩容回归边界。

RDMA、NCCL 与链路测试:AI 集群验收不能只看端口 Up

端口显示 Up 只说明物理链路和基础协商完成。PCIe 降速、误码、NUMA 跨越、RDMA 配置、路由热点和通信库绑定错误,都可能在端口正常的情况下造成训练性能下降。

AI 集群验收应按层次推进:物理和设备、主机路径、RDMA、网络并发、集合通信、存储和真实业务。每一层都有基线和证据,出现问题才能快速缩小范围。

第一层:物理链路与设备健康

这一层没有通过,不应直接运行 NCCL。上层工具可能把物理或 PCIe 问题表现为通信超时,反而增加定位难度。

  • 核对交换机端口、网卡、模块或线缆、目标速率、分拆和固件。
  • 检查链路状态、FEC、误码、丢包、模块温度和光功率或线缆状态。
  • 检查 PCIe 实际代际、通道宽度、AER 错误和设备重置记录。
  • 检查 GPU、NIC、CPU 的 NUMA 和 PCIe 拓扑与设计一致。

第二层:RDMA 基础能力

确认 RDMA 设备、端口和 GID/地址选择,验证服务端与客户端使用预期接口。按小消息和大消息、单向和双向测试带宽、时延和消息率。

测试结果需要与同型号节点基线比较。单个节点显著偏低时,优先检查插槽、NUMA、CPU 绑定、PCIe 和固件,不要立即调整整网参数。

验收层工具目标主要问题范围
物理/设备链路、误码、PCIe 和拓扑模块线缆、端口、插槽和固件
RDMA点对点时延、带宽和消息率主机配置、接口和基础网络
并发网络多对一、多对多、长稳拥塞、路径、缓冲和故障域
NCCLGPU 集合通信GPU/NIC 绑定、通信库和拓扑
业务训练步时、推理时延和稳定性端到端系统与应用

第三层:并发和拥塞

点对点达标不代表交换网络达标。需要构造跨 Leaf、跨 Spine、多对一、多对多和双向流量,观察路径均衡、ECN、PFC、丢包和尾部抖动。

测试持续时间要足以暴露温度、误码和周期性抖动。只运行几秒的峰值测试,无法代表长时间训练。

第四层:NCCL 集合通信

NCCL 测试应覆盖单机多 GPU、同交换域多机、跨 Leaf 和目标最大规模,并使用多个消息尺寸。记录算法带宽、总线带宽、错误日志和每节点差异。

如果 NCCL 异常而 RDMA 正常,重点检查 GPU/NIC/NUMA 拓扑、接口选择、容器设备映射、通信库版本和环境变量。不要用单个最优消息尺寸替代完整曲线。

第五层:真实业务和验收阈值

使用代表性模型、数据和并行策略运行训练或推理,记录 GPU 利用率、训练步时、通信占比、数据等待、失败重试和检查点。基础测试达标但业务不达标时,问题可能在数据、算子、调度或并行策略。

阈值应在项目开始前约定,包括允许节点差异、错误计数、持续时长、故障恢复和性能下限。验收不能在看到结果后再选择对项目最有利的指标。

故障排查和扩容回归

排障遵循从单节点、单链路到多节点,从物理到应用的顺序。每次替换线缆、换槽、升级版本或调整参数只改变一个变量,并保存前后数据。

新增服务器、交换机、rail 或固件版本后,至少回归物理、RDMA、并发、NCCL 和代表性业务。扩容不是简单重复上架,它可能改变路径、拥塞和作业布局。

常见问题

交换机和网卡端口都是 Up,为什么 NCCL 性能仍可能很低?
端口 Up 不覆盖 PCIe 降速、NUMA 跨越、误码、RDMA 接口选择、拥塞热点、容器映射和 GPU/NIC 绑定,需要按物理、RDMA、并发和 NCCL 分层检查。

Copyright © 2011-2026 北京中科新远科技有限公司 版权所有  Sitemap 备案号: