GPU 与整机 中科新远技术团队

GPU 服务器做 GPUDirect RDMA 前怎么检查:GPU、网卡与 PCIe 路径

说明 GPUDirect RDMA 部署前如何检查 GPU、网卡、PCIe、NUMA、IOMMU、驱动和容器路径,并建立可回归的通信基线。

GPU 服务器做 GPUDirect RDMA 前怎么检查:GPU、网卡与 PCIe 路径

GPUDirect RDMA 的目标是让网络设备与 GPU 显存之间建立更直接的数据路径,但功能可用不等于路径最优。GPU 和网卡分属不同 CPU 根端口、跨 NUMA 访问、PCIe 链路降宽或 IOMMU 配置不合适,都可能让通信能够建立却达不到预期。

部署前应先画出物理拓扑,再决定网卡插槽、GPU 到网卡的绑定和通信接口。等服务器到货后才发现卡位不对,通常比调整软件参数更难修复。

把设备路径画到 CPU 根端口

拓扑记录至少包含 CPU、NUMA 节点、PCIe Root Complex、PCIe Switch、每张 GPU、每张高速网卡和本地 NVMe。只记录插槽编号不够,因为外观相邻的插槽可能属于不同 CPU 或共享不同上行链路。

多 rail 服务器应为每张 GPU 组指定首选网卡,并检查各组是否对称。若一侧通过本地 PCIe 路径,另一侧必须跨处理器互联,集合通信中容易出现节点内不均衡。

确认每一层都满足功能前提

需要核对 GPU、网卡、服务器平台、操作系统内核、GPU 驱动、RDMA 驱动和通信库的支持组合。IOMMU、ACS、Peer Memory 等设置应依据 NVIDIA 与服务器厂商文档确定,不使用互联网上的通用开关清单直接修改生产 BIOS。

容器场景还要确认 GPU 与 RDMA 设备均被正确映射,相关库来自同一受控基线。宿主机测试通过而容器失败时,应先比较设备、权限和库版本,不要先改交换网络。

按路径分层建立性能基线

先检查 PCIe 实际协商速率和宽度,再做 GPU 内存、主机到 GPU、网卡 RDMA 和 GPU Direct 通信测试。每项测试记录设备对、消息尺寸、并发、持续时间和 CPU 绑定。

单个最优带宽值不能证明整个节点配置正确。应覆盖每一组 GPU/NIC 配对,并关注最低结果、节点间差异和重复运行波动,异常路径要能对应回物理拓扑。

多节点验证才是最终闭环

基础 RDMA 通过后,再运行单机多 GPU、同 Leaf 多机、跨 Leaf 和目标最大规模的 NCCL 测试。若规模扩大后性能突然下降,应同时检查路由散列、端口利用率、拥塞标记和作业放置。

最终基线应保存拓扑输出、固件与驱动版本、测试命令和结果。更换插槽、升级内核或驱动、调整 IOMMU 后,都要复用同一组测试回归。

常见问题

网卡和 GPU 在同一个 NUMA 节点就一定能获得最优 GPUDirect RDMA 性能吗?
不一定。同一 NUMA 只是重要条件之一,还要检查 PCIe 根端口、交换路径、链路宽度、IOMMU/ACS、驱动支持、设备绑定和网络侧配置。

Copyright © 2011-2026 北京中科新远科技有限公司 版权所有  Sitemap 备案号:京ICP备19012332号-2