高速网卡 PCIe 链路降速怎么验收:代际、宽度、拓扑与持续负载
说明高速网卡验收时如何检查 PCIe 协商代际和宽度、插槽拓扑、共享上行、错误计数及持续负载下的降速问题。

高速网卡被操作系统识别并不代表 PCIe 路径工作在目标状态。插槽只协商到较低代际或宽度、共享上行受限、跨 NUMA 或错误重训练,都可能让网络端口正常却无法持续提供预期吞吐。
PCIe 链路降速验收要同时检查静态协商、物理拓扑、错误与持续负载。单次工具输出正常,不能排除温度、供电或并发条件下重新降速。
用服务器槽位资料确定期望值
记录网卡型号、PCIe 能力、实际插槽、Riser、CPU/NUMA 和服务器厂商支持的目标代际与宽度。不要假设物理 x16 插槽一定提供独占 x16 电气通道。
同一服务器不同槽位可能共享 PCIe Switch 或与存储控制器分配上行。验收前先确定每个槽位的理论边界,才能解释工具结果。
比较能力值与当前协商值
分别读取设备最大支持和当前协商的链路代际与宽度,并在冷启动、热重启和业务运行后重复采集。若当前值低于设计,记录发生时间和所有上游桥接设备。
不要只看网卡端点。上游 Root Port 或 PCIe Switch 的协商和错误同样可能限制路径,尤其是多设备共享的服务器。
排查顺序从机械与固件开始
确认卡是否完全插入、Riser 与插槽匹配、辅助供电和风道正常,再核对 BIOS、服务器固件和网卡固件。未经厂商依据,不要用强制代际参数长期掩盖训练失败。
交叉更换槽位、Riser 或已知正常网卡时,每次只改变一个变量并保留结果。多项同时更换会失去故障定位价值。
持续负载下观察错误与温度
运行主机内存到网卡、RDMA、多流和 GPU Direct 等代表性负载,关联 PCIe 错误、链路状态、网卡温度、系统日志和吞吐。测试时间应覆盖设备升温后的稳定状态。
若吞吐低但 PCIe 状态稳定,再检查 NUMA、CPU 绑定、内存带宽和网络端。不要把所有性能不足都归为链路降速。
验收结果写入资产基线
为每台服务器保存网卡、槽位、协商代际与宽度、NUMA、固件和测试结果。更换主板、Riser、网卡或 BIOS 后自动对比。
批量设备若只有少数偏离,优先检查装配和个体硬件;若同型号普遍偏离,则回看服务器配置和支持矩阵,再决定是否调整设计。
通过条件按并发场景定义
单端口测试、双端口双向流量和 GPU Direct 并发对 PCIe 路径的压力不同。验收报告应写明每个场景的设备组合、CPU 与 GPU 绑定、消息规模和持续时间,不能只保留一个峰值。
设计值无法达到时,要区分厂商支持边界、硬件异常和业务实际需求。任何降级接受都应记录影响范围与复测触发条件,避免后续扩容时把已知限制当作新故障。