AI 网络长稳测试怎么设计:负载、温度、错误计数与恢复
说明 AI 网络长稳测试如何覆盖负载组合、运行时长、温度、FEC/RDMA、NCCL、作业并发、告警和故障恢复。

AI 网络短时跑通 RDMA 或 NCCL,只能证明基本路径可用。温度上升、模块老化边界、错误计数累积、多个作业并发和控制面变更,往往需要更长时间才暴露;长稳测试的目标是验证系统在目标负载下能持续运行并可恢复。
测试时长不是唯一标准。连续运行很久但负载单一、没有监控和错误阈值,得到的证据有限。应设计覆盖物理、网络、通信和业务的负载组合。
先定义通过与停止条件
列出允许的链路 flap、不可纠正错误、FEC 增长、丢包、重传、温度、性能波动和作业失败。阈值依据设备资料与业务目标,不在测试结束后根据结果调整。
出现硬件错误、温度越界或持续性能下降时,应停止并保存现场,避免继续压测覆盖证据。
负载覆盖单流与并发竞争
包括点对点 RDMA、多对一、双向、多消息尺寸、多节点 NCCL、多个作业并发和存储流量混跑。负载映射到实际服务器、rail 和交换路径。
轮换不同端口和节点,避免只有部分链路长期承压。对于分拆端口,同时压满多个分支观察主端与温度。
监控使用统一时间轴
采集交换机端口、FEC、队列、ECN/PFC、模块温度、网卡、PCIe、GPU、NCCL 和业务指标,并保证 NTP 一致。只有日志没有时间对齐,难以关联根因。
报告同时展示平均、最低、尾部和趋势。平均带宽稳定可能掩盖个别节点周期性下降。
加入维护和恢复动作
在受控阶段执行单链路中断、端口重启、节点重启或管理服务切换,观察告警、业务行为和恢复后性能。故障动作与性能压力分阶段,避免无法定位。
恢复后继续运行足够时间,确认错误不会快速复发。只看到接口重新 Up 不能作为恢复完成。
保留可复用的基线包
保存拓扑、端口表、硬件 OPN、软件版本、配置、测试命令、原始结果、告警和异常处置。报告中的每个结论应能回到原始数据。
后续扩容、升级或替换物料时复用同一基线,并只改变一个变量。长期基线也要随业务规模更新。
覆盖所有节点而不是只测平均
长稳调度应轮换节点和端口,让每台服务器、每个 rail 和每组上联都进入高负载时段。固定使用少数节点会让未覆盖设备带着隐患上线。
节点结果按最低值、错误和温度排序,异常节点隔离复测。用全网平均值放行会掩盖少数持续掉速或误码的设备。
测试结束前再执行一次全量健康检查,确认没有在压力阶段积累但尚未触发业务失败的硬件错误。