部署与验收 中科新远技术团队

AI 网络长稳测试怎么设计:负载、温度、错误计数与恢复

说明 AI 网络长稳测试如何覆盖负载组合、运行时长、温度、FEC/RDMA、NCCL、作业并发、告警和故障恢复。

AI 网络长稳测试怎么设计:负载、温度、错误计数与恢复

AI 网络短时跑通 RDMA 或 NCCL,只能证明基本路径可用。温度上升、模块老化边界、错误计数累积、多个作业并发和控制面变更,往往需要更长时间才暴露;长稳测试的目标是验证系统在目标负载下能持续运行并可恢复。

测试时长不是唯一标准。连续运行很久但负载单一、没有监控和错误阈值,得到的证据有限。应设计覆盖物理、网络、通信和业务的负载组合。

先定义通过与停止条件

列出允许的链路 flap、不可纠正错误、FEC 增长、丢包、重传、温度、性能波动和作业失败。阈值依据设备资料与业务目标,不在测试结束后根据结果调整。

出现硬件错误、温度越界或持续性能下降时,应停止并保存现场,避免继续压测覆盖证据。

负载覆盖单流与并发竞争

包括点对点 RDMA、多对一、双向、多消息尺寸、多节点 NCCL、多个作业并发和存储流量混跑。负载映射到实际服务器、rail 和交换路径。

轮换不同端口和节点,避免只有部分链路长期承压。对于分拆端口,同时压满多个分支观察主端与温度。

监控使用统一时间轴

采集交换机端口、FEC、队列、ECN/PFC、模块温度、网卡、PCIe、GPU、NCCL 和业务指标,并保证 NTP 一致。只有日志没有时间对齐,难以关联根因。

报告同时展示平均、最低、尾部和趋势。平均带宽稳定可能掩盖个别节点周期性下降。

加入维护和恢复动作

在受控阶段执行单链路中断、端口重启、节点重启或管理服务切换,观察告警、业务行为和恢复后性能。故障动作与性能压力分阶段,避免无法定位。

恢复后继续运行足够时间,确认错误不会快速复发。只看到接口重新 Up 不能作为恢复完成。

保留可复用的基线包

保存拓扑、端口表、硬件 OPN、软件版本、配置、测试命令、原始结果、告警和异常处置。报告中的每个结论应能回到原始数据。

后续扩容、升级或替换物料时复用同一基线,并只改变一个变量。长期基线也要随业务规模更新。

覆盖所有节点而不是只测平均

长稳调度应轮换节点和端口,让每台服务器、每个 rail 和每组上联都进入高负载时段。固定使用少数节点会让未覆盖设备带着隐患上线。

节点结果按最低值、错误和温度排序,异常节点隔离复测。用全网平均值放行会掩盖少数持续掉速或误码的设备。

测试结束前再执行一次全量健康检查,确认没有在压力阶段积累但尚未触发业务失败的硬件错误。

常见问题

AI 网络长稳测试持续 24 小时就一定足够吗?
不一定。时长要结合热稳定、错误增长和业务周期,关键是覆盖目标负载、全部链路、并发竞争、监控与恢复,并预先定义通过条件。

Copyright © 2011-2026 北京中科新远科技有限公司 版权所有  Sitemap 备案号:京ICP备19012332号-2