算力网络架构 中科新远技术团队

AI 集群双 Rail 怎么设计:带宽对称、故障域与布线顺序

说明 AI 集群双 Rail 网络的端点映射、带宽对称、交换平面、GPU/NIC 拓扑、布线和故障验收方法。

AI 集群双 Rail 怎么设计:带宽对称、故障域与布线顺序

双 Rail 的意义不是给每台服务器接两根线,而是建立两个可识别、尽量对称且故障边界清晰的通信平面。GPU、网卡、Leaf、Spine、线缆和软件接口都要保持一致映射,否则物理端口翻倍只会增加排障难度。

设计从通信模型和可接受故障影响开始。需要在单 rail 故障时继续运行,还是允许作业重启;两个 rail 用于并行带宽还是主备恢复,决定了交换容量、路由和验收方式。

先定义每个 Rail 的完整边界

为 Rail A 和 Rail B 分别列出服务器网卡端口、PCIe/NUMA、Leaf、Spine、子网或路由域、线缆路径和管理对象。两个 rail 不应在未记录的位置共享同一张网卡、交换机或上联。

若因成本必须共享部件,应明确这会形成共同故障点,并在可用性说明中反映。名称上的双 rail 不能替代故障域分析。

对称从服务器内部开始

每组 GPU 到对应网卡的 PCIe 路径、代际和 NUMA 距离应尽量一致。两张网卡分别接在不同 CPU,但 GPU 分布不对称时,软件即使同时使用两个接口也可能出现一侧更慢。

记录 GPU/NIC 绑定并纳入节点模板。服务器更换主板、卡位或 BIOS 后,应重新检查拓扑,不把旧节点配置直接复制。

交换容量按故障状态核算

正常状态下两个 rail 各承担一部分流量,单 rail 故障后剩余平面可能需要承接更多通信或允许性能降级。Leaf/Spine 上联和端口预留应按预期故障行为计算。

若作业不会自动迁移流量,就不要假设剩余 rail 能无缝接管。通信库、路由和调度策略必须通过实际故障测试确认。

布线与标签保持端到端一致

端口表按服务器、GPU 组、网卡端口、rail、Leaf 和线缆 OPN 逐行记录。两个 rail 使用可区分的标签体系,并尽量走不同理线和供电故障路径。

不能仅靠线缆颜色识别。颜色会因批次或替代物料改变,唯一端口编号和可导出的连接表才是维护依据。

验收覆盖性能与切换

分别测试 Rail A、Rail B 和双 rail 并发,比较每节点最低带宽、时延和 NCCL 扩展。差异明显时先查拓扑和端口映射,再调整通信参数。

故障注入包括单链路、单 Leaf、单 Spine 上联和整个 rail 不可用,记录作业行为、告警、恢复时间和恢复后性能。

常见问题

每台服务器使用一张双端口网卡连接两台交换机就算完整双 Rail 吗?
不一定。两个端口仍共享网卡和 PCIe 故障域;还要确认交换平面、路由或子网、GPU/NIC 映射、线缆路径和软件使用方式是否真正独立。

Copyright © 2011-2026 北京中科新远科技有限公司 版权所有  Sitemap 备案号:京ICP备19012332号-2