AI 集群双 Rail 怎么设计:带宽对称、故障域与布线顺序
说明 AI 集群双 Rail 网络的端点映射、带宽对称、交换平面、GPU/NIC 拓扑、布线和故障验收方法。

双 Rail 的意义不是给每台服务器接两根线,而是建立两个可识别、尽量对称且故障边界清晰的通信平面。GPU、网卡、Leaf、Spine、线缆和软件接口都要保持一致映射,否则物理端口翻倍只会增加排障难度。
设计从通信模型和可接受故障影响开始。需要在单 rail 故障时继续运行,还是允许作业重启;两个 rail 用于并行带宽还是主备恢复,决定了交换容量、路由和验收方式。
先定义每个 Rail 的完整边界
为 Rail A 和 Rail B 分别列出服务器网卡端口、PCIe/NUMA、Leaf、Spine、子网或路由域、线缆路径和管理对象。两个 rail 不应在未记录的位置共享同一张网卡、交换机或上联。
若因成本必须共享部件,应明确这会形成共同故障点,并在可用性说明中反映。名称上的双 rail 不能替代故障域分析。
对称从服务器内部开始
每组 GPU 到对应网卡的 PCIe 路径、代际和 NUMA 距离应尽量一致。两张网卡分别接在不同 CPU,但 GPU 分布不对称时,软件即使同时使用两个接口也可能出现一侧更慢。
记录 GPU/NIC 绑定并纳入节点模板。服务器更换主板、卡位或 BIOS 后,应重新检查拓扑,不把旧节点配置直接复制。
交换容量按故障状态核算
正常状态下两个 rail 各承担一部分流量,单 rail 故障后剩余平面可能需要承接更多通信或允许性能降级。Leaf/Spine 上联和端口预留应按预期故障行为计算。
若作业不会自动迁移流量,就不要假设剩余 rail 能无缝接管。通信库、路由和调度策略必须通过实际故障测试确认。
布线与标签保持端到端一致
端口表按服务器、GPU 组、网卡端口、rail、Leaf 和线缆 OPN 逐行记录。两个 rail 使用可区分的标签体系,并尽量走不同理线和供电故障路径。
不能仅靠线缆颜色识别。颜色会因批次或替代物料改变,唯一端口编号和可导出的连接表才是维护依据。
验收覆盖性能与切换
分别测试 Rail A、Rail B 和双 rail 并发,比较每节点最低带宽、时延和 NCCL 扩展。差异明显时先查拓扑和端口映射,再调整通信参数。
故障注入包括单链路、单 Leaf、单 Spine 上联和整个 rail 不可用,记录作业行为、告警、恢复时间和恢复后性能。