
AI Network Architecture
算力网络架构
从业务流量和扩展目标出发,分析 InfiniBand、RoCE、Leaf-Spine、Rail-Optimized、存储网络和管理网络的架构取舍。
栏目文章
InfiniBand、RoCE、Leaf-Spine、Rail-Optimized 与多平面网络
AI 集群存储前端网络怎么接:训练 Fabric 与数据服务的边界
围绕AI 集群存储前端网络,从训练 Fabric、存储前端、数据服务和带宽隔离、端到端兼容、部署验证和风险边界出发,帮助技术与采购团队形成可核对的方案与部署结论。
阅读全文AI 集群 Rail 映射怎么做:GPU、网卡与 Leaf 端口的一致性
围绕AI 集群 Rail 映射,从GPU、网卡、Rail、Leaf 端口和作业放置、端到端兼容、部署验证和风险边界出发,帮助技术与采购团队形成可核对的方案与部署结论。
阅读全文
RDMA MTU 规划:端到端一致性与异常边界
围绕RDMA MTU 规划,从端点、交换机、分拆链路和一致性检查、端到端兼容、部署验证和风险边界出发,帮助技术与采购团队形成可核对的问题与核对结论。
阅读全文GPU 集群安全平面怎么分:训练、管理、租户与审计流量
围绕GPU 集群安全平面,从训练面、管理面、租户面、审计和策略控制、端到端兼容、部署验证和风险边界出发,帮助技术与采购团队形成可核对的方案与部署结论。
阅读全文常见问题
围绕训练、推理、服务器形态与边缘部署,补充常见选型判断。
AI 集群的计算、存储和管理网络必须全部物理隔离吗?
不一定。小规模环境可以在满足带宽、队列、安全和故障隔离的前提下共享部分设备,但计算网络和带外管理通常应优先建立清晰的独立边界。
已有以太网交换机就一定适合直接部署 RoCE 吗?
不一定。需要确认交换机和网卡对优先级、PFC、ECN、DCQCN、缓冲、MTU和遥测的支持,并完成端到端参数设计和压力测试。
Rail-Optimized 是否一定比普通 Leaf-Spine 更快?
不一定。它需要多网卡服务器、正确的 GPU/NIC/NUMA 映射、对称布线和通信库配合。规模较小或绑定错误时,增加的复杂度未必带来收益。
Quantum-2 交换机的一个 OSFP 笼口是否只能连接一个服务器端口?
不一定。具体连接数量取决于交换机端口模式、目标速率、分拆线缆和服务器网卡端口。规划时必须区分物理笼口、逻辑端口和分支链路。
每台服务器使用一张双端口网卡连接两台交换机就算完整双 Rail 吗?
不一定。两个端口仍共享网卡和 PCIe 故障域;还要确认交换平面、路由或子网、GPU/NIC 映射、线缆路径和软件使用方式是否真正独立。
AI 训练网络是否必须全部采用 1:1 无阻塞设计?
不一定。应依据通信模型、并发、作业放置和故障目标计算;但采用收敛设计必须通过代表性并发业务验证其对完成时间和尾部时延的影响。
训练网络与存储网络使用同样的 400G 端口就可以放心共享吗?
不能只看端口速率。还要评估两类流量并发、队列与 QoS、主机 PCIe/NUMA、故障域和最坏状态下的业务完成时间。
增加 ECMP 路径数量是否一定能消除 RoCE 网络热点?
不一定。还取决于业务独立流数量、散列字段、路由是否真正等价、作业放置和拥塞控制;少量大流仍可能集中在个别路径。
同时运行两个 InfiniBand 子网管理器就一定具备高可用吗?
不一定。还要确认角色选举、故障域、配置与分区一致、管理可达、监控和实际切换行为;两个实例共享同一主机仍是单点。
AI 网络预留一定比例的交换机端口就足以支持后续扩容吗?
不足。还要预留 Spine 容量、端到端介质、机柜与电力、管理端口、地址、路由、监控和变更窗口,并明确每个预留端口对应的扩容位置。