
AI Network Architecture
算力网络架构
从业务流量和扩展目标出发,分析 InfiniBand、RoCE、Leaf-Spine、Rail-Optimized、存储网络和管理网络的架构取舍。
栏目文章
InfiniBand、RoCE、Leaf-Spine、Rail-Optimized 与多平面网络
InfiniBand 与 RoCE 怎么选:从业务瓶颈到网络验收
结合 AI 训练、HPC、现有以太网基础和运维能力,比较 InfiniBand 与 RoCE 的技术原因、架构方案、部署条件和验收方法。
阅读全文
Leaf-Spine 与 Rail-Optimized:GPU 集群拓扑怎么规划
解释 Leaf-Spine 与 Rail-Optimized 拓扑的流量路径、交换机和网卡角色、服务器布线、故障域、测试与扩容方法。
阅读全文常见问题
围绕训练、推理、服务器形态与边缘部署,补充常见选型判断。
AI 集群的计算、存储和管理网络必须全部物理隔离吗?
不一定。小规模环境可以在满足带宽、队列、安全和故障隔离的前提下共享部分设备,但计算网络和带外管理通常应优先建立清晰的独立边界。
已有以太网交换机就一定适合直接部署 RoCE 吗?
不一定。需要确认交换机和网卡对优先级、PFC、ECN、DCQCN、缓冲、MTU和遥测的支持,并完成端到端参数设计和压力测试。
Rail-Optimized 是否一定比普通 Leaf-Spine 更快?
不一定。它需要多网卡服务器、正确的 GPU/NIC/NUMA 映射、对称布线和通信库配合。规模较小或绑定错误时,增加的复杂度未必带来收益。