算力网络架构 中科新远技术团队

AI 集群网络如何分层:计算、存储和管理平面的流量边界

从训练和推理业务流量出发,说明 AI 集群计算网络、存储网络、业务接入和管理网络的分层方法及验收边界。

AI 集群网络如何分层:计算、存储和管理平面的流量边界

AI 集群不是一张高速网络。训练节点之间的集合通信、数据集读取、检查点写入、容器镜像分发、推理服务访问、BMC 管理和监控日志具有不同的流量模型与故障影响。把它们全部放在同一网络中,早期部署看似简单,负载上升后容易出现互相抢占和故障范围过大。

网络分层的目的不是增加设备数量,而是让不同业务拥有可解释的带宽、时延、安全和运维边界。是否物理隔离,应根据规模、风险和成本决定;即使共享设备,也应在队列、路由和监控层面建立明确边界。

先识别四类主要流量

同一台 GPU 服务器往往同时连接多类网络。售前设计应把每个接口对应的平面、速率、冗余、VLAN 或 Fabric、IP 规划和交换机端口明确到服务器连接表。

  • 计算网络:GPU 节点之间的梯度同步、参数交换和远程内存访问,通常对时延、消息率和无损传输敏感。
  • 存储网络:数据集读取、检查点、日志和制品传输,吞吐高且可能形成持续大流。
  • 业务接入网络:推理请求、API、调度入口和上下游系统访问,强调可用性、安全和南北向连接。
  • 管理网络:BMC、操作系统管理、监控、日志、PXE 和自动化,要求在业务网络异常时仍可使用。

原有通用架构为什么不够

传统企业网络多以南北向访问和超售模型设计,AI 训练则可能在同一时间产生大量东西向流量。若叶脊上联带宽、散列路径或缓冲策略不足,单个训练作业就可能造成热点。存储大流与 RDMA 流量混跑时,错误的优先级配置还会放大拥塞。

管理网络与业务网络共用同一故障域也存在风险。当交换配置错误或数据面拥塞时,运维人员可能同时失去 BMC 和主机管理入口,增加恢复难度。

推荐的分层架构

计算平面可采用独立 InfiniBand Fabric 或经过完整无损设计的 RoCE Fabric;存储平面根据存储协议、吞吐和容错需求选择独立网络或受控共享;业务接入使用标准数据中心以太网;BMC 建议使用独立的带外管理交换网络。

规模较小时,可以通过独立端口、VLAN、VRF 和 QoS 在部分设备上共享资源,但必须保留带宽和故障隔离。规模扩大后,计算与存储的流量增长速度通常不同,物理分离更便于独立扩容和变更。

网络平面主要设备角色关键参数验收重点
计算高速交换机、网卡/SuperNIC、线缆端口速率、拓扑、拥塞控制、MTURDMA、集合通信、长稳
存储存储交换机、网卡、存储节点吞吐、队列、冗余、多路径并发读写、检查点和恢复
业务数据中心以太网交换机、防火墙或负载均衡路由、访问控制、可用性API 时延、故障切换
管理带外交换机、BMC、管理节点独立寻址、权限、日志断网运维、远程重启和升级

产品组合与接口规划

服务器侧应同时规划计算网卡、存储或业务网卡和 BMC 端口。多 rail 架构还会增加计算端口数量。交换机数量由服务器端点、上联比例、冗余方式和扩容预留共同决定,线缆清单必须包含每条链路的两端接口与距离。

DPU 可用于部分虚拟交换、安全或存储服务卸载,但不应代替网络分层。其管理面、主机面和外部端口同样需要明确归属。

部署参数与验收

部署前冻结地址、VLAN/分区、MTU、优先级、路由和固件基线。计算平面测试点对点、双向、多对多和 NCCL;存储平面测试并发读取、写入和检查点;业务平面测试接口时延与故障切换;管理平面测试业务网中断后的远程登录与恢复。

监控必须按平面展示端口利用率、丢包、ECN、PFC、误码、时延和主机错误。只有总流量图而无法区分业务,出现性能下降时很难定位。

扩容与风险边界

扩容前重新计算叶脊上联、存储带宽和管理端口,不要只检查机柜还有没有空位。新增节点还可能改变路由散列、作业放置和存储并发,需在小批节点加入后复测。

网络隔离不能替代容量规划,共享也不等于没有边界。最终方案应以真实模型通信、数据集和并发作业为依据,并为单链路、单交换机和单管理节点故障定义恢复路径。

常见问题

AI 集群的计算、存储和管理网络必须全部物理隔离吗?
不一定。小规模环境可以在满足带宽、队列、安全和故障隔离的前提下共享部分设备,但计算网络和带外管理通常应优先建立清晰的独立边界。

Copyright © 2011-2026 北京中科新远科技有限公司 版权所有  Sitemap 备案号: