算力网络架构 中科新远技术团队

AI 网络东西向与南北向流量怎么分层:训练、存储和服务入口的边界

说明 AI 网络如何区分训练与存储东西向流量、用户和数据入口南北向流量,并规划路由、容量、故障域和安全边界。

AI 网络东西向与南北向流量怎么分层:训练、存储和服务入口的边界

AI 数据中心里,训练集合通信、存储读取、模型分发和用户访问的路径与容错要求不同。把它们全部接入同一网络并统一按端口利用率扩容,容易让训练突发影响在线服务,也会让安全和排障边界变得模糊。

AI 网络东西向与南北向分层不是简单增加 VLAN,而是为每类流量确定端点、带宽、时延、路由位置和故障影响,再决定哪些平面物理分离、哪些可以逻辑隔离。

先用业务行为定义方向

GPU 节点之间的集合通信、参数同步和同站点存储访问通常属于高带宽东西向流量;用户请求、外部数据导入、模型 API 与跨站点连接更多体现南北向路径。方向只是起点,仍要记录每类流量的并发和峰值。

模型分发、检查点和数据预处理可能同时跨越两类路径。不要只按应用名称分类,应从源端、目的端和实际经过的交换层确认。

训练流量优先保持短且对称

集合通信对带宽对称、路径热点和尾部节点敏感。训练端点、Leaf/Spine 上联与 rail 设计应尽量减少无关安全设备或传统园区汇聚层插入。

需要策略隔离时,优先在不破坏数据路径的控制点实施,并通过 NCCL 或真实作业验证。端口连通不能证明策略处理没有改变时延与吞吐。

存储路径按共享程度决定隔离

存储流量与训练通信共享端点或交换容量时,检查点和数据加载可能形成并发峰值。根据流量模型选择独立网卡、独立交换平面、独立队列或受控共享。

分离后还要处理路由、命名、挂载和故障切换,不能只把线缆分成不同颜色。存储不可达时的作业行为也应进入架构设计。

南北向入口承担安全和服务治理

用户、API、数据导入和管理访问通常需要负载均衡、防火墙、身份和审计。它们适合在明确的边界 Leaf、服务网关或企业核心连接,不应默认穿过训练 fabric 内部。

入口扩容按在线并发、数据传输和灾备需求计算,与训练网络总带宽分开管理。两者共用设备时,必须分析单设备故障和维护窗口影响。

用故障矩阵验证分层结果

分别模拟训练链路拥塞、存储峰值、服务入口故障和企业网络维护,确认其他流量是否保持预期。监控要能按平面关联端口、主机与作业,而不是只展示全网总量。

当新业务需要跨越原有边界时,先更新流量表和容量,再开放路由与策略。长期例外不受管理,最终会重新形成难以解释的共享网络。

常见问题

AI 训练、存储和服务入口是否必须使用三套完全独立的物理网络?
不一定。应根据带宽、故障域、安全和运维能力选择物理或逻辑隔离;共享时必须有容量、队列、路由和故障验证,不能只依赖 VLAN。

Copyright © 2011-2026 北京中科新远科技有限公司 版权所有  Sitemap 备案号:京ICP备19012332号-2