企业网络 中科新远技术团队

双机房 AI 集群 DCI 怎么规划:业务边界、带宽与故障切换

说明双机房 AI 集群 DCI 在训练、数据复制、模型分发、控制面、带宽、时延、路由和灾备方面的规划边界。

双机房 AI 集群 DCI 怎么规划:业务边界、带宽与故障切换

双机房 AI 基础设施首先要决定哪些业务允许跨站点。把一个同步训练作业拆到两个高时延机房、在站点间复制数据集、同步模型制品和提供灾备,对带宽、时延和一致性的要求完全不同。

DCI 不是把两套 Leaf-Spine 直接延伸成一个大二层。站点边界、路由、故障隔离和恢复目标应先确定,再选择链路和协议。

按业务类型拆分跨站点流量

分别记录数据集复制、检查点、模型制品、容器镜像、管理控制、用户访问和可能的跨站点计算通信。每类流量说明方向、峰值、允许时延和完成窗口。

跨站点训练通信对时延和抖动敏感,必须用真实通信模式验证。链路标称带宽足够,不代表集合通信扩展可接受。

容量按并发与恢复窗口计算

日常增量复制、集中备份和灾后回灌可能同时发生。计算带宽时考虑峰值并发、协议开销和故障后补传,不能只用日均数据量除以一天。

为关键控制流量和业务访问保留容量,对可延迟的批量复制设置窗口或限速。QoS 不能替代链路总容量。

站点之间保持清晰路由边界

优先使用可汇总的三层互联,明确每个站点拥有的前缀、服务入口和故障通告。需要二层延伸的少数系统应单独评估广播、环路和故障扩大。

BGP/ECMP、多运营商或多链路设计要验证入向与出向路径、MTU 和故障收敛。不同方向带宽不对称时,复制和恢复计划也要调整。

灾备目标决定数据策略

明确 RPO/RTO、哪些数据必须同步、哪些可以重建、模型和配置由谁作为事实源。把所有数据无差别实时复制,可能占用大量带宽又不改善恢复。

站点故障时,调度、身份、DNS、存储和管理入口要共同切换。只有网络路由恢复,业务平台仍可能无法启动。

演练正常、拥塞和断链三种状态

测试代表性复制与访问并发、链路高利用、单运营商或单设备故障,记录吞吐、延迟、丢包、路由收敛和业务恢复。再验证链路恢复后的积压清理。

保存两站点时间同步的监控和日志。扩容 GPU 或存储后重新评估 DCI,不把初期数据量长期作为容量依据。

安全与运营商边界单独管理

明确链路是否经过运营商或公共设施、数据是否需要加密、密钥如何管理以及加密设备的带宽与故障域。安全处理不能在项目末期临时叠加,否则可能改变时延与 MTU。

保留运营商电路、设备、SLA、故障升级和维护通知信息,并通过自有监控判断实际可用性。运营商报告正常不替代端到端业务验证。

成本评估同时包含主备链路、端口、光模块、加密、跨站点流量和日常运维,避免只比较线路标称带宽。

常见问题

两地都有 400G 网络,是否适合把一个训练任务跨机房运行?
不能只看端口速率。还要评估站点间实际时延、抖动、丢包、通信模式、路由和故障,使用代表性 NCCL 或业务测试后决定。

Copyright © 2011-2026 北京中科新远科技有限公司 版权所有  Sitemap 备案号:京ICP备19012332号-2