双机房 AI 集群 DCI 怎么规划:业务边界、带宽与故障切换
说明双机房 AI 集群 DCI 在训练、数据复制、模型分发、控制面、带宽、时延、路由和灾备方面的规划边界。

双机房 AI 基础设施首先要决定哪些业务允许跨站点。把一个同步训练作业拆到两个高时延机房、在站点间复制数据集、同步模型制品和提供灾备,对带宽、时延和一致性的要求完全不同。
DCI 不是把两套 Leaf-Spine 直接延伸成一个大二层。站点边界、路由、故障隔离和恢复目标应先确定,再选择链路和协议。
按业务类型拆分跨站点流量
分别记录数据集复制、检查点、模型制品、容器镜像、管理控制、用户访问和可能的跨站点计算通信。每类流量说明方向、峰值、允许时延和完成窗口。
跨站点训练通信对时延和抖动敏感,必须用真实通信模式验证。链路标称带宽足够,不代表集合通信扩展可接受。
容量按并发与恢复窗口计算
日常增量复制、集中备份和灾后回灌可能同时发生。计算带宽时考虑峰值并发、协议开销和故障后补传,不能只用日均数据量除以一天。
为关键控制流量和业务访问保留容量,对可延迟的批量复制设置窗口或限速。QoS 不能替代链路总容量。
站点之间保持清晰路由边界
优先使用可汇总的三层互联,明确每个站点拥有的前缀、服务入口和故障通告。需要二层延伸的少数系统应单独评估广播、环路和故障扩大。
BGP/ECMP、多运营商或多链路设计要验证入向与出向路径、MTU 和故障收敛。不同方向带宽不对称时,复制和恢复计划也要调整。
灾备目标决定数据策略
明确 RPO/RTO、哪些数据必须同步、哪些可以重建、模型和配置由谁作为事实源。把所有数据无差别实时复制,可能占用大量带宽又不改善恢复。
站点故障时,调度、身份、DNS、存储和管理入口要共同切换。只有网络路由恢复,业务平台仍可能无法启动。
演练正常、拥塞和断链三种状态
测试代表性复制与访问并发、链路高利用、单运营商或单设备故障,记录吞吐、延迟、丢包、路由收敛和业务恢复。再验证链路恢复后的积压清理。
保存两站点时间同步的监控和日志。扩容 GPU 或存储后重新评估 DCI,不把初期数据量长期作为容量依据。
安全与运营商边界单独管理
明确链路是否经过运营商或公共设施、数据是否需要加密、密钥如何管理以及加密设备的带宽与故障域。安全处理不能在项目末期临时叠加,否则可能改变时延与 MTU。
保留运营商电路、设备、SLA、故障升级和维护通知信息,并通过自有监控判断实际可用性。运营商报告正常不替代端到端业务验证。
成本评估同时包含主备链路、端口、光模块、加密、跨站点流量和日常运维,避免只比较线路标称带宽。