从 GPU 数量到交换机端口:AI 集群完整 BOM 怎么算
说明如何从 GPU、服务器和 rail 数量推导网卡、交换机端口、上联、光模块、DAC/AOC、备件与管理网络 BOM。

AI 集群 BOM 不能从交换机端口数量倒推。正确顺序是业务规模、GPU 与服务器布局、每服务器网络端点、拓扑层级、上联比例、线缆距离和扩容预留。任何一个假设变化,都可能改变交换机和线缆数量。
售前清单应同时包含计算、存储、业务和管理网络。只计算高速计算端口,会遗漏 BMC、管理交换机、存储接口、配线和备件,最终仍无法完成上架。
先定义四个基础数量
例如相同 GPU 总数,采用每服务器 4 张或 8 张 GPU 会得到不同服务器数量;每节点 1 个或 8 个计算端口,又会得到完全不同的 Leaf 或 rail 交换机数量。没有这些输入,任何 BOM 都只是估算。
- GPU 总数与每服务器 GPU 数量,用于得到服务器节点数。
- 每服务器计算网卡或端口数量,用于确定单 rail 或多 rail 端点。
- 每服务器存储、业务和管理端口数量。
- 当前建设规模、一期预留和目标扩容规模。
端口计算方法
服务器下行端口数等于服务器数量乘以每服务器计算端口数。Leaf 数量除了满足下行,还要为 Spine 上联保留端口。无阻塞、1:1 或允许一定超售会改变上联数量。多 rail 架构应按每个 rail 独立计算并保持对称。
Spine 端口由 Leaf 数量和每台 Leaf 的上联数量决定,还要检查单台 Spine 故障后是否仍满足可接受带宽。端口总数不能等同于可用端口,冗余、管理和保留端口都要扣除。
| BOM 层级 | 计算输入 | 容易遗漏 |
|---|---|---|
| 服务器侧 | 节点数、每节点端口、卡型 | 挡板、插槽、辅助供电和固件 |
| Leaf/rail | 下行端口、上联端口、冗余 | 分拆、空闲预留和管理端口 |
| Spine | Leaf 数和每 Leaf 上联 | 故障后带宽与未来扩容 |
| 光模块线缆 | 每条链路的两端和距离 | 极性、配线架、弯曲半径和备件 |
| 管理网络 | BMC、交换机和管理节点 | 独立地址、日志、跳板和远程恢复 |
线缆数量不能只等于端口数量
一条链路可能使用一根 DAC/AOC,也可能使用两只光模块加一条光纤。分拆链路的模块、MPO/LC 连接和分支数量不同。跨机柜、跨排或经过配线架时,还要分别计算跳线和主干。
长度应从实际机柜和走线路径获得,不建议用机柜直线距离代替。高密度端口还要评估出线方向、理线架、弯曲半径和连接器散热。
软件和许可清单
硬件 BOM 之外应列出交换机网络操作系统、管理软件、监控、驱动、固件、RDMA 组件和通信库的版本或获取方式。涉及 DPU、vGPU、商业管理平台或第三方软件时,许可范围需单独确认。
不确定的许可、支持和订阅不能写成默认包含。应在报价和技术偏离表中明确由谁提供、覆盖哪些节点、持续多久以及续期方式。
预留和备件
预留应服务于明确的扩容路径,而不是统一加一个百分比。需要判断新增服务器是否仍能接入现有 Leaf,Spine 是否有端口,机柜是否有电力和空间。若下一阶段会跨越拓扑层级,一期就应预留相应上联和布线。
备件按故障影响、交付周期和现场更换能力配置。模块、AOC、DAC、风扇和电源的备件策略不同,关键链路还应有可验证的替换流程。
BOM 验收
采购前执行端口闭合检查:每个服务器端口都有对端,每个交换机端口都有用途,每条链路都有介质和长度,每个设备都有供电、管理和安装附件。现场按端口矩阵逐条核对。
价格、库存、交期和授权状态必须在项目时点向供应方确认,不能从历史项目直接沿用。完整 BOM 的价值是减少范围遗漏,并不替代当期商务和供货核验。