
AI Network Architecture
算力网络架构
从业务流量和扩展目标出发,分析 InfiniBand、RoCE、Leaf-Spine、Rail-Optimized、存储网络和管理网络的架构取舍。
栏目文章
InfiniBand、RoCE、Leaf-Spine、Rail-Optimized 与多平面网络
InfiniBand 与 RoCE 怎么选:从业务瓶颈到网络验收
结合 AI 训练、HPC、现有以太网基础和运维能力,比较 InfiniBand 与 RoCE 的技术原因、架构方案、部署条件和验收方法。
阅读全文
RoCE Leaf-Spine 的 ECMP 怎么规划:路径数量、散列与热点
说明 RoCE Leaf-Spine 网络中 ECMP 路径、路由邻接、流量散列、作业放置、拥塞遥测和故障验证的规划方法。
阅读全文常见问题
围绕训练、推理、服务器形态与边缘部署,补充常见选型判断。
AI 集群的计算、存储和管理网络必须全部物理隔离吗?
不一定。小规模环境可以在满足带宽、队列、安全和故障隔离的前提下共享部分设备,但计算网络和带外管理通常应优先建立清晰的独立边界。
已有以太网交换机就一定适合直接部署 RoCE 吗?
不一定。需要确认交换机和网卡对优先级、PFC、ECN、DCQCN、缓冲、MTU和遥测的支持,并完成端到端参数设计和压力测试。
Rail-Optimized 是否一定比普通 Leaf-Spine 更快?
不一定。它需要多网卡服务器、正确的 GPU/NIC/NUMA 映射、对称布线和通信库配合。规模较小或绑定错误时,增加的复杂度未必带来收益。
Quantum-2 交换机的一个 OSFP 笼口是否只能连接一个服务器端口?
不一定。具体连接数量取决于交换机端口模式、目标速率、分拆线缆和服务器网卡端口。规划时必须区分物理笼口、逻辑端口和分支链路。
每台服务器使用一张双端口网卡连接两台交换机就算完整双 Rail 吗?
不一定。两个端口仍共享网卡和 PCIe 故障域;还要确认交换平面、路由或子网、GPU/NIC 映射、线缆路径和软件使用方式是否真正独立。
AI 训练网络是否必须全部采用 1:1 无阻塞设计?
不一定。应依据通信模型、并发、作业放置和故障目标计算;但采用收敛设计必须通过代表性并发业务验证其对完成时间和尾部时延的影响。
训练网络与存储网络使用同样的 400G 端口就可以放心共享吗?
不能只看端口速率。还要评估两类流量并发、队列与 QoS、主机 PCIe/NUMA、故障域和最坏状态下的业务完成时间。
增加 ECMP 路径数量是否一定能消除 RoCE 网络热点?
不一定。还取决于业务独立流数量、散列字段、路由是否真正等价、作业放置和拥塞控制;少量大流仍可能集中在个别路径。
同时运行两个 InfiniBand 子网管理器就一定具备高可用吗?
不一定。还要确认角色选举、故障域、配置与分区一致、管理可达、监控和实际切换行为;两个实例共享同一主机仍是单点。
AI 网络预留一定比例的交换机端口就足以支持后续扩容吗?
不足。还要预留 Spine 容量、端到端介质、机柜与电力、管理端口、地址、路由、监控和变更窗口,并明确每个预留端口对应的扩容位置。