AI知识库

53AI知识库

学习大模型的前沿技术与行业应用场景


简单说说算力网络:华为“万卡集群”组网实战
发布日期:2024-07-28 08:15:51 浏览次数: 2010


前段时间写了篇英伟达IB组网的文章《256台H100如何组建集群?》,很多网友要求分享1024台服务器怎么组集群。刚好最近公司在建设华为昇腾910B集群,简单分享一下采用RoCE组网的“万卡集群”

集群的物理网络按不同功能设计4个网络

参数面网络:采用双层的Leaf-Spine组网,通过大带宽接口接入到Leaf交换机,实现多机分布式训练时的参数交换。


样本面网络:用于AI集群频繁访问海量样本场景,用于访问存储系统。


业务网络/带内管理网络主要用于系统业务调度与管理当然,也可以将业务网络与带内管理网络可以分开。



带外管理网络:每个AI服务器或存储服务器提供1个GE网口接入到GE 交换机,接入到管理区网络,主要用于集群设备的带外管理与操作。



务网络带内管理网络、带外管理网络采用传统的TCP/IP协议,参数面网络采用RoCE网络用于计算节点之间参数交换。样本面网络同样采用RoCE网络用于计算节点访问存储节点。


我们重点看参数面网络的组网设计(RoCE组网),采用Spine-Leaf二层组网,带宽收敛比1:1。典型的框盒架构如下图所示:

Spine采用华为框式RoCE交换机CE16808,Leaf采用华为盒式RoCE交换机CE9860。

Spine交换机(CE16808):每台交换机8块业务板,8业务板* 36端口/业务板*400G=288个400G端口。



Leaf交换机(CE9860):每台交换机4块业务子板,共16个上行400G端口+16个下行400G端口(一分二变为32个下行200G端口)。



服务器接入方式:与英伟达GPU采用多轨接入不同,昇腾910B卡接入Leaf交换机采用单轨接入,即1台服务器的8个昇腾910B卡只接入到同一台Leaf交换机(占用4个400G模块),也就是说,每台Leaf交换机(CE9860)最多可接入4台昇腾910B服务器。


再附上一张“Spine交换机-Leaf交换机-AI服务器”端口连线图,有点复杂,感兴趣的可以仔细琢磨一下,不感兴趣的直接跳过,哈哈。

以上16台Spine交换机(CE16808)最多可以接入288台Leaf交换机(CE9860),288台Leaf交换机下行组多可以提供288*32=9216个200G端口,即9216张昇腾910B卡(1152台昇腾910B服务器),四舍五入,勉强称为“万卡集群”



如果将Spine交换机从CE16808换成16块业务板的CE16816,则16台Spine交换机最多可以接入576台Leaf交换机(CE9860),可以接入的昇腾910B卡也翻倍到18432张(2304台昇腾910B服务器),名副其实的“万卡集群”

再进一步,如果Leaf交换机采用CE16808,最多可以提供288个400G端口,其中128个400G上行端口,128个下行400G端口(一分二变为256个下行200G端口)。与之对应,128台Spine交换机(CE16816),每台CE16816可以提供576个400G端口。如下图所示:

128台Spine交换机对应576台Leaf交换机,每台Leaf交换机对应256个下行200G端口,一共576*256=147456张昇腾910B卡,妥妥的“十万卡集群”。



53AI,企业落地应用大模型首选服务商

产品:大模型应用平台+智能体定制开发+落地咨询服务

承诺:先做场景POC验证,看到效果再签署服务协议。零风险落地应用大模型,已交付160+中大型企业

联系我们

售前咨询
186 6662 7370
预约演示
185 8882 0121

微信扫码

与创始人交个朋友

回到顶部

 
扫码咨询