微信扫码
与创始人交个朋友
我要投稿
前段时间写了篇英伟达IB组网的文章《256台H100如何组建集群?》,很多网友要求分享1024台服务器怎么组集群。刚好最近公司在建设华为昇腾910B集群,简单分享一下采用RoCE组网的“万卡集群”。
集群的物理网络按不同功能设计为4个网络:
业务网络/带内管理网络:主要用于系统业务调度与管理。当然,也可以将业务网络与带内管理网络可以分开。
带外管理网络:每个AI服务器或存储服务器提供1个GE网口接入到GE 交换机,接入到管理区网络,主要用于集群设备的带外管理与操作。
Spine采用华为框式RoCE交换机CE16808,Leaf采用华为盒式RoCE交换机CE9860。
Spine交换机(CE16808):每台交换机8块业务板,8业务板* 36端口/业务板*400G=288个400G端口。
Leaf交换机(CE9860):每台交换机4块业务子板,共16个上行400G端口+16个下行400G端口(一分二变为32个下行200G端口)。
再附上一张“Spine交换机-Leaf交换机-AI服务器”端口连线图,有点复杂,感兴趣的可以仔细琢磨一下,不感兴趣的直接跳过,哈哈。
以上16台Spine交换机(CE16808)最多可以接入288台Leaf交换机(CE9860),288台Leaf交换机下行组多可以提供288*32=9216个200G端口,即9216张昇腾910B卡(1152台昇腾910B服务器),四舍五入,勉强称为“万卡集群”。
如果将Spine交换机从CE16808换成16块业务板的CE16816,则16台Spine交换机最多可以接入576台Leaf交换机(CE9860),可以接入的昇腾910B卡也翻倍到18432张(2304台昇腾910B服务器),名副其实的“万卡集群”。
再进一步,如果Leaf交换机采用CE16808,最多可以提供288个400G端口,其中128个400G上行端口,128个下行400G端口(一分二变为256个下行200G端口)。与之对应,128台Spine交换机(CE16816),每台CE16816可以提供576个400G端口。如下图所示:
53AI,企业落地应用大模型首选服务商
产品:大模型应用平台+智能体定制开发+落地咨询服务
承诺:先做场景POC验证,看到效果再签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2024-05-28
2024-04-26
2024-04-11
2024-08-21
2024-07-09
2024-08-13
2024-07-18
2024-10-25
2024-07-01
2024-06-17