微信扫码
与创始人交个朋友
我要投稿
前段时间写了篇英伟达IB组网的文章《256台H100如何组建集群?》,很多网友要求分享1024台服务器怎么组集群。刚好最近公司在建设华为昇腾910B集群,简单分享一下采用RoCE组网的“万卡集群”。
集群的物理网络按不同功能设计为4个网络:
业务网络/带内管理网络:主要用于系统业务调度与管理。当然,也可以将业务网络与带内管理网络可以分开。
带外管理网络:每个AI服务器或存储服务器提供1个GE网口接入到GE 交换机,接入到管理区网络,主要用于集群设备的带外管理与操作。
Spine采用华为框式RoCE交换机CE16808,Leaf采用华为盒式RoCE交换机CE9860。
Spine交换机(CE16808):每台交换机8块业务板,8业务板* 36端口/业务板*400G=288个400G端口。
Leaf交换机(CE9860):每台交换机4块业务子板,共16个上行400G端口+16个下行400G端口(一分二变为32个下行200G端口)。
再附上一张“Spine交换机-Leaf交换机-AI服务器”端口连线图,有点复杂,感兴趣的可以仔细琢磨一下,不感兴趣的直接跳过,哈哈。
以上16台Spine交换机(CE16808)最多可以接入288台Leaf交换机(CE9860),288台Leaf交换机下行组多可以提供288*32=9216个200G端口,即9216张昇腾910B卡(1152台昇腾910B服务器),四舍五入,勉强称为“万卡集群”。
如果将Spine交换机从CE16808换成16块业务板的CE16816,则16台Spine交换机最多可以接入576台Leaf交换机(CE9860),可以接入的昇腾910B卡也翻倍到18432张(2304台昇腾910B服务器),名副其实的“万卡集群”。
再进一步,如果Leaf交换机采用CE16808,最多可以提供288个400G端口,其中128个400G上行端口,128个下行400G端口(一分二变为256个下行200G端口)。与之对应,128台Spine交换机(CE16816),每台CE16816可以提供576个400G端口。如下图所示:
53AI,企业落地应用大模型首选服务商
产品:大模型应用平台+智能体定制开发+落地咨询服务
承诺:先做场景POC验证,看到效果再签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2024-09-19
o1 能带我们走进 AGI 吗?
2024-09-19
解锁医疗新未来:Sunsimiao-7B 中文医疗大模型震撼登场
2024-09-19
36%的国资央企组建大模型团队,沙丘智库发布《2024年国资央企大模型应用跟踪报告》
2024-09-18
AI大模型实战篇:LATS,可能是目前最强的AI Agent设计框架
2024-09-18
360视角:大模型幻觉问题及其解决方案的深度探索与实践
2024-09-18
太爽了!o1 现在可以天天享用了
2024-09-18
Claude Artifacts 数据分析的N种打开方式(附Prompt)
2024-09-18
如何微调(Fine-tuning)大语言模型?
2024-07-18
2024-03-30
2024-04-26
2024-04-11
2024-05-06
2024-06-12
2024-05-09
2023-07-01
2024-07-07
2024-07-25