微信扫码
添加专属顾问
我要投稿
前段时间写了篇英伟达IB组网的文章《256台H100如何组建集群?》,很多网友要求分享1024台服务器怎么组集群。刚好最近公司在建设华为昇腾910B集群,简单分享一下采用RoCE组网的“万卡集群”。
集群的物理网络按不同功能设计为4个网络:
业务网络/带内管理网络:主要用于系统业务调度与管理。当然,也可以将业务网络与带内管理网络可以分开。
带外管理网络:每个AI服务器或存储服务器提供1个GE网口接入到GE 交换机,接入到管理区网络,主要用于集群设备的带外管理与操作。
Spine采用华为框式RoCE交换机CE16808,Leaf采用华为盒式RoCE交换机CE9860。
Spine交换机(CE16808):每台交换机8块业务板,8业务板* 36端口/业务板*400G=288个400G端口。
Leaf交换机(CE9860):每台交换机4块业务子板,共16个上行400G端口+16个下行400G端口(一分二变为32个下行200G端口)。
再附上一张“Spine交换机-Leaf交换机-AI服务器”端口连线图,有点复杂,感兴趣的可以仔细琢磨一下,不感兴趣的直接跳过,哈哈。
以上16台Spine交换机(CE16808)最多可以接入288台Leaf交换机(CE9860),288台Leaf交换机下行组多可以提供288*32=9216个200G端口,即9216张昇腾910B卡(1152台昇腾910B服务器),四舍五入,勉强称为“万卡集群”。
如果将Spine交换机从CE16808换成16块业务板的CE16816,则16台Spine交换机最多可以接入576台Leaf交换机(CE9860),可以接入的昇腾910B卡也翻倍到18432张(2304台昇腾910B服务器),名副其实的“万卡集群”。
再进一步,如果Leaf交换机采用CE16808,最多可以提供288个400G端口,其中128个400G上行端口,128个下行400G端口(一分二变为256个下行200G端口)。与之对应,128台Spine交换机(CE16816),每台CE16816可以提供576个400G端口。如下图所示:
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费场景POC验证,效果验证后签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2025-04-24
温度参数:调节AI输出的确定性与创造性平衡
2025-04-24
从搜索到解决方案:解锁火山 DeepSearch 的“三连跳” MCP 玩法
2025-04-24
一文搞懂:RAG、Agent与多模态的行业实践与未来趋势
2025-04-24
字节扣子空间 VS 智谱AutoGLM,谁家Agent更好用?(附邀请码)
2025-04-24
Function Calling已经过时 ,MCP才是真正的大模型接口标准
2025-04-24
大模型技术创新驱动的AI生态和应用演进
2025-04-24
除了MCP我们还有什么?
2025-04-24
LLM 推理引擎之争:Ollama or vLLM ?
2024-08-13
2024-06-13
2024-08-21
2024-09-23
2024-07-31
2024-05-28
2024-08-04
2024-04-26
2024-07-09
2024-09-17