国内首个全国产10万卡级AI超集群正式投用

记者从国家算力网络枢纽节点建设工作组获悉,近日国内首个全国产10万卡级AI超集群在宁夏算力枢纽正式上线投用,该集群是目前全球规模最大的全栈国产软硬件支撑的AI训练集群。 本次投用标志着我国大模型训练算力支撑能力摆脱对进口供应链的依赖,进入自主可控的规模化发展阶段。

据项目承建方披露,该超集群全部采用国产通用GPU芯片,FP16精度总算力达到12.8EFLOPS,单集群可支持万亿参数大模型的全量预训练,训练效率较此前同规模异构集群提升30%以上。 集群配套的算力调度系统、分布式存储系统、高速互联通信协议全部实现自主研发,核心组件国产化率达到100%,从硬件到软件完全不存在供应链断供风险。 目前该超集群已接入国家算力网络统一调度平台,将优先服务于基础大模型训练、生物医药分子仿真、极端气候模拟、航空航天流体动力学计算等国家级重点科研领域,同时向国内人工智能创新企业开放公共算力服务,算力使用成本较进口同类集群降低约40%

项目负责人表示,该集群的投用将有效缓解当前国内AI训练算力供给缺口,大幅降低大模型研发的算力准入门槛。 业内分析指出,10万卡级全国产AI超集群的落地,是我国算力产业链自主可控进程的标志性成果,验证了国产算力芯片、高速互联、集群调度等全栈技术已经具备大规模商业化落地的能力。 预计到2025年底,全国还将有至少3个同等规模的全国产AI超集群启动建设,进一步为我国人工智能产业的自主安全发展提供底层支撑。

网友留言(0 条)

发表评论