华为汪涛:超节点成大模型高效训练关键

9月17日华为全联接大会现场,汪涛首次公开大模型算力瓶颈的破局之道。当前全球顶尖AI模型已进入万亿参数级竞争,传统算力集群正面临效率瓶颈。他直言:"10万卡算力集群将成训练标配,但传统架构的通信代价已超训练总时长40%。"
首页 新闻资讯 行业资讯 华为汪涛:超节点成大模型高效训练关键

9月17日华为全联接大会现场,汪涛首次公开大模型算力瓶颈的破局之道。当前全球顶尖AI模型已进入万亿参数级竞争,传统算力集群正面临效率瓶颈。他直言:"10万卡算力集群将成训练标配,但传统架构的通信代价已超训练总时长40%。"

汪涛用一组数据揭示行业痛点:8卡服务器组成的10万卡集群,芯片间通信延迟让算力利用率每提升1%,就相当于提前3天完成模型迭代。这在AI领域堪称"分秒必争"。传统架构下,服务器间通信延迟从纳秒级飙升到微秒级,导致计算资源严重浪费。

华为超节点技术直击核心问题。通过光互联技术,让数万颗芯片像电脑一样协同工作,实现通信带宽与时延的线性增长。仿真显示,4k-NPU超节点集群的MFU值比传统架构高2.75倍,这直接关系到模型训练效率。汪涛强调:"超节点是构建超大规模AI基础设施的必然选择。"

技术突破背后是完整生态支撑。华为开放的灵衢协议已形成11颗关键芯片矩阵,涵盖计算、互联、存储等环节。从鲲鹏CPU到昇腾NPU,再到专用缓存单元,这套芯片组合为超节点提供底层支撑。汪涛透露,这套方案已通过大规模集群验证。

超节点或成AI算力升级新方向