Token是大模型处理的核心单元,其生成效率直接影响模型响应速度和服务能力。在训练和推理过程中,海量数据需要在多块GPU间分发汇总,若出现CPU调度拖累、存储访问卡顿或网络抖动,会导致GPU空转等待,严重拉低集群算力利用率。
中科曙光近日推出Token加速技术体系,以scaleFabric原生无损RDMA为核心网络传输底座,构建算-存-传三级紧耦合的Token加速通道。其中支撑GPU直通网络的IBGDA技术实现国内首次规模化落地,填补国产智算高速互连领域空白。
该技术体系通过GDR技术让网卡直接读写GPU显存,绕过CPU中转;IBGDA技术更进一步,让GPU自主驱动网卡管理数据传输,彻底消除传统路径的CPU延迟瓶颈。实测数据显示,单跳转发时延低至260纳秒,三跳基准时延较主流方案降低63%,有效抑制多级网络时延累积。
目前scaleFabric已完成DeepEP等主流框架适配,实现十万卡级超大规模集群验证。这项国产技术不仅提升多GPU集群数据交换效率,更为MoE等大模型提供高性能替代方案,全面释放国产智算基础设施算力潜能。