天津移动宣布,其与华为合作的AI推理加速方案已在空港智算中心正式商用,成为全国首个现网规模落地的运营商AI加速集群。这项方案通过华为OceanStor A800存储设备和AI算法,实现了算力、网络和存储的协同优化。
方案在天津移动内部自用业务和对外Token服务中发挥关键作用。特别是为近期推出的Token套餐和9月校园大赛提供支撑,帮助打造"Token工厂"品牌。目前月均Token调用量已达500万次,正在为高校算力竞赛提供支持。
当前大模型推理面临KV Cache数据量激增的挑战,天津移动联合华为通过UCM技术构建了AI加速底座。现网数据显示,该方案在支持GLM-5.1、Kimi-K2.6等主流模型时,单卡吞吐量提升1.1-3倍,首Token时延降低30-40%。
技术验证显示,通过KV Cache高效复用,Token推理成本降低30%。这种"低成本"模式不仅提升了内部Agent开发效率,也为算力普惠提供了新路径。天津移动负责人表示,未来将深化技术攻关,拓展ToB市场。
华为方面指出,该方案已通过现网验证,具备全国复制的条件。双方合作标志着AI推理技术从实验室走向商业落地,为Token经济开辟新赛道。
算力普惠新范式,Token经济加速落地。