登录
首页
新闻
项目
关于
招聘
联系
留言
覆盖
ParaCache
ParaCache
中科曙光ParaCache首Token时延降98.5%破解推理瓶颈
大模型推理正面临“速度与成本”的双重挑战。传统自回归推理方式需要重复计算,导致响应变慢;而为加速推理引入的KV Cache又占用大量显存,模型越大、上下文越长,硬件成本越高。当显存被“打爆”,算力再强也难以应对更多请求,这道“内存墙”正成为全球AI基础设施的共性难题。
大模型推理
中科曙光
ParaCache
存算协同
AI基础设施
6
2026-08-28
中科曙光发布ParaCache方案提升大模型推理效率
8月28日,2026中国国际大数据产业博览会期间,中科曙光推出新一代词元加速方案ParaCache。这项技术通过保存并复用大模型已计算结果,让重复计算减少80%以上。实测显示,处理约12万词元输入时,模型开始回答前的等待时间最高可降98.5%;高并发场景下,系统每秒处理词元量达原值27倍。
大模型
ParaCache
存储技术
推理效率
人工智能
2
2026-08-28
1