中科曙光
中科曙光
中科曙光ParaCache首Token时延降98.5%破解推理瓶颈
大模型推理正面临“速度与成本”的双重挑战。传统自回归推理方式需要重复计算,导致响应变慢;而为加速推理引入的KV Cache又占用大量显存,模型越大、上下文越长,硬件成本越高。当显存被“打爆”,算力再强也难以应对更多请求,这道“内存墙”正成为全球AI基础设施的共性难题。
1