百度百舸Meetup聚焦Agent推理基础设施优化

9月22日,百度智能云联合SGLang社区举办"Agent时代的推理基础设施"主题Meetup,围绕多芯适配、上下文缓存等技术展开深度探讨。活动聚焦Agent规模化落地的核心痛点,强调推理基础设施对任务连续性、稳定性及成本控制的关键作用。
首页 新闻资讯 行业资讯 百度百舸Meetup聚焦Agent推理基础设施优化

9月22日,百度智能云联合SGLang社区举办"Agent时代的推理基础设施"主题Meetup,围绕多芯适配、上下文缓存等技术展开深度探讨。活动聚焦Agent规模化落地的核心痛点,强调推理基础设施对任务连续性、稳定性及成本控制的关键作用。

当前Agent任务呈现长输入、多轮次、强复用特征,393条真实任务轨迹显示输入输出比中位数达213∶1,极端情况下输入序列长度可达67.5万Token。这种复杂工作负载要求推理基础设施突破单纯追求模型响应速度的局限,转向系统性优化。

百度百舸通过多维度技术升级构建完整体系:sglang-kunlun插件打通昆仑芯适配,实现硬件可插拔机制;统一缓存管理体系让FULL与SWA混合模型在HiCache场景下命中率达96.8%;MoE专家压缩技术使显存占用降低50%,输出吞吐峰值提升2.23倍。服务治理层面引入动态调度、变长行为感知分桶等机制,保障高并发场景稳定性。

活动还披露Agent规模化落地的深层挑战。SGLang社区分享部署自动化经验,元神智算CEO探讨标准与生态建设,万涂幻象社区主理人聚焦上下文连续性问题。三位嘉宾共同指出,Agent价值不仅在于回答能力,更在于连续任务理解与交付能力。百度智能云表示将持续与技术社区共建,推动Agent从单点尝试走向规模化落地。