2026年骁龙峰会上,高通技术公司宣布与阶跃、无量火、江波龙达成合作,基于第六代骁龙8超级至尊版移动平台,成功实现30B-MoE模型在智能手机端的部署。这项突破让300亿参数量级大模型具备在手机上规模化运行的条件。
第六代骁龙8超级至尊版搭载全新Oryon CPU、Adreno GPU和Hexagon NPU三大核心组件。其中Oryon CPU峰值频率达5GHz,配备可扩展缓存架构FlexCache,能处理复杂多任务;Adreno GPU引入专为AI设计的Matrix Cores和Neural Fusion特性,实现图形与AI计算深度融合;Hexagon NPU则通过Element Accelerator和扩容50%的共享内存,大幅提升端侧推理性能。
无量火的Ember推理引擎通过XCompute异构调度技术,将阶跃30B-MoE模型运行内存需求降低超50%。结合江波龙的端侧AI存储方案,模型权重可从闪存高效加载,实现存储与计算协同。这套系统能完成邮件理解、行程规划、航班酒店推荐等全链路自主办公,所有操作均在本地完成。
实测数据显示,NPU+GPU双引擎协同使模型预填充吞吐量突破330Token/s,解码速度达28Token/s,首个词元生成时间缩短至毫秒级。相比云端API调用效率提升数倍至数十倍,为智能手机带来更复杂的智能体AI体验。