Arm CSS for Mobile 2发布 系统级优化成端侧智能体新战场
在端侧 AI 从"问答交互"演进为"理解意图并自主执行"的智能体时代,移动计算平台的设计理念正在发生根本性转变。Arm最新发布的第二代移动终端计算子系统(CSS for Mobile 2)正是这一转变的产物,它不再追求单一组件的峰值性能,而是围绕响应速度、能效与持续执行能力,对计算资源、系统IP、物理实现和软件生态进行一体化协同优化。
正如Arm所强调的,智能体AI工作流在单次交互中会同时调用移动系统的多个组件:数据处理、模型执行、内存访问、应用控制等环节必须保持紧密协同。CSS for Mobile 2将CPU、GPU、系统IP、软件及开发者工具整合为一个完整平台,并从整体工作负载的角度统筹优化性能、能效和数据传输效率,甚至将优化延伸至物理实现阶段,使芯片合作伙伴在SoC集成前就能将功耗、性能和面积(PPA)与架构设计协同考量。
C2 CPU 集群:智能体AI的编排中枢
C2 CPU集群是整个平台的调度核心,由C2 Ultra、C2 Pro核心与双SME2第二代可伸缩矩阵扩展引擎组成,兼顾通用计算与端侧AI算力,改善智能体运行延迟高、多任务并行能力不足的问题。
性能层面,对比上一代平台,C2 CPU集群AI模型性能最高提升1.7倍;单线程性能提升15%,网页浏览速度提升15%,应用启动速度提升12%,集群多线程性能提升12%,可以同时处理知识检索、模型推理、应用调用等多项任务。
新一代C2 CPU集群集成了双SME2引擎,实现SME2能力翻倍:运行Moonshine、Parakeet 语音转文本模型,延迟下降40%;设备本地记忆检索性能提升41%;小语言模型推理速度提升25%;完整端到端智能体工作流综合性能提升24%。
同时,CPU集群采用差异化拓扑架构,搭配私有L2缓存与大容量共享L3缓存,大幅减少内存访问频次,有效解决端侧内存密集型场景的延迟瓶颈,在设备功耗、散热约束下,保障智能体高频交互的灵敏响应。
C2 CPU集群的核心价值不仅在于算力,更在于其编排层能力。它负责维护任务状态、整合上下文信息,并决定工作流中每个阶段应由哪个计算资源(本地应用、端侧模型、其他计算资源或云端服务)来执行。CPU 统一协调权限管理、任务决策以及整个任务的执行进程,使系统即使面对高频并发的AI交互,也能在移动设备的功耗与散热约束下维持灵敏响应。
Mali G2 Ultra NX:AI原生移动GPU
CSS for Mobile 2搭载 Mali G2Ultra NX,这是Arm首款AI原生Mali GPU。它将专用神经网络加速器紧密嵌入着色器核心,搭配全新执行引擎与第三代光线追踪单元RTUv3,在移动端功耗约束下实现桌面级游戏画面表现。
GPU内置三项关键神经图形技术:神经超级采样(NSS)依靠低分辨率渲染重建高清画面,降低渲染负载;神经帧率提升(NFRU)生成中间帧拉高游戏帧率;神经超级采样与降噪(NSSD)把超分和降噪结合,改善光追场景画面噪点问题。
在Arm演示项目《光影新生》当中,对比传统渲染模式,整体效率最高提升4倍,内存流量最多减少70%,游戏可以稳定跑满120fps。
全新执行引擎是近七代Mali规模最大的指令集升级,线程束寄存器数量翻倍,借助动态寄存器分配,从容运行复杂着色器程序。相比上代,非AI游戏性能提升14%,基准性能最高提升24%。第三代光追单元优化几何数据结构,硬件支持不透明度微贴图(OMM),复杂植被、织物等场景帧率可提升30%,光追负载降低70%,光追场景DRAM流量最多下降13%。神经网络加速器支持电源门控,闲置时关闭电路控制功耗,适配手机续航需求。
SI L2 系统互连,释放异构计算全部潜力
再强大的计算引擎,也只有在数据能够高效传输的前提下才能充分发挥价值。CSS for Mobile 2 采用的 SI L2 系统互连,基于面向移动设备优化的架构设计,为异构工作负载提供服务质量(QoS)支持。
SI L2 可为整个平台提供更低的数据访问延迟和更高带宽,同时具备一致性和 QoS 能力,帮助管理和优化多个计算资源之间的任务调度与优先级分配。这在 CPU、GPU 及其他系统资源并行运行、共享数据及内存访问权限时尤为重要。SI L2 已支持 LPDDR5X、LPDDR5,并可适配 LPDDR6 等新型内存标准。
完善软件生态,降低开发者落地门槛
硬件能力想要落地,离不开软件生态支撑。Arm依托全球超2200万开发者社区,为 CSS for Mobile 2搭建完整开发工具链。
KleidiAI库深度对接主流AI框架,充分调动SME2 算力,开发者不用大幅修改现有代码,即可优化端侧AI模型运行效果。Arm AI Portal集合经过验证的模型、性能数据与示例代码,配合MCP服务器服务智能体AI开发,帮助开发者快速完成评估、调优、部署,也支持厂商自有模型做适配优化。
图形方向,神经图形开发套件兼容 Vulkan、虚幻引擎等主流工具,提供NSS、NFRU插件与性能分析工具。在中国市场,Arm上海团队和腾讯游戏、网易、Unity 中国深度合作,推进神经动态全局光照等前沿技术落地,助力国产手游拥抱AI图形能力。
为什么"系统级优化"是智能体AI的必然选择?
从Arm CSS for Mobile 2的发布可以看出,移动计算平台的竞争逻辑正在发生深刻变化:
第—,智能体AI工作流决定了"木桶效应"的凸显。 智能体在单次交互中需要串并联多个任务阶段,任何一环的延迟或能效瓶颈都会影响整体体验。因此,平台必须从"各组件峰值性能之和"转向"全链路协同效率"。
第二,CPU的角色正在从"通用算力"向"编排中枢"升级。 尽管NPU在计算密集型任务中具备更高的峰值算力(通常在100-200 TOPS级别),但 CPU(搭载SME2 后等效约5-6TOPS)在延迟优化、任务编排、跨平台兼容性方面具有不可替代的优势。对于轻量级模型(通常指20亿至30亿参数规模,如Gemma-2B、腾讯混元 HY-1.8B-2Bit),CPU是更合适的运行载体。
第三,AI 原生图形不是替代传统渲染,而是"效率倍增器"。 Mali G2-Ultra NX 的设计理念表明,神经网络技术最适合处理高复杂度的图形内容(如复杂光照、大规模几何细节),而简单内容的传统渲染依然高效。未来GPU的发展将是传统渲染与神经图形的深度融合,而非此消彼长。
第四,开放性与灵活性是生态扩张的关键。 CSS for Mobile 2的组件既可以单独选用,也可以与自研IP或第三方IP结合;Mali G2-Ultra NX以软IP形式交付,合作伙伴可自主决定着色器核心与 NX 单元的数量配置。这种灵活性使不同定位的移动设备都能找到最优的配置组合。
结语
Arm CSS for Mobile 2的发布,标志着移动计算平台正式进入"AI 原生"与"系统级优化"并重的新阶段。它不再以单一跑分成绩或单一加速器作为衡量标准,而是取决于整个系统将用户意图转化为实际行动的综合能力。
CSS for Mobile 2所构建的"CPU编排+GPU神经图形+系统级互连+开放软件生态"的完整平台,将为下一代更快速、更高效、更智能的移动体验奠定坚实基础。
关注我们


