您正在访问亚汇网香港分站,本站所提供的内容均遵守中华人民共和国香港特别行政区法律法规。

Arm 发布第二代移动终端计算子系统 CSS for Mobile 2,支持双 SME2 引擎,神经加速 GPU

文 / 小亚 2026-09-08 12:39:04 来源:亚汇网

Arm方面表示,智能体AI的能力已从早期的问答交互,演进到理解用户意图并自主执行任务的阶段,智能体工作流和日益复杂的AI原生图形技术,对移动计算提出了新的要求。移动设备的性能表现将取决于三个核心维度:各任务阶段的执行速度、数据在不同计算引擎间的传输效率,以及系统对全任务流程的协同调度能力。CSSforMobile2据此从整体系统层面统筹优化性能、能效和数据传输效率,并将优化延伸至物理实现阶段,使合作伙伴在开展SoC集成之前,就能将功耗、性能和面积(PPA)与架构设计协同考量。该平台在组件选用上保留了灵活性,合作伙伴既可以单独选用各个组件,也可以将其与自研IP或第三方IP结合。ArmC2CPU集群:双SME2引擎CPU部分,ArmC2CPU集群融合了C2-UltraCPU、C2-ProCPU以及第二代Arm可伸缩矩阵扩展(SME2)技术。官方公布的数据显示,该集群在最新AI模型上的性能最高提升达1.7倍,单线程性能最高提升15%,网页浏览速度提升15%,应用启动速度提升12%,集群级多线程性能提升12%,可支持知识检索、模型准备和应用执行等任务并行处理。与上一代配置相比,新一代C2CPU集群集成双SME2引擎,SME2能力翻倍。具体到智能体AI工作流的各个环节:运行最新的Moonshine和Parakeet语音转文本模型时,搭载SME2的C2-Ultra相比C1-Ultra延迟降低40%,有助于缩短智能体AI交互的起始延迟;在记忆阶段,其内存信息检索与搜索性能较上一代提升41%;在推理阶段,小语言模型结合检索到的上下文生成结构化指令的平均速度较上一代提升25%。在涵盖语音处理、记忆检索、推理、应用执行和网页浏览等环节的端到端测试中,C2-Ultra配置相比上一代实现了24%的整体性能提升。Arm同时介绍了该工作流的核心编排层(OrchestrationLayer)。它负责维护任务状态、整合上下文信息,并决定工作流中每个阶段由哪个计算资源执行,执行过程可能涉及本地应用、端侧模型、其他计算资源或云端服务,CPU则统一协调权限管理与任务执行进程。MaliG2-UltraNX:神经网络加速器进入GPUGPU部分,MaliG2-UltraNX是Arm首款AI原生MaliGPU,核心变化是将专用神经网络加速器直接嵌入GPU着色器核心,使神经图形工作负载能够与图形和计算任务并行运行,并复用GPU的内存系统、一致性缓存和控制结构,减少数据在不同计算单元之间的传输。该GPU结合全新执行引擎和第三代光线追踪单元(RTUv3),为神经图形工作负载提供AI原生图形基础。该GPU支持三项神经网络加速技术,其中神经超级采样(NSS)基于低分辨率渲染画面重建更高分辨率的图像;神经帧率提升(NFRU)通过生成中间帧提高帧率;神经超级采样与降噪(NSSD)将超分与降噪相结合,面向复杂光线追踪场景。在Arm与SumoDigital基于虚幻引擎联合打造的演示游戏《光影新生》中,NFRU与NSSD方案与传统渲染相比实现了最高4倍的性能效率提升,外部内存流量降低多达70%,使虚幻引擎MegaLights等技术得以应用于移动设备。该GPU面向持续高帧率体验设计,可支持最高120帧每秒的稳定运行。执行引擎是ArmMali过去七代产品中规模最大的指令集架构升级,支持每个线程束的寄存器数量比上一代多达2倍,并采用动态寄存器分配机制减少寄存器溢出。与上一代产品相比,其基准测试性能最高提升24%,非AI游戏性能提升14%。光线追踪方面,新架构在主流光线追踪基准测试中可将DRAM流量最多降低13%,并对不透明度微贴图(OMM)提供硬件级支持。Arm的演示数据显示,使用OMM可使帧率提升30%,光线追踪工作负载最多降低70%。作为背景,ArmMaliGPU的累计出货量已超过140亿颗。软件生态:KleidiAI与ArmAIPortal软件层面,CSSforMobile2依托全球超过2200万的Arm开发者社区,通过KleidiAI与主流AI框架的深度集成,为ArmCPU提供优化的软件执行路径,开发者无需改变现有开发流程,即可利用SME2等底层能力。ArmAIPortal则在统一平台汇聚经过优化和验证的模型、性能与准确性数据、代码示例及部署资源,ArmMCP服务器将这些能力引入智能体AI开发环境,帮助开发者加快从评估到部署的开发流程。按照Arm公布的信息,CSSforMobile2为芯片合作伙伴提供了可灵活配置的基础平台,其后续在终端芯片和整机产品上的落地进展,大家可以进一步关注。

相关新闻

加载更多...