Arm 第二代移动计算平台 CSS for Mobile 2发布:AI 原生,CPU 管智能体、GPU 管神经图形
当手机里的 AI 从"回答一个问题"进化到"替你完成一件事",衡量移动计算平台的标准就变了。智能体需要持续感知、记忆、推理和行动,图形渲染需要在不增加功耗的前提下逼近桌面级画质,两个变化同时指向同一个问题:移动 AI 的计算平台应该具备什么,谁能提供一套被市场广泛采纳的标准答案,谁就掌握下一代移动体验的定义权。9 月 8 日,Arm 在上海举行的 Arm Everywhere China上给出了自己的答案,第二代移动计算子系统 CSS for Mobile 2,一个 AI 原生的计算平台。
Arm 边缘 AI 智能终端计算副总裁 James McNiven、Arm 边缘 AI CPU 产品管理总监 Daniel Lu 与 Arm 边缘 AI 高级产品经理 Deyan Lazarov 分别深入解析了行业趋势与新一代计算平台全貌、CPU 与 GPU 技术细节。这套 AI 原生计算平台由 C2 CPU 集群、Mali G2-Ultra NX GPU 和 SI L2 系统互连组成,配套 KleidiAI 软件库与全新的 Arm AI Portal 开发者入口。
从生成式到智能体:移动计算的新变量
Arm 认为,AI 正在经历一个转折点。第一代生成式 AI 以问答为主,用户提问、模型回答,大量计算发生在云端。每一次交互都要往返数据中心,延迟、连接和成本的问题随之而来。智能体 AI 的工作方式完全不同,它围绕一个目标持续运行,不断重复感知、记忆、推理、行动四个阶段。以一个"帮我订周年晚餐"的智能体工作流为例,设备要先理解语音指令,再从日历和相册中检索个人信息,接着生成结构化指令,最后跨应用执行订位、发消息、导航等动作。James McNiven 的总结是,AI 正在从被动响应走向主动执行,而主动执行意味着计算必须更多地在设备本地完成。
这种工作负载有三个特征。一是延迟敏感,用户等待的是整个流程的响应时间,而不是单一算子的吞吐。二是突发性强,忙时需要立即响应,闲时应当省电。三是高度异构,一部分任务跑在本地 CPU 上,一部分卸载到 GPU 或 NPU,还有一些要上云。Arm 的判断是,这个编排循环的每一环都离不开 CPU,CPU 因此成为智能体 AI 的核心。在 Arm 描绘的分工图里,CPU 负责编排与轻量 AI 工具调用,GPU 承担并行 AI 计算,专用加速器处理特定负载,云端运行大模型,四类资源各司其职。
去年随上一代平台推出的 SME2 已经在这一年里铺开。James McNiven 透露,目前几乎所有旗舰智能手机,无论是安卓还是 iOS 机型,均已采用 SME2。生态侧的进展同样可观,支付宝、淘宝、腾讯混元、通义千问、网易伏羲、vivo、OPPO、三星、Unity 中国以及 Google AI Edge Gallery 都已接入 SME2 生态。对 Arm 而言,SME2 的目标是把自家指令集做成本地 AI 的首选。
Arm 还在活动现场展示了 Google Android AI 产品负责人的观点。他的判断是,用户正在从"被问才答"转向期待系统主动找信息并在合适的时机递上来,这需要 NPU、GPU、CPU 协同工作,而 CPU 位于系统中心承担编排职责,SME2 提供的低延迟交互能力恰好支撑这种体验。Arm 借此说明,SME2 的采纳不只是芯片厂商的事,操作系统侧也在同步跟进。
对 AI 演进的判断,Arm 保持着相当克制的态度。当被问及智能体时代 CPU 的重要性是否会再度提升、CPU 与 NPU 的算力配比是否会再次调整时,Daniel Lu 表示:“回顾过去十年,行业对不同工作负载的侧重,其实折射出了每一代计算需求的演进。因此如果简单地认为明年 CPU 会变得“更加重要”,这样的结论并不准确。”
移动图形同样面临转折点。桌面级内容正在进入手机,分辨率更高,几何复杂度逐年翻倍,光线追踪从点缀变成全场景照明。而手机的热设计功耗和电池容量没有本质变化。Arm 的思路是让 AI 直接进入 GPU 渲染管线,用神经网络重建像素、补全帧、消除噪声,把桌面级画质压进移动端的功耗预算之内。
CSS for Mobile 2:AI 原生的平台架构
CSS for Mobile 2 延续了 Arm 计算子系统的交付模式,把 CPU、GPU、系统 IP 与物理实现打包成一个可配置的平台,芯片合作伙伴在此基础上做差异化定制。计算子系统是 Arm 近年推出的交付模式,不同于单点出售 CPU 或 GPU IP,它把移动平台所需的计算组件连同系统互连、物理实现整体交付。去年的第一代产品把这套模式带进移动市场,今年的第二代则把重点转向 AI 原生。命名上也有变化,上一代平台的代号是 Lumex,今年直接命名为 CSS for Mobile 2。James McNiven 在媒体问答环节解释了这一调整:“Arm 在 COMPUTEX 2026 上也介绍过面向 PC 领域的 CSS for PC。通过这种简化的命名方式,希望能帮助大家更清楚地了解每一个 CSS 具体针对的是哪个行业。”
平台的第一个部分是 C2 CPU 集群。参考配置为 2 颗 C2-Ultra 加 6 颗 C2-Pro,集群配备两个 SME2 单元,AI 能力较上一代翻倍,集群等效 AI 算力约 5 至 6 TOPS。第二个部分是 Mali G2-Ultra NX,Arm 首款 AI 原生 GPU,将神经网络加速器直接集成进着色器核心,并换上全新执行引擎与第三代光线追踪单元。第三个部分是 SI L2 系统互连。这一代系统 IP 采用通道化的互联架构,完整支持 LPDDR6,同时兼容 LPDDR5X 与 LPDDR5,提供高级 QoS 特性、高效的 MTE 内存标记实现与 DVM 支持,并针对移动场景做了 PPA 优化。最直观的收益是延迟,CPU 访问 DRAM 的负载延迟较上一代 SI L1 降低最高 45%。James McNiven 提醒,这虽是纳秒级的优化,但在 SoC 系统里每一纳秒都至关重要。
三个部分的整体收益体现在几个关键数字上。GeekBench 6.3 单线程性能提升 15%,多线程提升 12%,Speedometer 3.1 网页浏览性能提升 15%,应用启动速度提升 12%。针对最新 AI 模型,语音类任务的执行速度最高提升 70%,相当于 1.7 倍。在神经图形场景中,帧率与能效最高提升 4 倍。上述对比均基于上一代平台与 Arm FPGA 参考平台的测试结果,参考集群统一采用 2 颗大核加 6 颗中核的 2+6 配置,以保证两代之间口径一致。
平台同时保留了充分的灵活性。合作伙伴既可以单独选用各个组件,也可以将其与自研 IP 或第三方 IP 结合,根据产品定位调整核心配比,这也是 Arm 计算子系统的既有模式。物理实现的提前交付意味着芯片厂商在 SoC 集成之前,就能把 PPA 与架构设计放在一起考虑。
C2 CPU 集群:为智能体编排而设计
C2-Ultra 是这代集群的性能核心。按照 Arm 公布的信息,这颗核心的改进集中在三个方向。更大的执行引擎让更多指令保持并行运行,更智能的数据搬运缩短访存等待,更强的分支预测与取指能力减少错误路径。分支密集的代码会因此受益,Arm 的测试显示各场景下分支误预测均有下降。后端停顿同样得到改善,更快的加载数据可用性与更大的存取容量,让依赖数据的后续工作更早开始。综合结果是峰值性能较 C1-Ultra 提升 15%(4.45 GHz 及以上主频下测得),同性能下功耗降低 38%。
C2-Pro 负责持续性能。这颗核心延续了上一代 C1-Pro 的微架构,合作伙伴可以借助 2nm 等制程改进进一步提升频率。集群内每颗核心配备私有 L2 缓存,并通过 DSU 动态共享单元挂接共享 L3 缓存。两级缓存的组合减少了访问系统缓存与 DRAM 的频次,这是面向内存受限场景的关键设计。Daniel Lu 在回答关于内存密集型场景的提问时提到,这套拓扑在应对内存受限场景时具有独特优势。
智能体工作流的收益可以分解到四个阶段。按照 Arm 的测试,语音转写环节在 Moonshine 与 Parakeet 模型上的延迟较上一代降低 40%,记忆检索环节在 LFM2.5-Colbert-350M 上的速度提升 41%,推理阶段小语言模型生成结构化提示的平均速度提升 25%,端到端工作流整体快 24%。
Arm 对 CPU 的定位非常克制。与 NPU 动辄 100 至 200 TOPS 的算力相比,搭载 SME2 的 CPU 集群等效算力只有 5 至 6 TOPS。Daniel Lu 表示:“所以我们认为 CPU 的核心指标是降低延迟,而非峰值性能;峰值性能通常是 GPU 或者 NPU 更擅长的领域,它们更适合持续运行高计算密集度的算法。”
CPU 的主要应用场景是轻量级模型。James McNiven 给出了一个参照区间,所谓轻量级模型主要是 20 亿至 30 亿参数规模,例如 Gemma-2B 和腾讯混元 HY-1.8B-2Bit 这种级别。SME2 为此配套了查找表指令 LUTi,让 CPU 可以直接处理 2-bit 等低位宽的权重与激活值,省去大量内存访问。Arm 在活动现场演示了一个纯 CPU 推理的实时翻译,混元 2-bit 压缩模型约 300 MB,负责翻译,千问 TTS 以 FP32 精度做声音克隆,整个过程仅由 CPU 多线程完成。
在 NPU 布局的问题上,Arm 的策略同样明确。手机端 NPU 的创新交由合作伙伴主导,Arm 把工程资源集中在 CPU 与 GPU 上,因为更广泛的第三方开发者倾向于使用标准化的计算资源,跨平台兼容性对他们尤其重要。至于核心数量,C2 集群最高可支持 14 核,从入门到旗舰有多种档位,具体配比由芯片厂商按目标工作负载自行选择。
另外,GeekBench 6.3 单线程基准测试反映的是通用计算性能提升 15%;而 1.7 倍来自特定的语音类 AI 模型,得益于 CPU 矩阵运算密集任务的处理能力提升。这两个数字,一个反映日常应用,一个反映端侧 AI,说明进入智能体时代后,CPU 的评测指标正在进一步分化,这同样值得我们关注。
Mali G2-Ultra NX:AI 原生 GPU 与神经图形技术
Mali G2-Ultra NX 是 Arm 首款 AI 原生 GPU。它的核心变化是把神经网络加速器 NX 紧密集成进着色器核心,让神经图形任务与图形、计算任务共享内存系统与一致性缓存,在 1 至 2 W 的功耗预算内持续输出神经图形算力。由于复用了现有架构,NX 的芯片面积占用很小。
三项神经图形技术构成这一代 GPU 的核心功能。NSS 神经超级采样用低分辨率渲染重建高分辨率画面,输入低分辨率颜色、运动矢量、深度与帧历史,最多可以做到 8 个像素中 7 个由 AI 重建,并把抗锯齿一并完成。在 Arm 的两项游戏演示中,NSS 带来 2.1 倍与 1.9 倍持续功耗预算下的帧率提升,外部内存流量降低 50%,每帧动态能耗降至约一半。NFRU 神经帧率提升在两个渲染帧之间生成 AI 中间帧,把帧率翻倍,当前版本生成一帧,多帧生成的路线图已在规划中。NSSD 神经超级采样与降噪面向光线追踪场景,同时完成超分与降噪,让全场景照明在移动端变得可行,目前处于 Early Access 阶段。
这些技术的关键词是开放。NSS 与 NFRU 的模型已开源到 Hugging Face 与 GitHub,开发者可以针对自家游戏的美术风格重新训练模型,而不是使用固定模型。Arm 还向 Khronos 提交了 Vulkan ML 扩展提案,并与腾讯游戏共建 AI 渲染联合实验室,探索神经动态全局光照等方向。在腾讯游戏 Arena Breakout Infinite 的演示内容上,双方也对比了 NSSD 开启前后的画面差异。
实际收益来自 Arm 与 Sumo Digital 合作开发的《光影新生》。这款基于虚幻引擎的作品实现了 UE 5.5 MegaLights,最多 1400 个动态光源,全场景光线追踪照明。开发团队借助神经图形技术,把内容复杂度提升了一倍。在 G2-Ultra NX 上,它的帧率从 15 FPS 提升到 60 FPS,最高 4 倍帧率提升、4 倍能效提升,外部内存流量最多降低 70%。具体到技术路径,NSSD 把 540p 的低分辨率输入重建为 1080p 输出,NFRU 把 30 FPS 的输入提升为 60 FPS 的呈现。另一项演示中,NFRU 把 60 FPS 的持续游戏体验提升到 120 FPS,同时 DRAM 流量降低 33%。
神经图形之外,传统渲染路径同样有代际提升。全新执行引擎是 Mali 七代以来规模最大的 ISA 重构,每线程束可用寄存器数量最多翻倍,并支持动态寄存器分配,明显减少寄存器溢出。第三代光线追踪单元引入更紧凑的三角形数据结构与硬件级不透明度微贴图 OMM 支持。综合结果是基准测试性能平均提升 20%,游戏实测最高提升 14%,光追场景 DRAM 带宽最高降低 13%,OMM 场景下光追负载最多可降 70%,帧率最高提升 30%。
对 AI 与传统渲染的关系,James McNiven 认为:“AI 在处理复杂内容时优势显著,例如,对于拥有大量几何细节和复杂渲染需求的桌面级画面内容,AI 能够发挥非常明显的作用。但并不是所有内容都这么复杂,对于简单的内容,本身渲染起来就不难,AI 带来的增益相对有限。”
面对帧生成带来的延迟问题,Deyan Lazarov 给出了量化解释,以 30 FPS 场景为例,单帧时间预算约 33 ms,开发者需要在这个窗口内完成原始帧渲染与 AI 帧插入,同时配合 Frame Pacing 帧步调方案保证输出节奏稳定,还可以通过降低原始渲染分辨率来节省时间。Deyan Lazarov 还提到:“在最新版本中,我们还引入了不同质量等级(quality tiers)的模型。也就是说,如果开发者愿意在一定程度上牺牲画面质量,就可以选择运行速度快得多的网络模型。”
软件生态:开发者与智能体的统一入口
硬件的价值最终要靠软件兑现。CPU 侧,KleidiAI 已有超过 100 个第三方应用集成、超过 12 个 AI 框架集成、超过 200 个优化微内核、超过 14 万行代码,并以 Apache 2.0 许可开放外部贡献。过去几个月,Arm 在模型侧的推进明显加快,4 月与 Google Gemma 合作发布 Gemma4-E2B 的 SME2 优化,同月落地腾讯混元 HY-MT1.5-1.8B-2Bit 的 2-bit 量化支持,5 月与 Stability AI 合作优化 Stable-audio-open-small,7 月与通义千问推进 Qwen3-TTS。Google AI Edge Gallery 已原生支持 SME2。GPU 侧,Arm 在硬件就绪之前就发布了神经图形开发套件与开源网络,并为虚幻引擎等主流引擎提供插件,开发者几乎不需要额外配置即可启用 NSS。
此次全新计算平台在软件侧的重点是 Arm AI Portal。这是面向开发者与智能体的统一入口,它提供三类能力,预优化模型库,覆盖 SME2、G2-Ultra NX、Ethos-U NPU 与云 CPU 等目标,并可按设备类型、架构支持、运行时与数据类型筛选;模型优化工具,处理量化与移植问题,当前处于 Early Access 阶段;以及从集成、评估到部署的完整工作流。开发者还可以安装配套的 Arm MCP Server,把 AI Portal 的能力带入自己常用的开发环境。被问及智能体与传统开发者是否需要差异化对待时,James McNiven 表示:“我们不能再只提供一个供用户浏览和下载内容的网页。我们还需要提供类似 MCP Server 这样的能力,让智能体能够自主完成模型选择和调用。”
定义移动 AI 的计算平台标准
回到开头的问题,谁能定义移动 AI 的平台标准?支撑这个判断的是几个事实。Arm CPU 覆盖 99% 的智能手机,Mali GPU 累计出货超过 140 亿颗,SME2 在发布一年内进入几乎所有旗舰智能手机,并朝着本地 AI 首选指令集的目标推进。在路线选择上,Arm 把手机端 NPU 的创新空间留给合作伙伴差异化,把 CPU 与 GPU 做成开放的行业基础,再用统一的软件生态连接开发者与智能体。对芯片厂商而言,这是一条成本可控、生态现成的路径,对第三方开发者而言,这意味着一次开发、跨设备部署的兼容性。
中国市场在这套布局里的分量同样清晰。James McNiven 在回答媒体提问时透露:“我们的生态团队布局全球,上海就有一支规模很大的团队,他们和 Unity 中国、腾讯游戏、网易等企业都有非常紧密的合作。”
还有一个值得记录的变化。过去几年,移动端 AI 的竞争焦点一直在 NPU 的 TOPS 数字上,进入智能体时代,CPU 的编排能力与内存系统的重要性回升。Daniel Lu 对此的回答谨慎而务实,他认为行业始终在针对不同设备和场景寻找最合适的算力平衡点,未来几年这种平衡仍会持续演进。他举了云计算的例子,五年前业内普遍讨论一个 CPU 搭配八个 GPU 的配置模式,如今这一比例已经明显变化。移动端的 CPU、GPU、NPU 配比大概率也会走上同样的调整之路。
智能体 AI 与神经图形会不会按 Arm 的预期落地,取决于接下来一年芯片厂商与游戏开发者的实际采纳。但从 CPU 指令集到 GPU 神经图形,再到面向智能体的工具链,Arm 已经为移动 AI 计算提供一套标准答案,我们将期待未来合作伙伴的采纳速度与终端产品的实际表现。





