AI 芯片的聚光灯此前几乎都在GPU和NPU上,智能体兴起后,CPU又被推回了舞台中央。
近日,Arm 在上海举行 Arm Everywhere China 年度大会,会上既有面向手机的第二代计算子系统 CSS for Mobile 2,也有用于数据中心的 Neoverse CSS N4 和 AGI CPU,机器人和自动驾驶也同步发布新产品和服务。
看起来分散的几条产品线,背后押注的是同一件事,AI 不会一直停留在问一句、答一句的聊天框里。智能体要持续访问数据库,调用工具并在多个应用之间切换。NPU 和 GPU 依然负责最吃算力的部分,CPU 则要接住调度、控制和大量通用任务,完整工作流里,任何一种芯片都很难单打独斗。
这也解释了 Arm 为什么把产品越做越重,过去它主要出售 CPU 和 GPU 的 IP 授权,如今,计算子系统和可直接部署的 CPU 平台都摆上了货架,客户可以少做一些底层整合,Arm 则能更深地进入一颗芯片的设计和交付过程。

智能体把 CPU 拉回算力中心
以手机场景为例,端侧大模型受制于功耗、散热和内存,不可能把所有任务都塞给 NPU。CPU 要维护上下文、调度应用,GPU 还得兼顾图形和并行计算,厂商比拼的重点因此不再只是某一个处理器跑得多快,而是整套系统能否在有限电量里顺畅配合。
CSS for Mobile 2 就是 Arm 给出的整套方案,它把 C2 CPU 集群、Mali G2-Ultra NX GPU、系统 IP、物理实现方案和软件工具预先整合在一起。对芯片公司而言,这相当于少走一段验证和适配的路,对 Arm 而言,则是把原本分散出售的 IP 打包成价值更高的产品。
Arm 称,最新小语言模型在 C2 CPU 集群上的运行速度最高提升 70%;与上一代 C1-Ultra 相比,C2-Ultra 的 AI 性能最高提升 1.7 倍,单线程性能最高提升 15%,在相同性能下,功耗最高可降低 38%。
GPU 一侧,Mali G2-Ultra NX 加入了专用神经网络加速器,可以在图形管线里完成超级采样、插帧和降噪。Arm 给出的数据是,神经网络场景下每瓦性能最高提升 4 倍,传统游戏性能最高提升 14%。腾讯互娱和 Unity 中国已经接入相关技术,网易《燕云十六声》和叠纸《无限暖暖》也在推进适配。
在数据中心领域,CPU 的角色更加明确,Arm 云与 AI 业务负责人 Eddie Ramirez 表示:“智能体是 7×24 小时不间断运行,工作负载不再以突发性为特征。”云厂商更在意单线程性能能否预测,服务等级能否稳定兑现。
Arm 首席营销官 Ami Badani表示:“GPU 和 CPU 配比未来会逐步接近,甚至有可能趋近 1:1。”这也是 Arm 最想争取的增量市场。
Arm 不再满足于只卖 IP
Neoverse CSS N4 和 AGI CPU 实际上是两种不同深度的生意。N4 留给客户较大的设计空间,面向仍想自研芯片的云厂商和芯片公司,单颗裸片最高支持 128 个内核,并支持 LPDDR6 和 PCIe 7.0。按照 Arm 的数据,与 CSS N3 相比,N4 性能最高可达 2 倍,每瓦性能最高提升至 1.25 倍,内存带宽最高提升至 1.75 倍。
AGI CPU 则往前多走了一步,它是一套可直接部署的芯片平台,客户不必从 IP 开始搭建。OpenAI、Meta、Oracle 和联想等公司正在围绕该产品开发方案。火山引擎计划推出基于 AGI CPU 的智能体沙箱,让不同 AI 智能体运行在彼此隔离、又可按需扩展的环境中。
从 IP 到 CSS,再到成品 CPU,Arm 交到客户手里的东西越来越完整。这样做的好处很直接,客户可以缩短开发周期,Arm 也有机会提高单个项目的收入。
但代价同样存在,产品做得越深,公司就要承担越多研发、制造协同和市场推广工作,也更容易触碰客户原本自己完成的设计环节。
Arm 援引 IDC 数据称,在加速计算场景中,采用 Arm 架构的机架级服务器市场规模已经超过 x86。Arm 眼下的筹码仍是能效、软件生态和横跨终端与云端的架构兼容性,据披露,合作伙伴累计出货的 Arm 架构芯片已经超过 3500 亿颗,相关软件开发者超过 2200 万人。
物理 AI 是 Arm 试图复制这种平台能力的下一个市场。机器人和自动驾驶系统既要运行模型,又要处理实时控制、安全、传感器和执行器,参与者比手机产业链更加分散。Arm 已把 Total Design 生态项目扩展到这一领域,参与企业超过 80 家,包括 AWS、Hugging Face、NXP、QNX、通义千问和西门子。
Arm 物理 AI 业务拓展副总裁 Dermot O'Driscoll 表示:“我们的目标是帮助解决方案提供商与终端用户建立连接,推动机器人方案从研发阶段走向实际部署。”这里最先落地的项目之一,是一套机器人能力分级框架,Arm 想用统一语言描述机器人的任务、时延、算力位置、内存、功耗和安全需求,方便不同厂商对接。
同样需要观察的,还有 Arm 与客户之间的边界。芯片企业使用 CSS 或 AGI CPU,开发速度会更快,自主设计空间也会相应缩小。云厂商一边采购 Arm 技术,一边继续保留自研能力,Arm 若想把产品卖得更深,就必须证明自己仍是一个足够中立的平台伙伴。
本文转自:凤凰网科技
原文地址: https://tech.ifeng.com/c/8wKY7ttNROT

小同爱分享4 个月前
命没了还有轮回,钱没了,死都不甘心。 - 小同爱分享
小同爱分享7 个月前
疫情,就是让人抑郁,又没了感情。 - 小同爱分享