当前222位置:首页 > 原创 > 刘岩轩
[导读]衡量一块 AI 芯片的标准,正在从 峰值算力有多高 ,变成 能不能稳定地产出Token 。当 Token 把算力与模型统一成同一个度量单位,芯片价值的衡量也就回到了业务本身。近日,海光信息在贵阳举行的 2026 中国国际大数据产业博览会上首发 Agent to Token 开放计算架构,正是对这一转变给出的体系化回应。

衡量一块 AI 芯片的标准,正在从"峰值算力有多高",变成"能不能稳定地产出 Token"。当 Token 把算力与模型统一成同一个度量单位,芯片价值的衡量也就回到了业务本身。2026 年 8 月 27 日,海光信息在贵阳举行的 2026 中国国际大数据产业博览会上首发 Agent to Token 开放计算架构,正是对这一转变给出的体系化回应。

在活动期间,我们有幸采访了海光信息总裁助理兼智能计算产品部总经理杜夏威与海光信息总裁助理兼服务器产品部总经理张攀勇,两位分别从 DCU 与 CPU 两条产品线出发,解读了这套架构的设计逻辑。


双芯协同,贯通 Agent 业务流到词元生产

海光把这套架构命名为 Agent to Token,指向的是 AI 落地方式的变化。过去行业谈论算力,关注的是芯片的峰值性能;谈论大模型,关注的是参数量。当 Token 把两者统一起来,讨论的焦点变成了性价比与业务效果。Agent 的出现,则把这条链路再向上推了一层,进入真正的业务场景。杜夏威说:“所以这次我们去提出来所谓的Agent to Token,更加强调的是当我们由传统的算力到了Token,强调性价比与实际的应用效果之后再往上一层,我们来到了真正的业务层,就是围绕着Agent,当我们需要实现业务化集成的时候,这里面可能就不再简简单单是AI芯片或者是海光DCU所要发挥效能就能完全决定的,这里面还涵盖了与CPU侧的联动。”

在架构分工上,海光 CPU 承担 Agent 业务流的系统枢纽职能,覆盖数据预处理、多智能体沙箱隔离、任务编排决策、记忆体分级存储、向量数据库检索五个模块。DCU 聚焦词元生成侧的并行计算,承担批量解码、KV 缓存优化、预处理加速、长序列支撑等工作。双芯协同可根据 Agent 并发规模、任务复杂度与词元生成量级动态调配资源。

海光把 Agentic AI 业务流拆解为机头、沙箱、编排、记忆体存储、数据库五个压力模块,并为每个模块匹配 C86 CPU 的对应能力。机头需要数据预处理与后处理、算子打包分发、KV Cache 数据传输,CPU 以高 IPC、强单核与高主频应对。沙箱需要高并发、快速启动与销毁、安全隔离,CPU 以多核心多线程、大 NUMA 域与硬件虚拟化应对。编排需要串行执行与分支控制,CPU 以高主频与高带宽 Cache 应对。记忆体需要分级存储与快速读写,CPU 以内存扩展与池化、数据加速协处理器应对。数据库需要高并发检索与实时更新,CPU 以 AVX512 向量计算与大带宽 DDR 应对。

DCU 一侧围绕大模型推理的工程问题做优化。在首词元时延上,海光依托 DTK 软件栈深度优化 FlashAttention 算子,结合 KV Cache 量化技术,降低长上下文下的预计算开销。逐词元生成是推理延迟的主要环节,Decode 阶段占比达到 83%。海光 DCU 通过定制化优化 GEMV 核心算子、算子融合与显存分配器优化,减少解码阶段的冗余操作。它通过连续批处理与前缀缓存复用,配合 FP8 KV Cache 显存压缩,提升单卡并发上限。针对 256K 与 1M 长上下文,它深度适配长上下文注意力机制,结合稀疏注意力与 KV Cache 量化压缩,突破显存与算力的双重限制,适配混元 Hy3 与 Kimi K2.7 Code 等 256K 长上下文模型。


Agent 时代,CPU 不再是数据中心“配角”

这套架构释放的一个明显信号,是 CPU 在数据中心里重新变得重要。杜夏威提到,Agent 天然带有操作与交互属性,其安全性与沙箱隔离需要 CPU 侧联动;业务流中也并非全部依赖 AI 芯片,还需要存储、IO、通信等支持。行业理论认为,智能体负载在 CPU 端的处理延迟可达 90% 以上。张攀勇表示:“大部分都觉得CPU is back in the data center,在这个过程中间,CPU的角色越来越重要。”

张攀勇解释,过去 CPU 与加速卡 1:4 或 1:8 的配比,对应的是传统训练场景。一个 CPU 节点内含两个 CPU,一般配 8 张加速卡,计算量集中在 GPU 上,CPU 主要承担前期数据处理。进入 Agent 时代后,业务流被拆成数据准备、任务理解、决策、编排、工具调用、数据访问、结果导出等多个阶段。大量推理动作仍由 GPU 完成,但中间的准备、调度、编排与数据访问由 CPU 承担,CPU 的占比因此上升。在企业级 Agent 场景中,沙箱节点、数据访问、数据库节点、冷存储节点等都消耗 CPU 资源,海光经与客户讨论后认为 1:1 是当前较为合理的配比。

张攀勇进一步谈到,Agent 场景对 CPU 提出了与以往不同的需求。应用接入、数据处理、沙箱运行、任务理解、编排、与 GPU 交互、数据访问、记忆管理、多节点并发,这些环节对 CPU 的串行处理效率、峰值判断和高并发数据交互能力提出了更高要求。CPU 的角色,是更好地衔接 CPU 与 GPU 之间的交互,为 Agent 提供一个更稳定的计算平台。在芯片内部,CPU 也需要保证内部数据传输通路的更高效率与更高 IPC。

与过去的服务器周期相比,这一轮周期给 CPU 的定位也不同。张攀勇指出,传统 CPU 主要用于科学计算和互联网服务,前者看重浮点精度,后者强调高密计算。进入 Agent 时代,CPU 更像总调度和业务中枢,不一定要有非常强的计算能力,但要有很强的数据处理能力、带宽,以及与 DCU 和网络的统一联动。海光因此以系统为中心,对 CPU 做更深层次的定位,追求系统整体最优,而不是单独一颗 CPU 的最优。

对于 CPU 的放量节奏,张攀勇提到两层驱动。一是 Agent 等新兴场景的需求量会越来越大,二是信创市场会持续开放扩大。他也坦言,今年 DDR 价格持续上涨给 CPU 企业带来一定负面影响,但海光对 CPU 未来的增量仍持信心。

这一判断也反映在实际项目里。在近期一家央企车企的采购中,海光获得了近半份额。张攀勇把原因归结为两点:一是开放生态,能与客户、OEM、系统供应商共建;二是 C86 生态,既兼容传统 X86,又在安全上做了大量自研工作。


四维开放与内生安全

除双芯协同外,这套架构的另一条主线是开放,具体落在算力、互连、安全、软件栈四个维度。

算力开放面向多元异构融合。海光支持海光 CPU 与海光 DCU 的原生组合,也支持其他厂商 CPU 与海光 DCU、海光 CPU 与其他厂商 GPU、海光端侧嵌入式与云端 DCU 的云边协同组合,构建可扩展、可替换、可演进的异构算力方案。

互连开放以自研 HSL 高速互连协议为核心。HSL 全称 High-performance Scalable Link,是海光自主研发并开放的高性能可扩展系统互连总线协议,用于突破传统 PCIe 瓶颈,实现海光 CPU、DCU 及各类 AI 加速卡之间的高速低延迟互连。提供远超 PCIe 的带宽与更低延迟,使多个计算单元像单一芯片一样协作。HSL 1.0 规范涵盖完整总线协议栈、IP 参考设计与指令集,一套协议贯穿 GPU-to-GPU、CPU-to-GPU、CPU-to-CPU、GPU-to-NIC、GPU-to-SSD 多种通路。

软件栈开放通过 DTK、DAS、DAP 等能力降低迁移与开发门槛。DTK 通过 HIP 接口实现 CUDA 代码 95% 以上兼容,迁移成本降低 70% 以上,算子覆盖度超 99%,支持 100 余种框架。DAS 集成 2000 余个算子,完成 GLM、DeepSeek、Kimi、Qwen 等模型的深度优化。DAP 提供知识库引擎、智能体编排引擎、自然语言数据分析引擎与 DAPClaw 工具。生态层的 UPTK 统一异构编程工具包主打"一套代码、多端部署",CUDA 用例移植效率提升 50% 以上。在模型适配上,海光适配的模型数量从 2025 年末的 365 余款增至 2026 年 4 月的 400 余款,覆盖全球绝大部分主流非闭源模型。

安全开放是海光重点强调的维度。张攀勇说:“海光一直的方案叫‘云边端’,叫内生全栈安全,就是从最底层的芯片开始,设计整体的安全方案。”

海光从 Agent 业务流到词元生产做了全链路保护。在密钥保护上,海光芯片内置平台安全处理器 PSP,实现密钥可用不可见,密钥明文不暴露。在链路保护上,芯片内嵌符合 GM/T 0028 标准的二级密码模块,实现端到端链路加密。在远程认证上,海光 CSV 中国安全虚拟化技术提供基于硬件的不可篡改认证机制,把信任锚点从平台软件下沉到芯片内部。在智能体隔离上,CSV 在硬件底层实现智能体计算过程的加密隔离,防止恶意智能体攻击其他智能体内存。在模型与数据存储保护上,海光提供高性能密码协处理器,用芯片内置密钥管理模块实现密钥可用不可见。在可信启动上,海光芯片内置自主可信根,支持 TPM2.0、TCM2.0、TPCM3.0 等可信计算框架,通过逐层验证实现白名单保护。

采访中,杜夏威回应了行业关心的内存墙问题。针对长上下文与 KV Cache 膨胀给 DCU 的 HBM 容量与带宽带来的压力,他表示:“我们肯定也还是先看自己能解决什么样的问题,具备更大显存容量、更高访存带宽的芯片我们一定会是重点发展的方向,因为对于我们的用户或者上层模型侧的需求来讲一定是你能最直接的解决硬件资源的上限的提升。” 同时他也表示,显存不可能无限扩张,海光还会从系统化与软硬件协同、甚至芯模协同的方向推进,发展存储端容量优势以改善芯片显存约束,并持续跟进 MoonCake 的 KV Cache 优化方案。

从行业落地看,海光这套架构已进入 20 余个行业、300 余个应用场景,并以万卡级集群支撑万亿参数训练。对于"应运而生"的解读,杜夏威把它拆成三个阶段。第一个阶段是算力,海光从芯片与算力出发,审视自己能做什么。第二个阶段是大模型快速发展,Token 把算法与算力统一起来。第三个阶段是 Agent 时代的业务化,把模型、算法、智能体与业务完成集成。在他看来,"生"并非无中生有,而是既有 AI 计算开放架构理念的延续。

Agent to Token 开放计算架构的发布,是国产算力面向词元经济的一次体系化能力升级。它把 CPU、DCU、内生安全、互连与软件栈放进同一个框架,覆盖 AI 应用从任务发起到结果生成的完整过程。当行业的价值衡量从峰值算力转向稳定产出 Token,这套架构提供的是一种更贴近业务本身的算力组织方式。

本站声明: 本文章由作者或相关机构授权发布,目的在于传递更多信息,并不代表本站赞同其观点,本站亦不保证或承诺内容真实性等。需要转载请联系该专栏作者,如若文章内容侵犯您的权益,请及时联系本站删除( 邮箱:macysun@21ic.com )。
关闭