构筑自主可控算力底座:国产全栈智算破局之路
算力自主可控,是我国AI产业与数字基建发展中亟待解决的现实问题。
当前市面上主流算力方案大多基于海外GPU架构改造,长期存在两大行业痛点:高端先进制程供应受限,CUDA封闭生态容易形成深度技术绑定,使得国内企业难以掌握技术发展主动权。针对行业现存困境,上海东方算芯科技有限公司(下文简称:东方算芯)走出了一条区别于通用GPU兼容路线的自研道路,核心技术方案已实现落地应用。
二十年磨一剑:自研核心技术体系
东方算芯于2024年5月在上海浦东成立,专注软件定义可重构计算、近存计算两大前沿技术方向,主打国产高性能AI算力芯片研发与全栈式系统解决方案。公司核心技术源自清华大学魏少军教授团队十余年的可重构计算研究积淀,经过工程化打磨形成完备的自主知识产权体系。在国家级集成电路、人工智能专项基金及头部产业资本支持下,公司已形成多点协同研发格局,研发运营分支机构覆盖北京、西安、南京、苏州、成都等地,深圳及华中区域站点也在规划筹建中。
依托清华大学团队近二十年的持续技术攻坚,相关研究自2006年起深耕可重构计算前沿领域,先后承接核高基、863、国家重点研发计划等国家级重大专项;2014至2023年完成可重构处理器、AI芯片、3D混合键合近存计算芯片全链条原型验证,团队历史成果曾获国家技术发明二等奖、中国专利金奖、世界互联网大会领先科技成果等荣誉,累计拥有百余项国内外发明专利,产出300余篇高水平学术论文。2024年,这一技术积淀经东方算芯实现产业化落地,全面推进AI、超算国产化算力产品的商业化推广。
东方算芯自主搭建"软件定义芯片架构+3D混合键合近存计算"两套底层核心体系,打造出独立于海外GPU技术路径的国产算力方案,降低对高端先进制程的依赖,构建起从底层芯片、加速硬件到整机集群的全链路国产化算力方案,为行业提供差异化算力选择。
(一)软件定义芯片可重构计算架构
传统GPU、ASIC芯片硬件结构固定,计算逻辑无法跟随算法快速迭代,面对大模型多样化、高动态的算力需求,普遍存在资源利用率偏低、算法改造成本高的问题。
针对这些问题,东方算芯自主研发软件定义芯片可重构计算架构,以TensorTile为基础调度单元,构建全异步无阻塞数据流执行架构。芯片硬件可根据不同算法模型、不同计算任务灵活重构计算资源与数据通路,结合空间并行与时分复用机制提升硬件利用率,依靠架构创新降低对高端制造工艺的性能依赖。
公司DF1000系列芯片采用国内成熟工艺制造,BF16精度理论峰值算力可达520 TFLOPS,芯片搭载多精度可重构张量计算单元与Transformer专用加速模块,原生支持FP32、FP16、BF16、FP8、FP4多精度计算,针对大模型高频Attention算子完成深度优化,能够适配主流开源大模型。
在软件层面,东方算芯自主搭建指令集、编译工具链与算子库,形成区别于CUDA体系的国产软件开发路径。目前基础算子可覆盖大模型训练、常规推理、分离式推理、分布式推理等主流AI任务。公司持续拓展第三方框架适配能力,现阶段研发重点聚焦AI训推场景,在传统超算纯浮点计算场景的性能仍在持续优化迭代中。
(二)3D堆叠混合键合近存计算技术
传统冯·诺依曼架构存在典型的"存储墙"问题,计算单元与存储单元物理分离,大量算力、功耗、时延消耗在频繁的数据搬运中,长期制约高端算力的能效上限。
为此,东方算芯采用3D堆叠混合键合(Hybrid Bonding)工艺路线,实现逻辑计算层与DRAM存储层无凸点垂直互连。相较行业传统2.5D HBM中介层方案,该工艺可将芯片互连间距压缩至亚微米级别,显著提升互连密度与带宽效率。
架构优化后,芯片内部数据传输链路大幅精简,有效降低数据访问延迟与无效功耗。芯片片上访存带宽达6.4 TB/s,单卡Scale-up互联带宽为900 GB/s,可支撑大规模多卡并行协同计算。
该技术的核心价值在于降低对海外先进制程和进口HBM存储芯片的依赖,依托国内成熟14nm产线即可实现高端算力落地,有效降低外部供应链风险。
(三)原生分布式多卡互联执行架构
超大模型训练和超大规模智算集群,对多卡互联时延、通信稳定性、并行调度效率要求极高。东方算芯打造芯片、服务器、软件三层一体化原生分布式架构,适配大规模算力组网需求。
芯片端内置自研软件定义通信处理器,服务器端配套原生以太网超节点架构,软件端提供专属分布式编程模型与运行环境。通过TY64超节点互联设备,可实现64卡无阻塞全互联组网,降低多卡同步时延与通信损耗,满足超参数大模型大规模并行训练需求。
硬件支持智能动态调压调频,可根据推理、训练不同负载自动调节运行工况,适配大型智算中心高密度、高负载运行场景,也可满足轻量化算力设备的低功耗部署需求。
全栈标准化产品矩阵,助力国产替代
基于三大自研核心技术,东方算芯建成涵盖芯片、基础软件、整机服务器、大规模集群的四层全栈产品体系,实现软硬件协同设计、一体化交付。全系产品均完成信创兼容性认证,核心元器件实现国产化替代。
配套基础软件方面,公司同步自研指令集系统、编译器、算子库、分布式开发框架及集群运维平台,构建闭环式软硬件协同生态,保障整套算力平台从底层到应用的自主可控。
底层软硬件自主研发,凸显技术差异化优势
当前国内多数国产化算力方案,依旧基于海外GPU架构做兼容式改造,普遍存在生态受制于人、依赖高端工艺、软硬件体系不统一等问题。东方算芯通过底层全栈自主研发,形成明显的技术差异化优势。
第一,核心软硬件自主设计。公司计算架构、指令集、编译体系均为自主研发,搭建了区别于CUDA体系的国产软件生态路径,并持续拓展主流AI框架适配能力。
第二,弱化高端供应链依赖。凭借软件定义可重构计算与3D近存计算双重创新,产品依托国内成熟工艺即可实现高端AI算力输出,无需进口高端存储芯片,降低外部供应链不确定风险。国内3D堆叠封装工艺仍处在持续降本增效的迭代阶段。
第三,全栈一体化协同交付。不同于行业芯片、整机、软件分厂商拼凑集成的模式,东方算芯完成芯片、板卡、服务器、集群软件的统一研发与联合调优,面向客户输出一站式算力解决方案,缩短软硬件适配周期、简化项目落地流程。
覆盖主流应用场景,创新产业发展范式
东方算芯的产品核心能力聚焦AI训练与推理场景,信创适配成熟,在政务数字化、智能制造、金融风控等国产化替代场景优势突出。
整套国产化算力体系可覆盖四大类主流应用场景:
• 通用人工智能领域:支撑各类开源大模型的单机训练、推理与分布式并行计算,为国产AI研发提供训推一体化算力底座。
• 前沿科研计算领域:服务AI for Science科研创新,支撑气象模拟、新材料研发、生物医药仿真等高精度科研计算任务。
• 政企信创算力领域:用于政务数字化平台、金融风控算力集群、能源调度系统、央企数据中心的国产化升级改造。
• 工业与智慧城市场景:落地工业视觉质检、设备故障预判、数字孪生、仿真测试、城市智能分析等产业数字化应用。
整体产品梯度清晰:DF1000系列适配单机轻量化算力需求,TY64超节点与HS512集群面向大规模、高并发、超参数算力场景,覆盖从科研调试到大型商用集群部署的完整算力层级。
结语
长期以来,国内高端AI算力产业发展路径相对单一,多数技术迭代依托海外架构体系开展,行业面临底层技术受限、生态绑定、供应链承压的发展困境。
东方算芯以可重构计算与3D近存计算为核心技术路径,构建了区别于通用GPU兼容路线的国产算力技术体系,为国内高端算力产业提供了换道创新的发展思路。
通过搭建全栈自主、安全可控的国产化算力体系,公司为国内AI基础设施补齐了部分底层短板,为数字经济与科研创新提供算力支撑。一体化交付模式有助于降低各行业算力国产化替代成本,加速自主算力技术的规模化落地。
同时,公司也为国内集成电路领域产学研深度融合、实验室技术产业化转化,提供了可参考的实践样本。未来,东方算芯将持续深耕底层算力技术创新,完善全栈自研产品生态,为我国算力基础设施自主可控、数字产业安全创新提供支撑。





