当前位置:首页 > 芯闻号 > 芯事记

近日,深圳官方正式官宣重磅技术成果,由深圳河套学院AI训练平台项目团队牵头,联合哈尔滨工业大学(深圳)、深圳市大数据研究院、华为团队及深智城AI算力平台共同攻关,依托华为昇腾910C国产AI算力集群,成功完成1.6万亿参数DeepSeek-V4-Pro大模型全参数后训练,创下国产自主算力支撑超大参数通用大模型训练的全新纪录。

华为芯片完成1.6万亿AI大模型“全参数后训练”!国产算力跨越最后难关

这不是一次试探性的尝试,而是一次里程碑式的技术突破。它用无可辩驳的工程结果证明,国产AI芯片已经跨过了那条最难的门槛。在美国制裁持续收紧的背景下,中国半导体行业正努力从支持基础AI推理,迈向更复杂的模型训练阶段。

深圳官方在报道中明确指出,"此次实践为全球第三方机构在国产算力平台上完成该级别模型训练的相关探索,积累了重要经验,也印证了国产AI芯片可支撑世界级超大参数模型训练工作"。

  • 为什么“全参数后训练”含金量这么高?

很多人只注意到“1.6万亿参数”,却忽略了“全参数后训练”这六个字的含金量。

AI大模型的核心分为推理和训练。推理是模型已经学好了,按部就班回答问题,这是国产芯片之前擅长的“单行道”;而训练则是让模型从零开始学,不仅需要海量算力,还要不断自我反思调整,相当于在单行道上建起复杂的“立交桥”。

训练又分预训练(打基础)和后训练(学规矩、学技能)。全参数后训练,意味着要同时调整1.6万亿个参数,而不是小打小闹的局部微调。更棘手的是,DeepSeek-V4-Pro采用了混合专家(MoE)架构——推理时只需唤醒少数专家,训练时却要所有专家同时学习、海量通信,数据交换量是普通模型的几十倍。

  • 三大工程突破,完成艰难破局

第一是"显存拼图"。1.6万亿个参数的数据量极其庞大,不可能塞进任何一张单独的计算卡。团队设计了一套极其精密的分布式承载方案,把整个模型像拼图一样,拆成一小块一小块,精确地分配到每一张芯片上。哪块卡负责哪部分参数,什么时候需要和其他卡交换数据,都算得丝毫不差。

第二是"负载均衡"。混合专家模型最头疼的问题就是忙闲不均。有的专家任务排成长队,有的专家却闲得没事干。之前很多国产集群跑MoE模型,算力利用率普遍偏低。这次团队专门针对MoE架构优化了调度算法,动态给每个专家分配任务,彻底解决了跨卡通信拥堵的问题。

第三是"全程不掉线"。做过大模型训练的人都知道,最怕的就是跑了几天几夜,突然一个硬件故障或软件错误,整个训练直接崩溃,前面所有的时间和算力都打了水漂。这次训练一共跑了1500多步,全程没有出现一次中断或者报错。这背后是一整套完整的全链路监控和容错体系,是无数个日夜调试出来的结果。

最终,模型算力利用率突破30%,关键训练算子效率提升14%。在万亿级训练领域,30%的利用率已是相当优秀的工业级水准(即便用顶配海外芯片,很多团队也仅在40%左右)。

本站声明: 本文章由作者或相关机构授权发布,目的在于传递更多信息,并不代表本站赞同其观点,本站亦不保证或承诺内容真实性等。需要转载请联系该专栏作者,如若文章内容侵犯您的权益,请及时联系本站删除( 邮箱:macysun@21ic.com )。
换一批
延伸阅读

3月23日,华为春季全场景新品发布会正式拉开帷幕,备受瞩目的华为畅享90 Pro Max如约登场。作为2000左右性价比高手机中的实力机型,该机以“超流畅 超耐用 续航信号王者”为核心定位,凭借麒麟8000芯片与鸿蒙操作...

关键字: 华为

2026 年 3 月 31 日,华为投资控股有限公司正式发布 2025 年年度报告。

关键字: 华为 2025年年报 AI 云计算

踏入一座半导体晶圆厂的车间,见证的是AI算力赋能先进制程的突破,半导体行业以AI重构研发制造体系,开启自研技术迭代与先进封装的新征程;走进一条电子终端的产线,看见的是数智工具重塑生产效能的变革,电子行业通过...

关键字: 华为

3月20日,以“因聚而升 融智有为”为主题的华为中国合作伙伴大会2026在深圳继续举行。继大会首日系统阐述了战略创新、体系升级、政策变化后,当日华为进一步解读了如何以“伙伴+华为”体系为核心,与伙伴共筑AI时代数智新基建...

关键字: 华为

3月19日,华为中国合作伙伴大会2026在深圳隆重举行。大会以“因聚而升 融智有为”为主题,旨在通过“伙伴+华为”在战略、能力、价值的全面融合、协同共进,实现高质量服务客户数智化升级,共创千行百业数智化的价值跃升。

关键字: 华为
关闭