电话:
关闭
您当前的位置:首页 > 职场资讯 > 社保

华为全连接大会2025亮芯片底牌,昇腾鲲鹏未来迭代引关注

来源:网络整理 时间:2025-09-25 作者:佚名 浏览量:

所有人都没有预料到,华为会突然亮出未来几年的“芯片底牌”。

9月18日,上午时段,华为全连接大会2025举行,华为轮值董事长徐直军集中宣布了数款芯片产品,具体涵盖面向人工智能运算的昇腾950系列、昇腾960系列以及昇腾970系列,同时还有适用于常规计算的鲲鹏950处理器与鲲鹏960处理器,此外,还展示了由这些芯片共同构建而成的“全球性能最优异超节点”和“全球处理能力最强集群”。

需要了解的是,华为上次公开推出昇腾与鲲鹏处理器,是在二零一九年。从那时起,在美国连续多次的制裁影响下,无论是麒麟系列,还是昇腾与鲲鹏都受到了很大影响。虽然近两年大家都清楚华为的芯片正在逐步恢复,但仍然存在许多不确定性,比如麒麟、鲲鹏和昇腾这些芯片未来会怎样更新换代,外界目前还无法确定。

接下来说明即将发售以及计划中的四款昇腾处理器,我们研发了两种高带宽内存,鲲鹏处理器主要针对支持超大规模系统,增加核心数量,提升运行效能等方向不断进步......所以当徐直军直奔核心内容介绍华为“未来的处理器发展蓝图”时,在场的每个人无不感到惊讶,注意力也被带回到几年之前。

图源:观察者网

选择这个时机展示实力,华为不仅意在彰显其不可摧毁的意志,更希望为我国人工智能的进步提供支撑,让国内产业同行获得更大的信心保障。我明确地告知各位,鲲鹏芯片将不断进步,为中华以及全球的智能运算建立稳固基础。徐直军在此场合表示。

DeepSeek首创的方案能显著降低计算资源开销,不过徐直军指出,迈向通用智能、实现物理智能的过程中,计算资源始终是人工智能的核心要素,并且对中国的智能科技发展至关重要。

他首先在会议上提及了昇腾950系列芯片的性能表现,与上一代产品相比,这一系列芯片有多项显著提升,具体体现为,它能够兼容FP8/MXFP8/MXFP4这类低精度数值格式,其计算能力能够达到1P和2P级别,从而有效提高训练速度和推理数据量,同时它还专门支持华为研发的HiF8格式,在维持FP8高效运算特性的基础上,其精确度与FP16非常接近。

华为根据推理过程各个阶段对计算能力、数据存储容量和内存访问速率的不同要求,研发了两种经济型高带宽内存,这两种高带宽内存分别与昇腾950芯片封装,形成了昇腾950PR和昇腾950DT两个产品,前者用于预填充和推荐功能,后者用于解码和训练任务,两者预计将在来年推向市场。

图源:观察者网

徐直军还公布了规划中的两颗AI芯片。

昇腾960的参数指标将是昇腾950的两倍,它能够运用华为自主开发的HiF4数据类型,有助于显著增强运算效能,并且其运算精准度将超越业界采用FP4技术的方案,预计于2027年第四个季度上市;昇腾970的配置尚在协商阶段,与昇腾960对比,昇腾970的FP4运算能力、FP8运算能力、互联通路容量将整体提升一倍,内存数据传输速率最少会增长1.5倍,预计在2028年第四个季度面市。

图源:观察者网

众所周知,国产AI芯片因为生产技术上的不足,单块设备的计算能力相对滞后,不过人工智能对计算能力的巨大依赖,使得单个芯片的作用逐渐减退,依靠众多设备组合起来的整体计算能力正变得非常重要。所以今年三月,华为融合了光通信、网络、供电等多个领域的技术,把三百八十四颗昇腾芯片用高速互联总线组合起来,制造出全球规模最大的超节点,其性能参数超越了英伟达NVL72系统,它的长处在于让计算和通信快速同步进行,显著提高了算力使用效率,目前已经安装了超过三百套。

但华为并没有停下脚步,这次重磅宣布了未来的超节点规划。

首个计划于2026年第四季度推出的Atlas 950超级计算节点,选用八千一百九十二片昇腾九百五十DT芯片构建而成,其完整配置由一百二十八套计算单元和三十二套互联单元构成,合计一百六十套单元设备,所需场地大约为一千米平方,单元之间运用全光纤连接技术,整体计算性能获得显著增强,其中单精度浮点运算能力可达到八十亿亿次每秒,半精度浮点运算能力能达到一百六十亿亿次每秒,网络互联速率高达十六拍字节每秒,这一数值表明,单套Atlas 950产品的网络互联速率,已经超过当前全球互联网最高传输速率的十倍。

Atlas 950超级计算中心,在接下来很多年里都将作为全球计算能力最强的超级计算中心,同时在所有关键性能指标上都明显领先于行业内的主要设备。其中,对比英伟达同期推出的NVL144,Atlas 950超节点卡的体量要大出56.8倍,其计算能力高出6.7倍,内存容量多出15倍,总计达到1152TB;数据传输速率更是快了62倍,达到16.3PB/s。即便参照英伟达预计2027年面市的NVL576,Atlas 950超节点在各项指标上仍然表现更优。”徐直军说道。

图源:观察者网

这仍然不够。

华为着眼于未来,打算于2027年第四季度推出名为Atlas 960的超大型计算平台,该平台由15488块昇腾960芯片构成,包含176个计算单元和44个互联单元,总计220个单元,所需场地大约为2200平方米,其整体计算能力、内存规模以及互联速率均将在Atlas 950的基础上实现翻倍增长。该设备的FP8计算能力可达到30亿亿次浮点运算每秒,其FP4计算能力则能达到60亿亿次浮点运算每秒,内存空间可扩展至4460太字节,网络连接速率可提升至每秒34拍字节。

不光是AI芯片迭代,华为还同时布局通用计算CPU。

华为最强的领域__华为潜力

徐直军公开信息,华为计划于次年首季发布鲲鹏950芯片,该产品具备两种规格,其一拥有96核心与192线程,其二则配备192核心及384线程,此乃鲲鹏系列首款具备机密计算功能的数据中心芯片。另悉,在2028年首季,华为将推出鲲鹏960芯片,该系列将包含高性能版,其核心与线程配置为96核/192线程,同时也会有一款高密版,其核心数量不少于256个,线程数则达到512个。

紧接着,他公布了搭载鲲鹏950的TaiShan 950超级计算集群,这是全球第一个通用型超级计算集群,将于明年第一季度开始销售,最多可以连接16个节点,每个节点配置32个处理器,最大内存容量达到48TB,同时支持内存资源、固态硬盘资源以及智能加速卡资源的池化管理。

图源:观察者网

当前大型机和小型机的更换过程中,主要难题在于数据库的分布式重构,GaussDB的多写模式是建立在TaiShan 950超节点之上的,这种架构无需进行任何改造,却能让性能比原先高出2.9倍,它能够顺利地取代大型机和小型机上使用的传统数据库系统。TaiShan 950搭配分布式GaussDB,将使所有大型机和小型机彻底淘汰,各种应用环境中的大型机和小型机以及Oracle的Exadata数据库服务器都将被完全替代。这是徐直军的观点。

华为在洞察到超节点带来的显著系统效益之后,也打算推出TaiShan 950与Atlas 950的融合超节点方案,通过这种方案一方面可以借助极宽的带宽、极短的时延以及巨大的内存容量,形成一个规模宏大的共享内存区域,用以承载PB量级的推荐系统所需的数据表;另一方面,这种融合超节点所具备的强大AI计算能力,能够为超低时延的推理过程和特征检索任务提供有力支撑。

然而这种方式亦会引发严峻的难题。例如在远距离传输和稳定运行方面,现有的电气连接方法在高速状态下传输距离受限,而光连接则更易发生中断。现阶段,柜与柜之间的连接通道速率不高,与超节点的要求相差五倍之多;柜与柜的卡间传输延迟时间较长,现有连接技术最优只能实现大约三微秒,与Atlas 950/960的规格标准相比仍有二十四分之一的距离,当延迟时间已经降低到两到三个微秒时,哪怕只提升零点一微秒都极具挑战性。

图源:观察者网

徐直军讲过,要满足Atlas 950/960超级节点互联的技术条件,要使得万卡超级节点也能当作一台计算机使用,华为研发了超级节点构造,并且研发了新的互联规则,这些规则可以支持万卡级别的超级节点构造。

万卡级超节点架构在技术层面展现出六大核心特质,包括总线式连接、平等协作、全部资源整合、标准协议统一、庞大网络构建以及极高可靠性。针对超节点设计的全新互联方案,正式定名为“灵衢”,其寓意类似于交通枢纽,旨在达成海量计算能力的无缝对接,英文名称为UB,即统一总线。

徐直军谈到,旨在更全面地推动互联技术进步和产业革新,华为已决定公布灵衢2.0技术规范,诚邀行业同仁依托灵衢开发对应产品与组件,合力打造灵衢开放体系。灵衢专为超节点而设计,是面向超节点的互联标准,同时也是搭建算力集群产品的理想互联方案。

他随后宣布了两个大规模计算集群。

首先是名为Atlas 950 SuperCluster的集群系统,该系统由64台Atlas 950超级计算节点构成,这些节点将一万多台机柜里的52万余块昇腾950DT芯片整合为一个大单元,其FP8计算能力能够达到524 EFLOPS级别。与全球规模最大的集群 xAI Colossus 相比,本集群的体量是它的两倍半,处理能力是它的1.3倍,堪称当之无愧的全球算力第一集群。同期,2027年第四个季度,华为打算以Atlas 960超节点为根基,发布Atlas 960 SuperCluster,集群的容量将增大到百万级别,每秒浮点运算性能为2泽字节,每秒半精度浮点运算性能为4泽字节。

图源:观察者网

但是,毫无疑问,人工智能计算能力的运用,不仅对设备功能有严格考验,也要求辅助程序和创造手段达到更高水准。例如,英伟达之所以具备强大竞争力,并不仅仅是因为它的图形处理器效率高,还因为它构建的CUDA平台非常完善。

华为尽管配备了自家的昇腾芯片,依然要借助CANN来充当“CUDA”的功能。CANN的协作伙伴是华为自主研发的深度学习平台MindSpore,该平台的功能与PyTorch类似。这些工具合在一起,就形成了华为本地的AI软硬件体系,旨在与以英伟达为主导的PyTorch+CUDA模式展开竞争。

说实话,与已经发展了18年的CUDA生态相比较,才刚刚起步六七年的CANN,在操作便捷程度和生态系统的完善程度方面,仍然存在不小的距离,并且未来的发展任务还很艰巨。去年9月有国外媒体报道称,为了使客户能够适应新的生态系统,华为公司借鉴了英伟达最初推广CUDA的方法,向百度公司、科大讯飞公司以及腾讯公司派出了技术团队,协助他们在CANN平台上,将原本基于CUDA的训练代码进行复制和改进。

面对CUDA的成熟生态,华为或许应该优先考虑通过开源方式来构建自身的产业环境。

徐直军当众再次强调华为的公开合作原则和未来规划,具体如下:首先,华为会继续推动昇腾硬件的商业化进程;其次,CANN编译系统以及虚拟指令集的调用方式将对外提供,其他相关软件也都会进行开源,CANN针对Ascend 910B/C的公开透明行动计划,预计在2025年12月31日之前实现,往后开源开放将与产品推出时间保持一致;再次,Mind系列软件赋能套件和开发工具将全部进行开源,同样计划在2025年12月31日完成;最后,openPangu基础大型模型将实现全面开源。

图源:观察者网

徐直军的发言透露出华为在计算领域的长远规划,硬件层面将依托既有芯片制造技术,持续更新昇腾与鲲鹏系列产品,此外还会针对特定环节进行系统化补充,并借助超节点技术克服单卡性能短板;软件方面,华为将秉持开放共享理念,以灵衢2.0技术标准为载体,打造CANN与MindSpore等开源平台,以此应对美国在算力领域的技术封锁。

以下是徐直军演讲全文:

分享到:
客服服务热线
24小时服务
微信公众号
手机浏览

Copyright C 2025 All Rights Reserved 皖ICP备2024052706号-7

地址: EMAIL:1210524564@qq.com

Powered by PHPYun.

用微信扫一扫