华为加码AI基础设施 算力比拼转向系统能力

来源 | 《财经》新媒体 作者 | 撰稿人 苏子纯 编辑 | 王婧雅  

2026年09月18日 22:15  

本文2431字,约3分钟

一颗AI芯片有多快,曾经是衡量算力最直接的方式。但随着大模型训练进入万卡、十万卡规模,决定计算效率的已经不只有芯片本身。成千上万张芯片需要同时工作,数据要在不同芯片、服务器和存储之间频繁流动,任何一个环节跟不上,都可能拖慢整个计算任务。

9月17日,华为在全联接大会2026上发布昇腾960超节点,单个超节点最大支持4096张NPU卡,并提出进一步组成数十万乃至百万卡规模的集群。与昇腾960同时出现的,还有鲲鹏超节点、灵衢互联和AI存储等一系列产品。华为副董事长、轮值董事长汪涛表示,华为AI战略的核心是算力,将聚焦AI基础设施,围绕“超节点+集群”推进系统架构创新。

过去几年,外界谈到华为AI算力,关注点更多集中在昇腾芯片。这一次,华为正在把昇腾的竞争力向外延伸,以芯片为核心,通过超节点和大规模集群,将计算、互联、存储等能力纳入同一套AI基础设施。随着AI计算规模不断扩大,算力竞争也开始从单颗芯片的性能比拼,延伸至整套系统的协同能力。

押注超节点 重估算力基础设施

在全联接大会现场,汪涛公布了华为最新的AI战略,核心是算力,聚焦AI基础设施,围绕“超节点+集群”,通过系统架构创新构建竞争力。与此同时,华为发布昇腾960超节点,并升级鲲鹏超节点,此外还推出OceanStor M900 AI记忆存储,通过灵衢互联将不同计算和存储资源连接起来。

产品看起来很多,但华为要做的事情指向同一个方向,以昇腾为核心,把原本分散的计算、互联和存储组织起来,形成一套面向大模型和智能体的AI计算系统。

之所以把AI算力从芯片进一步延伸到超节点和集群,在于大模型对算力的需求正在发生变化。

汪涛在演讲开始用了相当长的篇幅谈到这一点。他判断,大模型参数正在迈向10万亿,未来还会继续增长;智能体执行任务已经从过去的一问一答发展到连续工作数小时,未来持续时间还会进一步拉长;与此同时,推理产生的Token数量也在快速增长。

模型越来越大、任务运行时间越来越长,背后需要调动的计算资源也越来越多。过去,扩大算力最直接的方式是增加服务器和计算卡,但当集群进入万卡甚至十万卡规模,仅仅增加芯片数量已经不能解决所有问题。

大模型训练过程中,不同芯片需要不断交换数据。集群规模越大,需要协调的芯片越多,通信占用的时间也随之增加。按照华为测算,在传统服务器架构下,10万卡集群中,通信时间可能超过训练时间的40%。

这也是华为把“超节点+集群”放到AI基础设施核心位置的原因。超节点把过去分散在多台服务器中的计算资源,通过高速互联组织到一起。物理上仍然是多个计算节点,运行模型时则尽可能像一台计算机一样协同工作。

在此基础上,华为又把计算之外的互联和存储纳入同一套体系。昇腾负责大模型训练和推理所需要的AI计算,鲲鹏承担通用计算,灵衢连接不同的计算和存储资源,OceanStor M900则承接智能体和长上下文推理产生的大量缓存数据。多个超节点还可以进一步组成更大规模的集群。

不难看出,华为此次强调的“系统架构创新”,并不是简单地把超节点做得更大,而是围绕大模型训练和推理重新组织计算资源,单颗芯片持续迭代的同时,通过高速互联把更多芯片组成超节点,并进一步将计算、互联和存储协同起来。

这种系统化布局最终要解决的,仍然是AI基础设施在规模扩大之后的效率和稳定运行问题。汪涛将下一阶段AI基础设施的要求归纳为规模、性能和可靠性。

Token经济性登场 单位成本成关注焦点

把更多芯片组成更大的计算系统,只是第一步。系统规模扩大之后,另一个问题随之而来,这些芯片究竟有多少算力能够真正用于模型训练和推理?

这也让AI算力的衡量方式开始发生变化。过去,芯片的峰值算力是最受关注的指标;进入大规模集群后,单颗芯片的性能已经很难代表整套系统的实际产出。同样数量的芯片,如果在通信、调度或者故障恢复上消耗的时间不同,最终能够完成的训练和推理任务也会不同。

因此,行业开始算一笔更具体的账,同样的芯片、能源和资金投入,到底能够产生多少Token。

英伟达在GTC 2026期间提出,AI工厂的运营指标正在从传统的数据中心利用率进一步转向Token产出,衡量维度包括每GPU、每机架以及每瓦、每兆瓦能够产生多少Token。其Mission Control 3.0也围绕减少系统低效、提高Token产出进行设计。

AMD在今年发布机架级AI系统Helios时,同样将“每美元Token产出”作为衡量AI基础设施经济性的指标之一。AMD表示,Helios每美元可产生的Token数最高比竞品多出30%。

Gartner今年2月发布的AI基础设施研究将当前的竞争称为“机架级之战”。报告认为,AI基础设施厂商需要应对不断增长的机架级系统需求,而衡量系统效率的重要指标之一,是每瓦、每美元能够产生多少Token。

这背后是一笔越来越现实的经济账,对于大模型公司和算力使用者而言,采购芯片最终是为了获得训练和推理能力。一套集群的峰值算力再高,如果大量时间消耗在通信、等待或者故障恢复上,能够真正用于模型计算的算力就会打折。反过来,同样数量的芯片,如果能够承担更多训练任务、处理更多推理请求,单位算力的使用成本也会下降。

这使得AI基础设施的竞争从提供多少算力,进一步转向这些算力能够产生多少实际产出。中国信通院在《AI计算节点发展研究报告(2026年)》中也指出,AI计算节点产业正从硬件性能单点竞赛向“硬件-软件-生态”综合体系竞争跃迁,产业生态也在从可用向好用升级。

对华为而言,这也是此次将昇腾、超节点、互联和存储放进一套AI基础设施的行业背景。过去市场可以比较一颗AI芯片的性能,未来面对越来越庞大的计算系统,厂商要回答的问题也变了,同样的芯片和能源投入,最终能够交付多少真正可用的AI算力。

216.73.217.84