昇腾960超节点亮相:算力竞争,开始从芯片走到系统

华为这次发布的重点,是把计算、网络和KV Cache存储放进同一个问题里。

这周华为全联接大会上,昇腾960超节点和面向AI推理的OceanStor M900同时亮相。新闻里最醒目的词是“960”,容易让人把它理解成又一张新芯片的发布。更准确地说,华为这次摆出来的是一套面向大模型训练和推理的系统方案:用更大的超节点、更快的互联和专门处理KV Cache的存储,去减少大规模AI任务在系统内部的等待。

这一区分并不只是措辞。芯片仍在路线图上,产品的规模交付和实际表现也还要等后续验证;已经公开亮相的,是以昇腾960超节点为核心的架构。华为称,该超节点可扩展至4096卡规模,并使用NPO光引擎和统一编址的互联方案。它希望解决的,是集群规模扩大后,计算卡之间、计算卡与存储之间如何更少绕路的问题。

过去很多人谈算力,习惯先看制程、显存和峰值算力。这些指标没有失去意义。问题在于,大模型从一次问答走向长上下文、多轮推理和工具调用之后,系统还要反复保存、读取和复用已经计算过的上下文。这里常被提到的KV Cache,本质上是推理过程中的一份“已算过的上下文”。它越大,越不能只靠单个芯片上的显存保存;一旦需要在多个设备、内存和存储之间调度,带宽、时延和软件调度都会影响最终吞吐。

OceanStor M900瞄准的正是这一环节。按照华为公开材料,它通过灵衢网络把KV Cache在显存、内存和SSD之间做分级存储和共享,并提出NPU到SSD“一跳直通”的方案。华为给出了容量、时延和Token吞吐等指标,但这些首先是厂商口径,适用的模型、负载和部署条件需要看后续的独立测试,不能直接外推成所有企业的实际收益。

所以,这次发布真正值得看的地方,不在于一句“国产芯片追上没有”。单颗芯片的计算能力、先进工艺、能耗和软件生态,仍然决定竞争的下限;超节点、互联和存储协同,决定的是当系统被拉到很大规模后,已有算力能否少一些空等,多一些有效工作。两者并不互相取代。

对正在做智能体应用的企业来说,这个问题会越来越具体。成本不只来自买了多少卡,也来自模型是否重复计算上下文、任务能否复用缓存、工具调用时系统是否频繁等待数据搬运。华为提出的路线,是把这类损耗当成基础设施问题来解决。它有现实针对性,但离“已经解决”还很远。

华为官方材料把CANN开源、超节点互联和大规模集群放在同一条路线里。路透社的报道则提醒了另一面:英伟达的CUDA生态仍有明显优势。对外部观察者而言,接下来比发布会更重要的,是芯片能否按路线交付,软件是否足够好用,客户能否在真实任务中算清性能、能耗和改造成本。

这也是我对这次发布的判断:它不是一场足以改写胜负的宣布,却把算力竞争从单卡参数推进到了系统效率。这个方向成立,结果要交给未来的产品和客户现场。

主要来源

华为:昇腾960超节点

华为:OceanStor M900 AI记忆存储

路透社:华为加码AI计算基础设施

分享本文

如果文中有你喜欢的句子,可以划线分享。