逛完WAIC才明白,国产算力不跟英伟达比单卡了

逛完WAIC才明白,国产算力不跟英伟达比单卡了

Napoleon Chan / 2026-07-21 09:3845617
标签:WAIC2026

据SemiAnalysis测算,单颗国产AI芯片的性能,大约是英伟达Blackwell架构的三分之一。

这是国产算力在先进制程受限下面对的物理天花板。但在WAIC2026上,一条绕开这块天花板的路线被跑通。当芯算融合馆挤满专业观众时,很多人是来看这套新解法的。

IMG_8973.HEIC.JPG

“拼积木”的系统战

既然单卡存在差距,那就把卡连起来。这种把几百上千颗芯片组合成一台“超级计算机”的技术,业内叫超节点。

华为之前算过一笔账。单颗昇腾芯片确实有差距,可一旦用高速互联技术把它们组成CloudMatrix 384集群,总体性能是英伟达GB200 NVL72的1.7倍,内存容量达到3.6倍。这种方案弥补了单点性能短板,在整体吞吐量上实现了反超。

这次在WAIC现场,华为把Atlas 950超节点真机拉了过来。这个庞然大物单机柜装了64张卡,靠着自研的灵衢协议,能把1024张卡连在一起。它实现了256TB的全局统一内存编址。大模型训练中芯片之间数据交互频繁,现在所有芯片访问远端数据就像访问本地缓存一样快,通信时延压到了3微秒。昇腾上一代超节点已在20多个行业落地750多套,这种从技术可行到商业可用的跨越,给行业留下了实际的参考样本。

image1.jpeg

 不只是华为在做这件事。中科曙光宣布了国内首个全国产十万卡AI超集群“曙光8000”投入使用。这套系统以海光芯片为算力底座,采用“超智融合”技术路线,同时支持高精度科学计算和低精度智能计算。十万张卡的规模,对系统可靠性要求极高,任何一个部件抖动都可能导致整体作废。中科曙光给出的解法,是算力单元与机柜解耦,单节点集成40张GPU,部署周期从数月缩短到了数小时。

image2.jpeg

中兴通讯在展会上发布了OEX超节点。他们的思路是开放解耦,底层协议标准化,全面兼容壁仞、沐曦、燧原等国内多元GPU生态。客户可以自主选择最优的芯片组合,再通过中兴的大容量交换芯片打通机内与机间互联。为了解决散热问题,这套方案配套了全栈液冷技术,能把PUE控制在1.15以内。

image3.jpeg

清微智能也在展示他们的REX81 Supernode系统。这套系统集成了4096颗TX81芯片,算力突破每秒500千万亿次。清微智能CTO欧阳鹏的解释很直白:超节点就是把众多芯片紧耦合在一起,像一个单一节点一样工作。通过芯片直连通道,这套方案减少了传统集群中的交换节点,互联成本降幅约90%。

image4.png

超节点扎堆出现,不是巧合。大家等于承认了一件事:制程上那点差距,短期追不上,那就换个地方比。

被低估的生态软板

行业里衡量这件事有个硬指标,叫MFU,模型算力利用率。芯片标称算力再高,真正能用在训练上的只是一部分。有科技公司基础设施负责人算过一笔账,极端情况下,模型训练过程中会浪费掉一半算力。而决定这个指标高低的,很大程度上不是芯片本身,是底层驱动、算子库和并行策略这些软件层的功夫。

国产阵营在这上面已经交出过一份答卷。华为用8192枚昇腾910训练盘古大模型时,MFU超过了50%,而训练同类稠密模型的业内普遍基准通常在40%到50%之间。但单点案例不等于普遍水平。CUDA生态覆盖了绝大多数开发者,开发者设计新算子,第一时间适配的还是英伟达的卡。如果国产软件栈跟不上主流开源框架的更新节奏,客户手里的卡就跑不起来新模型。

image5.jpeg

所以今年WAIC上,算力厂商开始在软件适配上发力。清微智能的RAISA软件栈已经适配了200多个大模型,支持PyTorch等主流框架和CUDA算子迁移。华为的昇腾CANN也在全面开源开放,旨在降低开发者的迁移门槛。沐曦股份带着全精度GPGPU架构和MXMACA软件栈亮相,尝试建立完整的软件生态。

芯片发布只是第一步,让开发者用得顺手,才是决定产品能否存活的关键。

推理时代的门票

算力基础设施的这波重构,背后是一本经济账。

IDC中国上个月表示,到2027年,推理会占到智能算力需求的七成以上。这个数字意味着什么?前几年买卡主要是为了训模型,训完一轮算一轮。推理不一样,模型只训几次,推理却要发生亿万次,智能体一个任务还会连续触发好几轮模型调用。到了这一步,客户关心的就不再是峰值算力,而是并发撑不撑得住、响应快不快、每个Token的成本能不能压下来。

image6.jpeg

而推理恰恰最吃通信时延和互联带宽,这两样都是超节点的长处。卖方市场已经有了反应。华泰证券在研报中,把超节点称作“26年国产算力破局之道”,测算出的2028年市场规模是3414亿元。订单也来得比预想的快。中国移动今年3月启动了集团层面首次AI超节点集采,6208张加速卡,运营商里这是头一回。

采购方的口味也跟着变了。前几年客户拿着单卡参数表挑货,现在直接问:能不能把我的模型跑起来,后续扩容怎么办。这道题单靠芯片答不了,互联协议、整机柜、散热、软件栈,哪一环短了都交不出货。逛完这届WAIC再回头看,单颗芯片三分之一的差距还在那里,但行业已经不在这个刻度上纠缠了。胜负手换成了另一个:谁能把一整套系统稳定地交到客户机房里。

声明类型:无需添加自主声明

发表评论注册|