


摘要:
产品做出来,和有人真的拿来跑核心业务,是完全不同的两回事。
凤凰网科技 出品
作者|杨乐多
编辑|刘毓坤
WAIC 今年评了 10 件镇馆之宝。
9 件在你面前。会跳舞的机器人,能聊天的数字人,写代码的 Agent。拍照,互动,发朋友圈。
而位于 H2 馆 A101 展区那件,你得走过去才注意到,是一排机柜。这排机柜是昇腾 Atlas 950 SuperPoD,1024 张 NPU 卡在里面运行。可就在这个庞然大物身边,里三层外三层围满了人。然而,它就那么岿然不动地亮着灯,安静立在喧嚣的人潮中间。
问题是:一个机柜,凭什么评上镇馆之宝?
答案不在展台上。
AI 进入 Agent 时代,算力撞墙了
过去你跟 AI 聊天,你说一句,它回一句,一台机器就够用。
现在不一样了。你打开一个 Agent,说帮我订张去上海的机票。它要同时查航班、比价格、读退改规则、填乘客信息、调日历确认时间。十几件事并行推进,每一步都在计算,且用户对延迟的容忍度极低。
这时候加更多机器反而更慢。因为节点增加后,多机之间的通信延迟会急剧上升。你以为算力在跑模型,实际上大量时间耗在机器之间的数据搬运上。业界把这叫通信墙,机器算得再快,多机互联效率低,整体算力就会打折扣。
还有另一个瓶颈。大模型动辄万亿参数,MoE 架构的模型甚至朝着十万亿发展。一台机器的内存装不下整个模型,必须切开分到不同机器上。一旦切开,每次调用都要跨机搬运数据,导致显存利用率下降。业界管这叫显存墙。
通信墙影响协同效率,显存墙限制模型规模。两堵墙的解法其实是同一个:把多台独立的机器,在物理和逻辑上整合成一个计算单元。
超节点就是这么来的。
昇腾 Atlas 950 SuperPoD,简单说就是通过一套叫灵衢的高速互联协议,把 1024 张卡拼成一台计算机。由此实现了 1024 张卡共享同一段内存空间,不再各算各的再汇总。
还有两个关键词:256TB 统一编址。这意味着万亿参数的 MoE 模型跑在上面,跟跑在一张卡上一样流畅。跨机柜的数据搬运开销,被架构本身消化。通信墙和显存墙,同时被这一架构解决。
Atlas 950 SuperPoD 这次在 WAIC 做真机首展。单柜 64 卡,最大可扩展至 1024 卡,是业界目前最大规模的超节点之一。
这些数字背后真正的信号是什么?
过去五年,算力竞争围绕单卡性能展开,谁的制程更先进,谁的峰值算力更高。但 Agent 时代到来之后,模型规模突破单机极限,推理需求成倍增长,决定 AI 能跑多远的已经不是单卡速度,而是千卡能否像单卡一样协同工作。
可以看到,赛道已经在变化。
750 套跑通之后
产品做出来,和有人真的拿来跑核心业务,是完全不同的两回事。
Atlas 950 SuperPoD 虽然在展台上是第一次亮相,但昇腾超节点技术在市场上不是新面孔。这届WAIC上,鹏城实验室与全球计算联盟联合发布的《超节点定义与实践白皮书》明确提出,超节点已成为AI基础设施建设全新范式。其核心在于通过跨物理节点的统一内存编址,把多台独立机器在逻辑上变成一台计算机来调度,这恰恰解决了Agent时代最棘手的通信墙和显存墙问题。
更值得一提的是,上一代 384 卡超节点已经累计发货 750 套,每一套都是签了合同、付了钱、在生产环境里运行着的。覆盖互联网、运营商、金融、教育、医疗、交通、制造等 20 多个行业。
目前中国市场上规模商用的超节点方案,仅此一家。
750 套意味着什么?这已经过了需要推广的阶段,市场已经用订单验证过了。750 套证明的是跑得稳、用得起、回得来。
但规模商用只是第一步。算力生态要真正确立竞争壁垒,还需要行业标准与技术生态两根柱子协同支撑。
第一根柱子是行业标准,本届 WAIC 上,GCC 全球计算联盟联合鹏城实验室发布了《超节点定义与实践白皮书》,中国有了自己的超节点产业标准。这份文件定义了超节点的概念、架构特征和技术边界。标准这件事容易被当成一份技术文档略过去,但它是产业最底层的竞争。谁定义标准,后来者就按谁的规则走。中国从追赶标准到拿出标准,这个角色切换本身就是信号。
第二根柱子是技术生态,CANN 是昇腾的软件底座,角色类似 NVIDIA 的 CUDA,而今天CANN 已全面开源,67 个社区项目,1244 万行代码,月活超过 3500 位开发者。兼容 Triton、PyTorch、vLLM、SGLang,支持 600 多个开源生态算子。一个今天用 PyTorch 写模型、用 vLLM 做推理的开发者,明天切到昇腾上,工具链不用换,习惯不用改。
产品跑通了,标准立住了,生态打开了。三个条件在 2026 年同时到位。
接下来的问题是,谁已经把核心业务放上来了?
最输不起的两类用户
750 套里,有两类用户值得关注。体量未必最大,但他们对技术故障的容忍度最低。
先说国泰海通。
这是国内证券行业最大的液冷数据中心之一,核心 AI 负载运行在昇腾超节点上。券商对算力的要求与互联网公司完全不同。互联网追求快,响应再快一点,吞吐再高一点。券商第一要求是不出错。交易系统崩一秒,后果是可量化的资金损失;风控模型慢一分钟,风险敞口就多暴露一分钟。
金融行业选算力底座,从来不选参数跑分最高的,看的是谁已经经过足够长时间的稳定运行验证,谁有足够多的同行在用,出问题是否有完善的兜底机制。
国泰海通把 AI 核心负载放上来,这个信号本身就比任何性能白皮书都有说服力。你跟券商讲参数,它不听;它只看你在谁家已经跑过,跑了多久,出没出过事。
除了金融风控,长周期科学计算对算力稳定性的要求同样苛刻,智源研究院则是另一个维度的案例。
智源研究院用昇腾超节点运行 Brainμ 神经科学大模型,基于 7 万多晚睡眠脑电数据,进行跨个体、跨模态分析,连续 10 个月稳定运转。今年 6 月,这项研究联合清华大学发表在 Science 上,首次证实睡眠中的记忆重激活可以反向调控睡眠结构,推翻了睡眠是被动恢复过程的传统认知。
这个过程中,科学家不需要瞬时峰值性能,需要的是连续 10 个月、每天面对不同实验条件的新数据,分析结果始终可靠。Brainμ 的分析结果经过超 3000 晚的人工双盲验证,与神经科学博士高度一致。Science 不会因为你的算力底座稳定就发论文,但底座不稳定,10 个月的实验数据出一次差错,论文就发不出来。
同一个底座上还运行着其他成果。中科大灵境造物用昇腾做新材料创制,消防服隔热能力提升 21 倍,直接关系到一线消防员的生命安全。中科院磐石 100 用昇腾做太阳耀斑预警,对 X 级耀斑实现 100% 捕获、零漏报。2003 年那次导致日本卫星损毁和瑞典电网崩溃的 X28 级耀斑,如果当时有这个系统,就能提前预警。
金融场景要求不能出错,科研要求长期撑得住。这两种严苛的业务需求,昇腾超节点都通过了实践检验。
拐点即起点
过去五年,AI 算力领域的叙事围绕一个字:快。制程更先进,峰值算力更高,带宽更大,每一代产品都在数字上追赶。
Atlas 950 SuperPoD 的亮相和 750 套商用同时出现在这届 WAIC 上,传递了一个不太一样的信号:单品性能竞赛的天花板已经可见,系统效率的竞争刚刚开始。
GCC 白皮书把超节点的定义写进了产业标准,CANN 的开源代码每天被下载 6 万多次,全国各地机房里的机器不分昼夜地运转。这些事实合在一起,指向同一个判断:AI 算力竞争的主战场,正在从芯片转向系统。
判断一项技术是否真的到了临界点,不看展台上的灯亮不亮。要看它离开展台之后,还能不能自己走下去。
2026 年,国产超节点过了这道门。