


十万卡集群的真门槛,九成厂商跨不过去
说真的,逛完今年 WAIC 最大的感受,就是算力行业的认知差太离谱了。很多人聊起十万卡集群,张口就数堆了多少颗芯片,好像卡多就是厉害,实则根本没摸到行业的核心门槛。
懂行的都清楚,十万卡绝不是芯片的简单堆叠,规模上去之后,通信延迟、故障率、功耗三座大山会指数级爆发,随便一个都能把集群干成中看不中用的 “算力孤岛”。通信卡壳,一半算力都在空转等数据;故障率飙升,一次断训就能亏掉几百万;功耗炸了,传统风冷直接失效,芯片分分钟降频宕机。
曙光 8000 能在几千件展品中杀出重围,拿下本届镇馆之宝,就是因为人家不是靠堆卡凑噱头,是真的从系统层面把三座大山全拆了。算存传一体化架构把通信时延压到微秒级,AI 智能运维把系统可用性拉到 99.99%,MW级浸没液冷把 PUE 干到 1.04,全链路自研打通所有环节。
说白了,十万卡时代的竞争,早就从“拼卡数”的上半场进入“拼系统”的下半场,能跑通全链路系统能力的,才是真正的行业领跑者。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”