全球第一超算跑满血DeepSeek!一张GPU没用,打造超智融合Token工厂
科技
科技 > 人工智能 > 正文

全球第一超算跑满血DeepSeek!一张GPU没用,打造超智融合Token工厂

在“灵晟”国产超算登顶最新一期全球超级计算机TOP500榜单后,清程极智与“灵晟”联合完成纯CPU MoE模型分布式推理方案:

16节点即可流畅运行DeepSeek-V3/R1-671B模型,在batch_size=2048时,输出吞吐量与80张主流GPU集群相当。

这不仅是一次HPC与AI融合的技术突破,也提供了一个观察国产算力如何从基础设施转化为Token生产能力的新样本:当算力、模型与推理软件被系统级协同优化,超算不再只服务于传统科学计算,也可以成为持续生产大模型Token的“工厂”

架构革新:

“灵晟”筑就AI大模型推理新基石

为何要在超算上跑AI?产业需求揭示了两大核心动因:

一是方法融合,科学计算物理模型与数据驱动的AI深度结合,催生颠覆性科研成果;二是效能提升,超算平台通过错峰运行AI任务,最大化利用算力资源。

以此为视角审视“灵晟”,其最大的亮点在于架构层面的原生超智融合。

算力侧:不同于单纯堆砌专用加速卡的传统路径,“灵晟”在自研的LX2 CPU中引入矩阵加速单元并支持多精度,实现片上HPC算力与AI算力的深度融合。尤为关键的是,CPU集成了片上内存(高带宽内存),可提供TB级带宽,相较传统CPU实现了十倍跃升,为大模型推理中的大批量并发处理提供了充足的带宽保障。

网络侧:自研的“灵启”网络支持μs级低时延传输,具备可扩展至200万端口、10万节点的超大规模组网能力。这种极低时延、极高扩展性的互联特性,有效消除了分布式推理中的通信瓶颈。

硬件创新只是第一步。“灵晟”LX2 CPU与GPU/NPU架构存在本质差异,要将大模型从“专卡”平滑迁移至“通卡”,必须攻克软件层面的重重难关。

软硬协同:

释放超智融合澎湃算力

HPC与AI虽属不同计算范式,但在核心优化思路上却一脉相承——均依赖算子优化、计算与访存重叠、流水线并行及多级并行等手段,以充分释放硬件性能。

结合“灵晟”平台硬件特性及自研软件,清程极智从多个技术维度对大模型推理进行了深度加速。

1. 面向“灵晟”LX2 CPU的算子开发与优化

针对“灵晟”自研软硬件,清程极智完成了算子的重构:基于LX2 CPU的矩阵运算指令集,结合OpenMP与自研编译器实现计算算子;基于自研通信库构建通信算子。

借助自研统一并行加速库——该库具备计算图语义扩展、共享内存通信加速、多线程调度优化及硬件特性抽象等核心能力,清程极智实施精细化的指令序列控制,应用计算掩藏访存、异步流水线调度等优化策略。

针对无依赖关系的多个算子,团队切分线程池,分布线程并行度,让少数线程负责并行度低的算子,多数线程负责并行度高的算子。例如Shared expert与EP通信同时进行,实测显示,MoE推理时延1440μs大幅降低至980μs。

2. 面向“灵晟”集群的多层次并行推理优化

LX2 CPU采用NUMA架构并集成片上内存,结合“灵启”网络的强劲互联能力,与DeepSeek大EP(Expert Parallelism,专家并行)架构天然契合,具备极佳的集群扩展性。

基于此,清程极智实施了多维度的并行策略优化:灵活配置张量并行(TP)、流水线并行(PP)、专家并行(EP)及数据并行(DP),构建多层次混合并行推理方案。

在DeepSeek部署上,团队采用EP256的大规模专家并行配置,专家权重的全量分散部署,节点内TP16,节点间DP16,并针对Attention模块,设计了定制化混合并行策略,充分释放了LX2平台的算力密度与通信能力。

3. MTP(Multi-Token Prediction)技术加持

在上述优化基础上,清程极智引入了DeepSeek MTP加速技术,一次推理产生多个token,再并行验证每个token否正确,显著提升了单请求的输出速率。团队还深入探究了不同并发规模下MTP加速比与预测深度的相关性,持续调优以实现最佳推理效果。

打破边界:

引领超智融合新范式

基于“灵晟”多样性算力架构的创新与清程极智的AI推理加速技术,成功实现了DeepSeek模型的高效部署,率先实现纯CPU MoE模型分布式推理,16节点即可流畅运行DeepSeek-V3/R1-671B模型,在batch_size=2048时,输出吞吐量与80张主流GPU集群相当。

从一次技术突破,

到面向终端可交付的高质量“Token服务”

此次灵晟超算合作落地的技术成果,绝非单次偶然的技术攻关突破,而是国产算力软硬结合价值的有力印证,更是清程极智长期深耕国产化算力适配、持续打磨AI推理工程能力的必然结果,全方位彰显了公司成熟的国产算力Token量产与交付实力。

当前国产算力产业已迈入新阶段,行业核心痛点早已从“有无算力硬件”转向“能否将硬件算力转化为稳定、高效、可落地的Token服务”。

单纯的硬件峰值算力指标无法真实反应实际AI生产力,只有通过深度的软件适配、算子优化、通信协同与并行策略重构,才能打通硬件算力到大模型Token服务的完整链路,让国产算力从硬件资源真正转化为可商用、高性价比的AI生产力,而这正是软硬协同融合的核心意义与产业价值。

本次纯CPU MoE模型分布式推理方案的成功落地,核心依托两大核心支撑:一是灵晟超算原生超智融合的国产化硬件底座,LX2 CPU、片上高带宽内存与灵启超低时延网络,构建了适配大模型推理的优质国产硬件体系;二是清程极智多年深耕国产化赛道的技术积淀。

相较于行业通用的适配移植模式,清程极智始终立足国产算力架构特性做原生优化,不套用海外GPU适配逻辑,长期深耕国产CPU、国产超算及其他国产算力的推理适配、算子迭代、集群并行优化等核心技术,积累了一套成熟、适配各类国产异构算力的系统化优化方法论,这也是本次突破得以实现的核心根基。

依托长期的国产化技术积淀,清程极智具备了完整的国产算力Token工厂量产交付能力。不同于碎片化的技术优化,清程打造的是一套从硬件适配、软件优化、算力调度到Token高效产出的全链路系统化能力。

本次合作中,清程团队针对灵晟硬件特性完成算子重构、计算通信协同优化、多层次混合并行部署与MTP技术叠加加速,并非零散的技术叠加,而是精准适配国产超算架构的成套工程化落地,成功将灵晟超算的硬件算力潜力,高效转化为高吞吐、低时延、可扩展的Token生产产能,让国产超算摆脱传统科学计算的单一用途,正式纳入大模型AI服务的生产体系。

所谓Token服务,核心是跳出传统算力评价思维,摒弃单纯以节点数量、峰值算力为核心的硬件评价标准,以终端业务可感知的Token产出效率、单位算力成本、推理时延、服务稳定性等产业落地维度衡量算力价值,建立一套完整的算力生产评价体系:不再单纯比拼节点数、峰值算力,而是衡量单位算力、单位能耗、单位成本下的Token产出吞吐、推理时延、服务稳定性与可用性。其本质是把零散的算力硬件、模型、软件系统,整合为标准化、可量产、可交付的AI生产力。

此次与灵晟超算的深度合作,是清程极智国产化深耕之路的重要标杆性落地。它充分证明,国产自主可控的超算硬件,搭配本土企业深耕打磨的自研推理软件与系统化优化能力,完全能够比肩主流GPU集群的大模型推理效能,实现高性能Token量产。

同时也印证了清程极智的核心竞争力:不止于单点技术突破,更具备将各类国产算力硬件,标准化、工程化转化为可持续交付的AI Token生产力的完整能力。

未来,随着国产算力生态持续完善、异构硬件不断丰富,清程极智将持续依托自身软硬协同优化优势,持续深化国产化全场景适配能力,拓展更多国产算力载体的Token工厂落地场景,推动国产算力从“可用”全面走向“好用、高产、低成本”,为国产AI基础设施的规模化商用落地筑牢核心产能根基。