清程极智师天麾:国产算力买回家,要想用好靠优化?
国产算力的痛点,不是硬件不行,而是软件不行。
9月11日下午,在2026中国算力大会重要分论坛——算力产业创投50人论坛上,清程极智联合创始人师天麾分享了团队释放国产算力效能的实践。
在他看来,国产算力的瓶颈不在硬件,而在软件生态。国外推理框架原生面向英伟达设计,搬到国产芯片上效率极低,"好比用烤箱蒸馒头"。所以,必须从底层针对国产算力重新做软件,而不是在国外框架上修修补补。
他还指出,大规模集群"规模上涨、效率下跌"是整个行业的痛点。在某国产十万卡集群实测中,清程极智自研引擎让 2-3 台国产高端服务器对标一台英伟达高端服务器,并助力深圳超算实现推理延迟降低32%。
在模型服务层面,他观察到,同样一个模型、同样报价,不同服务商的实际性能最高相差近5倍;科研用户要模型覆盖、企业要服务稳定、个人开发者要控制成本,需求千差万别,而服务商各有特色。为此团队打造的清程 AI Ping 平台,7×24 小时监测 30 余家服务商的真实服务质量,像导航实时规划路线一样,自动为用户匹配低延迟、低成本的通道,成为了Token界的“高德地图”。
以下为现场演讲实录,由小饭桌整理:
各位领导各位专家大家好,我是清程极智联合创始人师天麾,今天给大家带来的报告,主题为《AI Infra软硬协同,释放国产算力效能》。
先简单介绍我们公司,团队源自清华大学计算机系,核心方向是算力性能优化、系统调优,已获得多轮产业资本投资,投资方包含中金、智谱(Z基金)、北京市人工智能产业投资基金、上海科创、联想等。
我们目前有三款核心产品:第一款是八卦炉智能软件栈,面向国产算力做模型训练与微调;第二款赤兔推理引擎,主打国产算力环境下的高性能优化软件;第三款是AIPing 平台,承担多服务商环境下的智能调度、模型流量路由能力。
我们的合作客户覆盖范围很广:包含字节等互联网企业、各级政府单位;主流芯片厂商,如海光、华为等;计算中心、服务器硬件厂商;能源、金融行业企业,还有各类网企。
现在市面上做算力软件、AI 调度的公司很多,外人看起来各家方案差异不大。那为什么国家队项目持续选择和我们合作?我们拿实际的超算、大项目案例来做说明。
2021 年青岛海洋之光计算系统,具备十万台共享服务器规模,在大模型还未大规模爆发的阶段,我们团队作为核心研发,落地八卦炉资源系统,该项目由我们团队联合唐杰老师团队、阿里三方共同完成。
刚拿到世界第一的灵晟计算系统,采用芯片纯 CPU 架构,我们为其输出纯 CPU 优化方案,最终实现推理延迟降低 32%。
国内当前规模领先的登峰计算系统,我们完成了万卡到八万卡规模的大模型训练调优,相关成果论文即将发布;同时和芯片厂商、算力运营方完成大量训练优化适配工作。
国家级项目方面,上海仪电、北京智源人工智能研究院这类单位,都给到我们国产算力适配调优项目。
讲完案例,接下来讲核心产品能力,首先是推理优化。
当前国产算力的痛点,不是硬件本身不行,而是软件生态不完善,硬件买回来很难真正跑起来、跑高效。打个比方:手机没有操作系统,硬件就只是一堆零件;算力硬件如果缺少适配的中间层软件,硬件资源就无法转化成实际生产力。
国外主流推理框架原生面向英伟达生态设计,虽然可以在国产芯片上跑通,但运行效率很低。就好比外国人用烤箱烤面包,我们想用这个烤箱改蒸馒头包子,工程上可以实现,但性价比极低,体验很差。
所以我们选择从零自研推理运行时,而非基于国外框架修改二次开发,专门针对国产算力做深度适配,最大化释放国产硬件的真实算力。
这里有两组落地案例。
第一是灵晟计算系统(世界第一超算):16 个超算节点,推理能力可以对标 80 张主流 GPU;同时支持大规模扩展,8000 多个节点规模下,并行效率仍然达到 74.3%,解决大规模集群规模上涨、效率下跌的行业痛点。
第二是登峰计算系统,我们完成大量吞吐、延迟优化。实测 2‑3 台国产高端服务器,推理Prefill能力可以对标甚至超越一台英伟达高端服务器;推理吞吐持平的前提下,可以做到延迟大幅下降。
解决算力硬件如何高效跑模型之后,下一个问题:模型服务怎么交付到开发者、企业用户手上。
国内现在有数百家 AI 模型服务服务商,各家能力特点参差不齐。我们团队本身有超算评测的积累,长期做服务商评测。同样一个模型、同样报价,不同服务商实际服务性能差距最多可达 5 倍以上。
同时不同用户诉求完全不一样:科研用户希望模型覆盖广;企业落地场景,对成本敏感度不高,但极度看重服务稳定性;个人开发者首要诉求是控制成本。服务商各有特长,用户需求千差万别,供需匹配是一大难题。
基于这个痛点,我们历时一年多打造了AIPing 一站式服务平台,做客观、全面的 AI 模型服务评测与调度平台。
平台已经接入 30 余家正规大型服务商,覆盖 400 + 模型服务,7×24 小时持续监测各家服务商的真实服务质量。对外提供统一 API 接口,用户可以自由选择不同服务商的能力。国内主流开源文本、图片、音视频模型,基本都可以在平台上找到。接入方包括互联网大厂、电信运营商、模型原厂、AI 创业公司。
我们持续监测输出多维度指标:上下文窗口、输出长度、首包延迟、吞吐、服务可靠性、请求成功率、模型输出成功率,全部对外可视化展示。很多服务商也会参考我们平台数据,对标同行服务水平。
平台的核心逻辑,不需要用户自己去研究选择哪家服务商。用户直接输出约束条件,例如 “5 秒以内延迟,吞吐 50token/s,满足条件下成本最低”,平台依据实时评测数据,自动路由匹配最合适的服务商。把复杂的选型、工程调度交给平台,给到用户简单稳定的使用体验。
这里可以用出行导航类比模型调用场景。开发者调用大模型,经常遇到调用拥堵、延迟高、成本不可控的问题,就像道路堵车、交通费超支。出行需要智慧导航,AI 调用场景就需要智能路由。
智能路由承担两大核心能力:模型组合路由、服务商路由。
模型组合路由,类似导航选择不同交通工具。同一个任务不必绑定单一模型,问答部分交给 A 模型,复杂逻辑交给 B 模型,把任务拆分分配给最合适的模型,解决单一模型卡顿问题。
服务商路由,如同导航实时规划最优路线。平台实时监控各家服务商的负载、性能状态,24 小时感知各个服务通道通畅程度;同时实时对比各家的价格,自动避开高成本通道。实现选好用、选便宜,让每一次模型调用低延迟、低成本。
目前 清程AI Ping(aiping.cn)智能路由正在招募体验官,欢迎体验,你的模型调动一路畅通。
以上就是我的全部分享,谢谢大家。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”
