新闻动态

登顶全球第一!清程极智携手“灵晟”超算,解锁纯CPU国产算力AI推理新高度

时隔9年,中国超算再度站上全球之巅!在近期落幕的国际超算大会上,国家超级计算深圳中心新一代“灵晟”超算系统重磅亮相,以2.19EFLOPS的实测持续性能,成为全球首台持续性能突破2EFLOPS的超算系统。这也是继2017年“神威·太湖之光”之后,我国超算再度斩获全球第一,刷新国产超算性能纪录。


“灵晟”超级计算机

图片来源:国家超级计算深圳中心


在这一世界级突破的同时,GCC会员单位清程极智与深圳超算联合完成了一项“大考”:双方软硬深度协同优化,在未使用一张GPU的情况下,基于“灵晟”纯CPU集群,成功完成DeepSeek模型的分布式推理部署。测试结果显示,在16节点、batch_size=2048的条件下,其输出吞吐量已达到80张主流GPU组成集群的水平,成功验证了国产HPC超算承载顶级大模型推理的硬核实力。


这一成果,彻底打破了“CPU只适合科学计算、GPU才适配AI推理”的固有认知,让国产超算从传统高性能计算场景,跨界成为高质量AI Token生产的核心算力底座。


但这不仅是算力的胜利,更是“用起来”的胜利。


为什么这件事很难?架构不同,无法“平移”代码


长期以来,大模型推理高度依赖GPU、NPU等专用加速芯片,CPU集群因架构差异等原因,较少用于大规模AI推理场景。


“灵晟”的算力底座基于自研LX2 CPU,其体系结构与GPU、NPU截然不同。它虽拥有强大的矩阵加速单元和片上高带宽内存,但这也导致原本为GPU设计的AI推理方案无法直接复用。


LineShine的Arm LX2处理器与SME和SVE引擎的示意图

图片来源:Jack Dongarra 的《中国 LineShine 系统报告》



大模型推理对计算密度、内存带宽和节点间通信都有极高要求,要让原本运行在专用加速卡上的千亿参数大模型在纯CPU集群上跑得快,必须从底层开始重构。这不仅是技术难度的提升,更是对软硬协同能力的极限考验。


但“灵晟”的硬件设计最大的亮点在于架构层面的原生超智融合,为这件事提供了独特基础:



  • 算力侧:不同于单纯堆砌专用加速卡的传统路径,“灵晟”在自研的LX2 CPU中引入矩阵加速单元并支持多精度,实现片上HPC算力与AI算力的深度融合。尤为关键的是,CPU集成了片上内存(高带宽内存),可提供TB级带宽,相较传统CPU实现了十倍跃升,为大模型推理中的大批量并发处理提供了充足的带宽保障。


  • 网络侧:自研的“灵启”网络支持μs级低时延传输,具备可扩展至200万端口、10万节点的超大规模组网能力。这种极低时延、极高扩展性的互联特性,有效消除了分布式推理中的通信瓶颈,为大规模分布式推理降低通信开销。



硬件创新只是第一步。“灵晟”LX2 CPU与GPU/NPU架构存在本质差异,要将大模型从“专卡”平滑迁移至“通卡”,必须攻克软件层面的重重难关。


从算子到架构,清程做了三件事

面对挑战,清程极智没有选择“打补丁”,而是围绕LX2芯片特性,从算子、编译、计算图、并行策略到通信过程进行系统级联合优化,让AI模型不仅“能跑”,更能以更低时延、更高吞吐持续输出Token。



  • 第一层:面向CPU特性,重构计算与通信算子,大幅降低推理时延


针对“灵晟”自研软硬件,清程极智完成了算子的重构:基于LX2 CPU的矩阵运算指令集,结合OpenMP与自研编译器实现计算算子;基于自研通信库构建通信算子,借助自研统一并行加速库——该库具备计算图语义扩展、共享内存通信加速、多线程调度优化及硬件特性抽象等核心能力,清程极智实施精细化的指令序列控制,应用计算掩藏访存、异步流水线调度等优化策略。针对无依赖关系的多个算子,团队切分线程池,分布线程并行度,让少数线程负责并行度低的算子,多数线程负责并行度高的算子。例如Shared expert与EP通信同时进行,实测显示,MoE推理时延1440μs大幅降低至980μs。



  • 第二层:面向“灵晟”集群,设计多层次并行推理优化,最大化集群算力利用率


LX2 CPU采用NUMA架构并集成片上内存,结合“灵启”网络的强劲互联能力,与DeepSeek大EP(Expert Parallelism,专家并行)架构天然契合,具备极佳的集群扩展性。


基于此,清程极智实施了多维度的并行策略优化:灵活配置张量并行(TP)、流水线并行(PP)、专家并行(EP)及数据并行(DP),构建多层次混合并行推理方案。






在DeepSeek部署上,团队采用EP256的大规模专家并行配置,专家权重的全量分散部署,节点内TP16,节点间DP16,并针对Attention模块,设计了定制化混合并行策略,充分释放了LX2平台的算力密度与通信能力。



  • 第三层:引入MTP(Multi-Token Prediction)技术加持,提升单请求输出速率


在上述优化基础上,清程极智引入了DeepSeek MTP加速技术,使一次推理能够预测多个Token,再并行验证每个token否正确,显著提升了单请求的输出速率。团队还深入探究了不同并发规模下MTP加速比与预测深度的相关性,持续调优以实现最佳推理效果。


这件事意味着什么?让多样国产算力转化为可持续“Token产能”


上述优化带来的是技术指标的提升和算力价值的重塑——


  • 吞吐量比肩GPU集群:在特定条件下,16节点纯CPU集群的输出吞吐量与80张主流GPU集群相当;

  • 延迟大幅降低:MoE推理时延缩短32%。


而最核心的价值,在于打通了国产超算算力向AI生产力转化的完整路径。


清程极智联合创始人师天麾表示:“超智融合不是简单地用超算来处理AI任务,而是把高性能计算资源转化为可衡量、可持续的Token产能的关键路径。”


以往国产超算算力多局限于科学计算场景,价值难以向AI产业落地。而清程极智在本次“灵晟”项目上的的全链路优化,真正证明了超算算力的复用升级:通过精细化的系统级调优,让顶级国产超算能够稳定、高效地产出高质量Token,为大模型产业落地提供坚实的算力底座。


长期深耕!超智融合是清程极智的既定技术赛道


为何要在超算上跑AI?长期以来产业需求揭示了两大核心动因:一是方法融合,科学计算物理模型与数据驱动的AI深度结合,催生颠覆性科研成果;二是效能提升,超算平台通过错峰运行AI任务,最大化利用算力资源。


清程极智团队在过去十几年中,在国产超算上有较多的技术积累,对超智融合的探索由来已久。本次在灵晟超算的突破性成果,并非单次尝试,而是清程极智长期深耕“HPC+AI超智融合”技术路线的必然结果。


早在十几年前,清程团队即在太湖之光上有所作为;2021年,清程八卦炉训练系统再次创造历史,在青岛超算上实现全机规模上的大模型预训练;2025年,清程已率先基于鲲鹏高性能计算平台,完成DeepSeek大模型推理部署,通过算子优化、多层次并行调优,验证了国产HPC平台承载AI大模型负载的可行性。


未来,清程极智将持续深耕超智融合技术赛道,探索更大规模超算集群、持续突破国产算力AI推理性能上限,让模型在既定资源条件下形成更强的Token产能,为国产大模型产业的自主化、规模化发展筑牢算力根基!