在Token经济大潮的推动下,大模型产业的竞争正在从单纯比拼单卡算力,转向比拼Token的生产、流转与复用效率。中科曙光高速网络互联产品部总工程师万伟表示:“现在的大模型基本都基于Transformer架构,按Token进行处理。因此,Token是当前AI工厂最重要的产出,也是衡量AI效能和经济效益的重要指标。”行业内已逐步达成共识:AI算力硬件的纸面性能不等于业务实际产出,能否高效生成、传递、复用Token,决定着智算集群的真实服务能力。
当下,AI正快速走向规模化落地,MoE混合专家大模型、长文本对话、RAG检索增强、AI Agent高频调用等业务快速普及。为更好承载上述新型应用,AI集群也朝着万卡、十万卡规模持续扩张。但是,我们必须清醒地认识到,在需求增长的背后,“算力过剩而产出不足”的矛盾愈发凸显。比如,很多智算集群虽然配置了大量高性能加速卡,却受限于数据流转瓶颈,GPU频繁空转等待,硬件算力难以充分释放,模型计算利用率(MFU)长期达不到理想水平,进而推高了大模型训练与推理的综合成本。
在Token经济时代,如何打通从算力、网络到存储的全链路通路,将硬件算力转化为实实在在的Token输出能力,成了国产AI基础设施必须破解的核心命题。
1
网络成为绕不开的性能瓶颈
大模型完整业务流程通常包括训练、推理、存储复用三大阶段,Token在这三个阶段中持续流动,任何环节的性能短板,都会影响Token的生成速度。网络传输是贯穿全流程的关键。
万伟指出:“训练中的通信是同步操作,与过去云计算中的异步操作不同。一块GPU或一张计算卡稍慢,其他计算卡都要等待。因此,各算力卡之间的同步要求很高,通信过程对时延也非常敏感。任何异常时延的增加,都可能降低MFU。”更甚者,随着集群规模的扩张,网络通信耗时甚至会占据整体训练任务耗时的30%-50%,网络抖动带来的长尾时延则会被成倍放大,从而制约训练的迭代速度。
进入推理阶段,行业普遍流行“以存代算”的优化思路,通过保存KV Cache中间结果以减少重复计算开销。推理可以拆分为Prefill预填充与Decode解码两个阶段,PD分离架构也随之广泛应用。Prefill阶段完成输入处理并产出KV Cache,再通过网络把大量缓存数据交给Decode节点完成Token输出。面对长上下文业务场景,KV Cache的数据规模可以达到数十GB,跨节点搬运效率直接决定首Token时延TTFT、单Token生成时延TPOT两大核心体验指标。上下文越长,网络传输在整体推理耗时中的占比就越高,网络卡顿会直接造成用户对话响应慢、生成卡顿等问题。
在存储复用环节,RAG知识库、AI Agent业务需要反复读取训练数据集、Checkpoint检查点、KV Cache缓存,大量数据需要在计算节点与分布式存储之间来回交互。如果存储访问路径冗长,势必会造成加速卡频繁等待IO,既浪费算力,也将拉低Token复用效率。
过去,行业内常常简单地将Token生成能力等同于GPU算力。但现实情况是,超大模型、MoE架构很难在单卡甚至单机内容纳完整模型,必须依赖分布式集群运行。大量Token相关数据、KV Cache缓存需要跨GPU、跨节点流转。万伟直言:“算力不等于产出,数据流转效率是影响Token生成效率的关键因素。”其中,网络作为连接起算力与存储的纽带,一旦出现瓶颈,再强大的单卡算力也无法充分发挥其价值。在传统网络方案中,不管是CPU参与通信调度带来的调度开销,还是多级转发带来的时延累积、大规模组网下的拥塞抖动,都会制约大模型的业务性能。因此,市场迫切需要一套面向Token全生命周期设计的网络加速体系。
中科曙光scaleFabric Token加速技术体系应运而生,它以原生无损RDMA网络底座,打造算-存-传三级紧耦合的超级加速通道,实现了IBGDA(InfiniBand GPUDirect Async)技术在国内的首次规模化落地,为国产智算基础设施提供全新的全链路解决方案。
2
算-存-传三级协同
打造Token全链路加速通道
scaleFabric Token加速体系的核心逻辑,并非单纯追求网络带宽数值,而是围绕Token构建从生成、传输到缓存复用的完整链路,打通计算、存储、网络之间的数据通路,减少数据拷贝、降低CPU干预,让数据走最短传输路径,从而实现Token全流程高效流转。
1.计算加速:逐级剥离CPU负担,释放GPU通信潜力
计算侧的核心痛点在于传统通信路径过度依赖CPU参与,即便采用 GPUDirect RDMA(GDR)实现网卡直接读写GPU显存,绕开内存拷贝,通信任务下发、元数据处理依旧需要CPU参与完成调度。万伟指出:“RDMA通信可以分为控制面和数据面,传统GDR主要优化了数据面。IBGDA则进一步把通信控制和数据处理都放到GPU上完成,使得GPU Kernel能够直接驱动网卡。”
如此一来,通信任务下发、数据管理全部在GPU侧完成,彻底剥离通信链路中的CPU控制开销。对于MoE模型典型的All-to-All小包通信场景,这套方案可以大幅降低小包通信时延,缓解CPU调度带来的性能惩罚,更好适配当前主流大模型架构的通信特征。同时,scaleFabric Token加速体系已经完成对DeepEP等主流MoE通信框架的适配,上层业务应用几乎不需要修改代码即可直接复用,从而大幅降低业务迁移成本。
2.存储加速:打通算力到存储的高速通路
在大模型业务中,训练数据集加载、Checkpoint读写、KV Cache卸载、知识库读取等通常会带来海量存储访问。传统存储访问路径需要经过“存储-主机内存-GPU显存”多次拷贝,CPU与内存很容易成为中间的瓶颈。scaleFabric搭建起由NVMe over RDMA、XDS(XPU Direct Storage)、NFS over RDMA共同组成的存储加速通道,三种技术各司其职,又可以协同调度,满足不同AI业务的存储诉求。
NFS over RDMA面向传统文件业务场景,让NFS文件系统跑在RDMA高速网络上,无需改动上层业务习惯,就可以实现零拷贝高速文件访问,适配训练数据集加载、Checkpoint读写这类文件形态业务。在实际场景中,可将GPU利用率从55%提升至95%以上,缩短训练轮次耗时30%-60%。
NVMe over RDMA聚焦块存储访问,面向KV Cache卸载、热数据缓存等场景,让计算节点高速访问远端NVMe存储池,以满足大推理业务海量缓存的读写诉求。
XDS作为加速卡直通存储能力,允许GPU等各类加速卡绕过CPU与主机内存,经由RDMA网络直接读写远端存储,数据从存储端直接抵达加速卡显存,打造存储访问最短路径,以缓解大模型训练时加速卡等待数据而空转的问题。
总之,三者互相配合,能够有效覆盖文件、块存储、加速卡直读存储的多元场景,消除Token在存储环节的性能短板。
3.原生无损RDMA底座缓解大规模组网时延
大规模智算集群普遍采用CLOS多级组网架构,一份Token数据往往需要经过多跳交换机转发,而每一跳都会叠加时延。某些RDMA方案依赖PFC机制实现近似无损,但集群规模放大后极易出现性能滑坡。
scaleFabric采用严格无损网络协议,不需要依赖PFC便可实现无损特性,更可适配十万卡级别大规模集群扩展。公开测试数据显示,产品单跳转发时延低至260纳秒,网卡端到端时延低于1微秒,性能对标国际InfiniBand NDR水平;在三跳组网场景下,大消息的端到端时延对比主流RoCE方案降低约63%,有效抑制多级转发带来的时延累积问题。此优势对于PD分离推理长上下文 KV Cache 跨节点搬运、MoE大规模All-to-All通信价值突出,即使在十万卡规模下,Token跨节点传输依旧可以保持稳定的低时延。另外,scaleFabric方案预留软件迭代能力,下一代将升级至800G带宽,同时增加拥塞控制、包喷洒、多平面等高级特性,为未来更大规模集群的部署做好技术储备。
不同于市面上多数网络产品只聚焦网络本身优化,scaleFabric Token加速体系把网络、计算、存储作为一个整体系统进行统筹设计,以网络为纽带打通算存边界,构建方案的差异化优势。中科曙光北京公司scaleFabric产品经理纵瑞博表示:“我们采用开放架构,后续还将致力于让scaleFabric网络与更多国产厂商的产品完成适配和优化,为用户提供高性价比的国产原生无损RDMA网络方案。”
3
IBGDA:面向MoE时代的正确选择
在scaleFabric整套Token加速体系中,IBGDA是实现GPU侧自主通信的核心抓手,也是本次发布的核心亮点。在此之前,IBGDA规模化应用长期由海外厂商主导,国产RDMA网络实现GPU直通通信的落地案例罕见。中科曙光scaleFabric实现了该技术在国内首次规模化落地,填补了行业空白。
为什么IBGDA是适配当下大模型发展的正确路线?当前,MoE已经成为大模型主流架构,MoE推理训练过程会持续爆发大量碎片化小包通信。传统方案即便数据通路走GDR绕过内存拷贝,通信任务的发起、工作队列配置依旧依赖CPU进行处理。海量小包并发场景,CPU频繁处理通信指令,会产生巨大调度开销,CPU会成为通信的瓶颈。IBGDA的核心价值,就是将通信的控制面和数据面全部下沉至GPU,由GPU内核直接操作网卡寄存器完成通信发起,彻底将CPU移出关键通信路径,从而解决MoE场景小包通信的痛点。
万伟表示:“IBGDA主要应用于MoE通信,特别是MoE All-to-All场景。这类场景的特点是高频、大量、并发的小消息通信,因此非常适合使用IBGDA。对于一些传统通信场景,例如低频、顺序传输的大块数据,瓶颈可能出现在存储或计算环节,IBGDA的收益就不会那么明显。”但是放眼产业发展,MoE模型已经成为行业主流,长上下文推理、大规模分布式训练业务持续爆发,小包高频通信会是智算集群常态的业务特征,未来IBGDA的适用场景会持续拓宽。
从落地实践来看,IBGDA需要针对不同加速卡完成底层适配。在部分国产生态和NVIDIA生态中,曙光已经完成了适配,其scaleFabric方案可以直接使用。纵瑞博进一步补充说:“对于上层应用来说,这一能力是无感的。只要基于DeepEP 框架,就不需要修改业务代码或上层框架,便可直接运行。”
曙光已经在十万卡级别的大规模集群完成技术验证。“我们做过大量测试,理想情况下,整体性能大约可以提升20%-30%。这不仅是IBGDA本身的贡献,也是我们联合伙伴开展多方面优化的结果。”万伟如是说。
通过网络技术创新,提升多卡协同通信效率,依靠集群整体能力补齐单卡差距,是国产智算发展的可行方向。scaleFabric实现了IBGDA的规模化落地,正是国产基础设施系统创新的典型实践。它不只是一项网络技术创新,更是帮助国产算力集群将多张加速卡算力真正聚合起来的粘合剂,为国产大模型训练、推理提供自主可控的高速互联新选择。
万伟判断:“未来,AI计算一定会向集群化发展。在这一过程中,低时延网络和高性能存储都会成为标配。”scaleFabric Token加速技术体系,直击分布式大模型业务网络与存算协同痛点,助力国产AI基础设施释放出更大的整体算力,支撑国内大模型产业高质量规模化发展。