
中科曙光发布scaleFabric Token加速技术体系:IBGDA国内首次规模化落地,十万卡集群完成验证
9月11日,中科曙光发布scaleFabric Token加速技术体系。该体系以自研原生无损RDMA高速网络scaleFabric为基础,构建"算—存—传"三级紧耦合的Token加速超级通道。其核心IBGDA(InfiniBand GPU Direct Async)技术已在十万卡级大规模集群中完成验证,实现国内首次规模化落地。IBGDA让GPU内核直接驱动网卡发起通信,绕过传统路径中CPU的指令中转,将小包通信效率提升两个数量级,消除MoE架构大规模并发的"CPU惩罚"瓶颈。在典型两层CLOS架构下,scaleFabric单跳转发时延低至260纳秒,端到端三跳时延小于1微秒,以4KB以上大消息报文为例三跳时延较主流RoCE方案低约63%,与英伟达NDR持平。已完成与DeepEP等通信框架适配,结合全链路优化后系统整体性能可提升20%至30%。
【新闻原文】
9 月 11 日消息,中科曙光发布 scaleFabric 词元(Token)加速技术体系。该体系以自研原生无损 RDMA 高速网络 scaleFabric 为基础,构建"算—存—传"三级紧耦合的 Token 加速超级通道,减少数据传输和读取过程中的等待,提升大模型运行效率。
中科曙光高性能计算产品事业部总工程师万伟表示,"Token 是当前 AI 工厂最重要的产出,也是衡量 AI 效能和经济效益的重要指标。"分布式架构下,Token 相关数据需要在不同 GPU 之间频繁传递,数据流转的快慢会直接影响整个集群的计算效率。训练阶段所有计算卡需要同步梯度数据,是典型的同步操作——一块卡速度稍慢,其他所有卡都要等待,任何异常时延都会拉低模型计算利用率(MFU);推理阶段则分为输入预处理与逐字生成两个环节,中间会产生大量缓存数据需要在节点间搬运,用户感知到的"首字等待时间""打字速度",本质上都和数据传输速度高度相关。研究表明,在大规模分布式训练中,网络通信耗时占比已达到 30%—50%。
在计算环节,GDR 技术让网卡可直接读写 GPU 显存,减少 CPU 内存中转;IBGDA(InfiniBand GPU Direct Async)技术进一步让 GPU 直接驱动网卡、管理数据传输,消除传统路径中 CPU 调度带来的开销。其技术流程是:GPU 内核直接在显存中准备好数据并写入工作队列,然后直接向网卡的门铃寄存器发起写入操作以通知网卡,网卡随后通过 GDR 技术从 GPU 显存中读取工作描述符和数据,完成后续的 RDMA 发送。整个过程从数据搬运到任务下发全部在 GPU 上完成,实现"GPU 直达网卡"。这一"去中心化"通信模式将小包通信效率提升了两个数量级,消除了长期困扰 MoE 架构大规模并发的"CPU 惩罚"瓶颈。
在存储环节,scaleFabric 通过 NVMe over RDMA、XDS 和 NFS over RDMA 技术加快远端存储访问,支持 GPU 直接读取远端数据,并提升文件传输效率,缩短数据从存储到计算的路径。
性能实测方面,大模型分布式训练和推理涉及多级网络交换,一个 Token 从源 GPU 发出需依次经历接入交换机(Leaf)→汇聚交换机(Spine)→目标接入交换机(Leaf)三跳转发。在这一典型的两层 CLOS 架构下,scaleFabric 单跳转发时延低至 260 纳秒,端到端(三跳)时延小于 1 微秒;以 4KB 以上的大消息报文为例,scaleFabric 三跳时延较主流 RoCE 方案低约 63%,这一性能指标与英伟达 NDR 持平。在 PD 分离架构的 KV Cache 跨节点搬运和 MoE 模型的 All-to-All 大规模通信中,这一低时延、低抖动的网络能力为 Token 生成提供了稳定、可预期的跨节点传输保障。
尤为关键的是,中科曙光自研 IBGDA 技术已在十万卡级集群中完成验证,实现国内首次规模化落地。从千卡级扩展到十万卡级,IBGDA 在 MoE 模型的 All-to-All 通信场景中表现出优异的线性扩展能力,通信效率未随集群规模扩大而明显衰减。此前,IBGDA 的规模化落地主要由国际厂商主导,国产 RDMA 网卡与 GPU 直通的落地案例极为罕见。目前 scaleFabric 已完成与 DeepEP 等通信框架的适配。中科曙光方面透露,经过多场景测试,结合全链路优化后系统整体性能可提升 20% 至 30%。
万伟坦言,制约国产算力发展的一个重要因素是国内外高端计算卡的单卡性能仍有差距,国内 AI 基础设施的重要发展方向是通过系统级创新提升整体性能,依靠集群和多卡互联,通过增加计算卡数量、改善多卡通信效率,满足大模型发展所需的算力要求。中科曙光北京公司 scaleFabric 产品经理纵瑞博表示,公司采用开放架构,希望让 scaleFabric 网络与更多国产厂商的产品完成适配和优化,在 RoCE 和 NVIDIA InfiniBand 之外,为产业提供高性价比的国产原生无损 RDMA 网络方案。
【企服观察】
中科曙光这条消息在舆论场上的热度,远不如同一天外滩大会的 AI 支付发布,但对真正做算力采购和智算中心建设的人来说,它的分量可能更重。原因很简单:它触及的是国产算力最尴尬的那个痛点——单卡比不过,集群效率又上不去。
先把问题说清楚。国产 AI 芯片在工艺制程、先进封装上与国际顶尖产品存在客观差距,这是短期无法靠努力抹平的。于是行业转向另一条路:既然单卡性能追不上,那就靠规模堆。十万卡、百万卡集群被反复提及,逻辑是"一张卡慢一点,一万张卡总能补回来"。但这个逻辑有个前提——卡与卡之间的通信必须足够高效。而现实是,在大规模分布式训练中网络通信耗时占比已经达到 30%—50%,也就是说一半的宝贵算力可能消耗在等待数据上,而不是在做计算。MoE 架构普及后情况更糟,因为 MoE 会产生大量高频并发的小消息通信,传统路径中每一次通信都要经过 CPU 调度,CPU 一下成了新的瓶颈,业界称之为"CPU 惩罚"。
所以 IBGDA 的意义不是"又一项技术突破",而是把这条效率链路上最堵的一环给打通了。让 GPU 内核直接驱动网卡、绕过 CPU 中转,把通信从"GPU→CPU→网卡→网络→网卡→CPU→GPU"压缩成"GPU→网卡→网络→网卡→GPU",小包通信效率提升两个数量级。这个优化对稠密模型可能只是锦上添花,对 MoE 模型却是决定性的——因为 MoE 的性能瓶颈恰恰就在 All-to-All 通信上。更关键的是它已经在十万卡级集群完成验证,从千卡扩到十万卡通信效率没有明显衰减。工程界都知道,实验室跑通和万卡规模稳定运行之间隔着一条鸿沟,能在十万卡集群里扛住实际生产环境,这件事的说服力比任何基准测试数字都强。
对企业的现实影响可以从三个层面看。第一是算力成本。中科曙光方面透露,结合全链路优化后系统整体性能可提升 20% 至 30%。在当前智算中心普遍面临"算力贵、利用率低"的背景下,30% 的性能提升几乎等于直接省下三成的算力支出。对于自己建集群做模型训练的企业,或者按算力付费的 AI 应用公司,这是实打实的成本项。第二是选型逻辑的变化。过去甲方采购国产算力,往往被"单卡算力多少 TFLOPS"这样的参数主导,结果是纸面参数接近、实际跑起来差一大截。当网络层的系统级优化开始被量化(单跳 260 纳秒、三跳端到端低于 1 微秒、较 RoCE 低 63%),采购评估的维度就该从"单卡参数"转向"全链路实测效率"。建议在招标或 PoC 阶段就要求供应商提供目标模型在实际集群规模下的 MFU 与通信占比数据,而不是只看卡的数量。
第三是生态与自主可控的深层含义。IBGDA 此前主要由国际厂商主导,国产 RDMA 网卡与 GPU 直通的规模化案例极为罕见。这个空白被补上,意味着国产智算集群不必再在互联层完全依赖国外方案,从芯片、网卡、交换机到通信框架(scaleFabric 已完成 DeepEP 等框架适配)可以形成相对完整的自主链路。对政企、金融、能源等对供应链安全有硬性要求的行业客户,这条链路的存在本身就是采购前提。
不过也要避免过度乐观。中科曙光自己承认开放架构是刻意选择——希望 scaleFabric 与更多国产厂商产品适配,在 RoCE 和 NVIDIA InfiniBand 之外提供第三种选择。这句话背后透露的信息是:国产算力生态目前仍高度碎片化,各家芯片、网卡、框架之间的适配工作量巨大,一个厂商的网络产品能不能被整个生态接受,取决于它愿不愿意放弃绑定、做真正的开放标准。同时,性能与英伟达 NDR 持平是"持平"而不是"超越",考虑到对方下一代产品仍在迭代,这个身位需要持续投入才能守住。
对企服从业者的启示其实很朴素:在国产替代这条主线上,机会未必都在芯片本身。芯片是最难啃的骨头,但围绕着芯片的互联、存储、调度、框架适配、运维工具,同样存在大量"不解决就卡死整体效率"的关键环节。中科曙光选的是网络,其他厂商可以在存储加速、算力调度、模型压缩、集群运维上找类似的位置。判断标准也很清晰——这个环节是否位于数据流转的必经路径上,是否随着集群规模扩大而价值递增,是否能用可量化的指标证明收益。IBGDA 三条都符合,所以它能从一个技术名词变成一张有分量的订单。







评论
请评价真实、客观、有价值的内容请回复有价值的信息,无意义的评论将很快被删除,账号将被禁止发言。