公司A股

中科曙光发布scaleFabric Token加速技术体系,IBGDA支持GPU直连网络,已在十万卡级集群完成国内首次规模化验证

发布:更新:作者:

本文是 24TopNews 对公开财经信息完成重复合并后的事件分析,不是原始采访或证券推荐。

2026年9月,中科曙光发布scaleFabric Token加速技术体系。该体系以scaleFabric原生无损RDMA高速网络为核心,通过计算、存储与网络协同,减少数据传输和读取过程中的等待,提升大模型运行效率。其中,支持GPU直接发起网络通信的IBGDA技术已在十万卡级集群中完成验证,实现国内首次规模化落地。

Token是大模型处理和输出内容的基本单位,其生成效率直接影响模型响应速度与服务能力。分布式架构下,Token相关数据需要在不同GPU之间频繁传递,数据流转快慢会影响整个集群的计算效率。训练阶段,所有计算卡需要同步梯度数据,属于同步操作,一块卡速度稍慢,其他所有卡都要等待,异常时延会拉低模型计算利用率(MFU)。推理阶段分为输入预处理与逐字生成两个环节,中间会产生大量缓存数据需要在节点间搬运,用户感知到的首字等待时间、打字速度与数据传输速度相关。

“以存代算”成为行业优化方向,即把已经生成的中间缓存数据保存下来复用,以节省算力。存储环节因此加入数据流转链路,算力、网络、存储三者的协同效率影响整个AI系统上限。在大规模分布式训练中,网络通信耗时占比达到30%—50%,网络性能直接影响算力系统整体效率。MoE架构普及后,模型运行会产生大量高频并发的小消息通信,传统网络路径的CPU开销进一步放大,成为性能卡点。

国产算力卡在工艺制程、先进封装等方面与海外顶尖产品存在差距。IBGDA技术让GPU内核直接控制网卡发起通信,绕过传统路径中CPU的指令中转,降低小消息通信延迟。该技术适配MoE模型大量并发小消息的通信场景。经过多场景测试,结合全链路优化后,系统整体性能可提升20%至30%。

存储端协同方面,针对模型加载、缓存读写、检查点存储等不同场景,行业形成多层次的存储加速方案,让计算单元更直接地访问远端存储,减少中间的数据搬运环节。这些技术共同构成存算网协同的技术底座。中科曙光采用开放架构,scaleFabric网络与更多国产厂商的产品完成适配和优化,在RoCE和NVIDIA InfiniBand之外,提供国产原生无损RDMA网络方案。依托scaleFabric,中科曙光自研IBGDA技术已在十万卡级集群中完成验证。

受影响行业