跳到主要内容

不靠英伟达网卡:国产 GPU 直通方案让吞吐翻倍延迟减半

在 2026 年 7 月 17 日至 20 日的世界人工智能大会(WAIC 2026)上,一条看似不起眼的技术 Demo 引发了国产算力圈的广泛关注:奇异摩尔与壁仞科技联合展出的 IBGDA 方案,首次实现了国产 GPU 对国产 RDMA 网卡的直通通信,实测吞吐量接近翻倍、All-to-All 通信延迟大幅减半。

这不仅是两项国产硬件的技术握手,更是一次对国产算力集群"系统级短板"的精准手术。

国产算力的真实困境:强在单点,弱在系统

当前国产算力面临的核心困境,并非单芯片性能的落后。近年来,壁仞、摩尔线程、天数智芯等厂商的 GPU 芯片性能持续突破,单卡算力已逐渐逼近国际主流水平。然而,当这些芯片被组装成大规模训练和推理集群时,"单点强、系统弱"的结构性失衡便暴露无遗。

问题的症结在于互联。在大模型训练尤其是 MoE(混合专家)架构的推理场景中,节点间通信成为决定系统整体性能的关键瓶颈。MoE 模型的专家并行通信包含 Dispatch 和 Combine 两个核心阶段,每个阶段都涉及海量的小粒度数据交换。传统的跨节点通信路径是 GPU → CPU → 网卡,CPU 作为中间人转发指令,不仅引入额外延迟,还消耗大量 CPU 资源。

英伟达早已洞悉这一瓶颈,通过其 GPU 与 ConnectX 系列网卡的深度协同,率先实现了 IBGDA(InfiniBand Gather Direct Accelerate)方案——让 GPU 直接向网卡发起通信,完全绕过 CPU。这套方案已成为英伟达 AI 集群的标配能力。

然而在国产替代的赛道上,国产 GPU 对 IBGDA 的支持长期停留在与英伟达网卡的适配层面,国产 GPU 直通国产 RDMA 网卡的规模化落地案例几乎空白。这一短板直接制约了国产算力集群的通信效率,成为全栈自主可控链条上最脆弱的一环。

IBGDA 方案:让 GPU 和网卡"直接对话"

奇异摩尔此次推出的 IBGDA 解决方案,核心是基于其 Kiwi SNIC 800G 平台架构设计的单通道 400G RDMA ASIC 引擎。该引擎已完成软硬件协同开发,兼容专为 MoE 模型优化的集合通信库(对等 DeepEP),并原生支持 IBGDA 机制——即 GPU 可直接发起通信请求,不经过 CPU 中转。

在 WAIC 现场演示中,奇异摩尔携手壁仞科技搭建的测试平台对标英伟达 IBGDA 测试标准。实测数据给出了令人振奋的结果:

  • 吞吐量质的跨越:在 MoE 推理典型的小包、高频、强同步场景下,单次小消息带宽显著跃升,原始小包发送及合并发送的吞吐量均实现接近翻倍的提升;
  • 延迟大幅压降:All-to-All 通信延迟缩短近 50%;
  • 小包惩罚被彻底消除:传统方案中小消息时延远超大消息的"小包惩罚"现象不再出现。

这意味着在国产 GPU + 国产网卡的全链路中,通信不再是算力释放的绊脚石。尤其值得注意的是,该方案完全基于开放的以太网生态构建,既继承了以太网部署灵活、成本可控的优势,又为国产算力集群提供了一条兼具高性能与自主性的 Scale-Out 网络路径。

从技术突破到生态共建

IBGDA Demo 的公布只是一个缩影。在奇异摩尔主办的"AI 网络前沿生态论坛"上,两项更有深远意义的行动同步落地。

其一,《共封装光学(CPO)技术白皮书》正式发布。该白皮书由香港科技大学(广州)发起,奇异摩尔携手壁仞科技、图灵量子、奇点光子等单位共同编写,系统梳理了从可插拔光模块到 NPO、CPO、OIO(光内生)的技术演进路径,为国内光互连技术的标准化与产业化提供了权威指引。

其二,国产超节点生态共建倡议行动正式启动。在上海市经信委见证下,上海市算力网络协会、上海人工智能实验室、中国信通院华东分院联合中兴通讯、壁仞科技、沐曦、天数智芯、燧原科技、商汤科技、曙光信息、奇异摩尔等产业链核心企业,共同发起该倡议。这标志着国产算力产业正从"各自为战"走向"标准共建"。

互联,不再是配角

在 Scaling Law、Test-time Scaling 和 Agent 应用三重指数级需求同时驱动的当下,单芯片算力提升已无法独自承接产业需求。决定格局的关键变量,正越来越多地落在互联、整机、软件和系统协同上。

奇异摩尔此次的 IBGDA 方案,不仅以实测数据证明国产算力生态已具备底层互通、系统级协同优化的实战能力,更揭示了一条国产 AI 基础设施的可行路径:以开放的互联标准打破技术孤岛,以全栈协同释放单点算力,以生态共建替代单打独斗。

当互联从"配角"升级为决定系统效能的"核心命脉",国产算力的下一程,或许才刚刚开始。