NVIDIA 介绍 DOCA GPUNetIO 的新架构,让 CUDA 内核直接发起部分网络和数据传输操作,减少每次通信都经过 CPU 调度的开销。这个方向与分布式训练、推理中的多卡协作有关:模型算得快以后,数据搬运和通信等待往往会成为新的瓶颈。CPU 仍负责初始化等控制工作,变化主要发生在执行的数据路径。
过去不同通信库分别维护相近的设备侧网络实现,现在 GPUNetIO 被作为共同基础,供 NCCL、NVSHMEM 和 UCX/NIXL 等组件复用。完整 DOCA SDK 提供较广的网络能力,独立开源项目则以 RDMA Verbs 为主。开源版本检测到完整 SDK 后,还可以调用其中部分扩展功能,并非两个完全相同的发行包。
公告介绍了 NCCL 设备侧接口和 NVSHMEM 的接入方式,也提供代码与编程指南。对基础设施开发者,最直接的意义是减少重复维护底层队列和传输逻辑;普通应用则通常通过上层通信框架获得这些能力。是否改善现有服务,还取决于网络硬件、消息大小和工作负载,不能仅凭换用库名称推断吞吐变化。