返回快讯列表
开发者动态

NVIDIA 详解 CUDA Green Contexts,让关键推理任务保留专用计算资源

CUDA 13.1 的 Runtime API 可在单进程内划分执行资源,减少高吞吐任务对低延迟任务的干扰。

NVIDIA 发布 Green Contexts 的使用说明,介绍如何在同一进程中更明确地分配 GPU 执行资源。常见场景是模型推理、数据预处理或通信算子同时运行,其中一个小任务对延迟敏感,另一个任务却会持续占满显卡。只设置流优先级,仍可能需要等待正在执行的线程块结束。

Green Contexts 允许应用指定一组流式多处理器和工作队列,再把任务提交到对应资源。该能力此前已出现在驱动接口中,从 CUDA 13.1 起也能通过运行时接口访问,应用可以逐步接入,不需要一次重写全部执行路径。创建和销毁轻量上下文时,也不会隐式同步无关的 GPU 工作。

官方示例在一张 Blackwell 显卡上,把关键小算子的等待延迟从约零点一四毫秒降至零点零零七毫秒。这个结果来自特定并发实验,代价是后台大任务能够使用的计算单元减少。文章适合用来理解资源划分的取舍,不能把该单算子的延迟改善直接视为整套模型推理速度提高二十倍。

更多快讯