NVIDIA 在 9 月 3 日的 IFA 2026 公告里放出 NVIDIA PAIR,全称 Personal AI Router,免费开源,会在同一个家庭网络里找出兼容的电脑,把推理任务分摊过去。目前是 Windows、macOS 和 Linux 三端的 Beta,图形界面和终端都有,支持 GeForce RTX 20 系及更新、图灵及以后的 RTX PRO 工作站卡、DGX Spark,以及 M4 及更新的 Apple 芯片。NVIDIA 引用的依据是美国超过一半家庭拥有两台以上电脑。
推理侧给了两组数字。llama.cpp 靠内核优化、更好的推测解码和更快的预填充,在 GeForce RTX 5090 上吞吐最高提升到 1.9 倍。vLLM 在 RTX PRO 6000 Blackwell 工作站版上是 1.2 倍,在两台 DGX Spark 组成的集群上最高 1.4 倍,得益于 FlashInfer 里新的 XQA 注意力内核。这些优化可以直接用,也随 LM Studio 和 Ollama 分发。
本地智能体的安装门槛也在往下压。Perplexity Portable Computer、Nous Research 的 Hermes Agent 和 OpenClaw 都做了一键式的本地模型配置,底层都是带 NVIDIA 优化的 llama.cpp,其中两个要求 24GB 以上显存。
RTX Spark 的 Windows 新机型定在 10 月,规格是 1 petaflop 的 RTX Blackwell GPU、最高 128GB 统一内存、20 核 Grace CPU,联想给出 Yoga Pro 9n 和 Yoga 9n 2-in-1 两款,宏碁展示了一台小型台式概念机。整篇公告没有公布任何价格。