路由器而非GPU合并器:PAIR的实际工作原理
NVIDIA PAIR的核心机制近乎一种巧妙的障眼法:它通过接管Ollama和LM Studio默认监听的端口[1]来代理请求,因此任何指向localhost的智能体工具无需修改一行代码即可继续正常运行。在这个代理背后是一个调度器,在路由任务前会检查三项内容——配对节点是否在线并准备就绪、是否启用了受支持的推理引擎,以及所请求的精确模型是否已存在于该节点上[1]。
该调度器确实在执行实际工作:mDNS发现(一种设备在本地网络中自动相互定位的方式,无需手动配置IP地址)用于识别兼容设备,而mTLS加密(即双向TLS,通信双方均需出示证书以验证身份)则确保在任何推理流量传输前完成安全配对[2]。
PAIR刻意不做的事情同样重要:它既不合并GPU、也不池化显存或跨多台机器拆分单个推理请求[1]——这一点NVIDIA在其官方文档中已明确标注。这一区别正是技术用户最先关注的问题:这与那些将多台机器组合成单一虚拟加速器的工具是否不同?根据NVIDIA自身的描述,答案是肯定的——PAIR保持每个节点的工作负载独立,将完整任务交给空闲机器处理,而不是像模型分片框架那样将多台机器拼接成一个更大的GPU。

