PAIR 实际功能与 Nvidia ‘AI 集群’宣传之间的差异
Nvidia 自身的发布宣传大量使用了‘集群’和‘超级计算机’等术语,但其技术文档明确限定了 PAIR 的实际功能:PAIR 将每个独立请求完整地调度到单个节点,明确不合并 GPU 内存、不将多个 GPU 组合成更大的逻辑 GPU,也不将单个模型分片到多台设备上 [1]。实际上,它表现为一个位于现有本地推理引擎之上的调度层,根据节点就绪状态、目标模型是否已加载、当前工作负载以及其它应用占用 GPU 资源的情况,决定由网络中的哪一台设备处理请求 [2]。这一区别至关重要:数据中心意义上的‘集群’会合并内存,使超大模型可在多个 GPU 上运行;而 PAIR 仅为每项任务选择最合适的单台设备——更接近家庭网络的智能负载均衡器,而非多 GPU 模型分片技术。



