将推理一分为二:为何代理式 AI 需要 GPU 加 LPU 架构
NVIDIA 在 Vera Rubin 上的核心赌注是,代理式 AI 并非仅仅是聊天机器人推理的更大版本——它是一种结构上完全不同的工作负载[1]。聊天模型只需一次性回答提示;而代理则需要观察、推理、规划、调用工具、管理庞大的上下文,并按需生成子代理,这些操作花费在编排上的时间远超下一个词元的预测[5]。NVIDIA 的应对策略是不再让单个芯片承担所有任务。Rubin GPU 负责原始吞吐量和长上下文处理,新的 Groq 3 LPX 负责低延迟解码以支持交互式会话,而 Vera CPU——配备 88 个 NVIDIA Olympus 核心,内存带宽高达 1.2TB/s——则承担代理在模型调用之间产生的代码执行、数据处理和任务协调任务[4]。在一项包含 10 万个词元的代理式基准测试中,Groq 3 LPX 实现了每秒 3,400 个输出词元的速度,约为最接近替代方案的四倍[3]。这个七芯片平台将 GPU、LPU、CPU 和网络芯片整合在一起,形成 NVIDIA 所称的单一 AI 工厂引擎[2]。这一架构的赌注在于,代理式工作负载更青睐此类专业化设计,而非简单地增加更多 GPU。



