双脑协同:Alpamayo 如何真正实现推理
Alpamayo 2 Super 并非单一网络,而是两个模型顺序协作。一个 320 亿参数的 Cosmos 3 Super Reasoner 视觉-语言主干网络接收来自最多七台摄像头的 360 度视频流并完成‘思考’——它生成因果链推理痕迹,标记高层级元动作(如让行、并道、因静止车辆向左轻移),并能回答关于场景的具象化问题[1]。该推理输出随后传递给一个独立的 20 亿参数基于扩散的 Action Expert 模块,将语言级决策转化为连续、可执行的行驶轨迹[1]。将‘为何’与‘如何移动’分离是其架构的核心:理论上,同一推理核心可与不同动作头结合,用于自动驾驶出租车、卡车、接驳车或配送车,且推理痕迹本身成为可读日志,说明车辆行为原因,而非不透明的向量。NVIDIA 展示的模型实时叙述驾驶决策的病毒式演示——‘因静止车辆向左轻移’‘在人行横道让行行人’——正是这种分离的直观体现,也是该流程生成可理解中间推理而非单一端到端黑箱的最明确证据。


