4倍速度宣称在实践中仅实现30%的提升
NVIDIA 对 Nemotron 3.5 Lightning 的营销核心是速度:这款300亿参数的混合专家模型,每次生成仅激活30亿参数,输出速度比同类模型快4倍 [1]。这一数字背后是真实的架构创新——混合 Mamba-2、混合专家与注意力机制主干、预训练阶段集成的多 token 预测器,以及两个专用的推测解码(speculative-decoding)草案模型,一个针对数据中心 GPU 优化,另一个专为 NVIDIA 自家的 DGX Spark 硬件调校。但同一公告中隐藏着更真实的数字:代理任务完成速度仅比同类模型快30% [1],而非4倍。
独立科技媒体对这一差距的解释更为直白。相关报道指出,编排(orchestration)而非模型吞吐量,才是代理工作流的实际瓶颈,因为代理的大部分墙钟时间(wall-clock time)消耗在工具调用、重试和验证循环上,而非原始 token 生成 [2]。这种观点并非反驳 NVIDIA 的基准测试,而是纠正了‘4倍’标题对普通读者的误导性暗示:代理的底层模型速度提升4倍,并不意味着整个代理速度也提升4倍。



