小模型,大胜出:Nemotron后训练的经济学
英伟达与Palantir的新主权AI堆栈以Nemotron 3.5 Lightning为核心,这是一个拥有300亿参数的混合专家模型,每次推理仅激活约30亿参数。其引人注目的并非规模,而是训练数据:英伟达使用NeMo Anonymizer、Data Designer和AutoModel,在受控的Palantir Autopilot生命周期内,基于自身记录的分配决策、理由和结果对模型进行后训练[1]。在英伟达内部的分配决策基准测试中,该后训练模型准确率达到86.7%,比未经调优但规模更大的Nemotron 3 Ultra高出31.2个百分点,比其自身基础权重高出69.2个百分点[1]。在Palantir的AIPCon 11大会上,英伟达进一步表示,最小的Nemotron模型在预测准确性上比其最大的模型高出10到20倍,成本比前沿模型低95%,并且可在单个GPU上几小时内完成重新训练[2]。这一启示与其说是关于规模,不如说是关于对隐性人类判断的编码:该模型在抽象意义上并不更聪明,而是吸收了规划人员多年来的分配决策,而这些是更大、更通用的模型从未见过的。


