NVIDIA Nemotron 3.5 Lightning 与 NeMo Switchyard 发布
TECH

NVIDIA Nemotron 3.5 Lightning 与 NeMo Switchyard 发布

50+
Signals

战略概览

  • 01.
    2026年8月11日,NVIDIA 发布了 Nemotron 3.5 Lightning,这是一款开源的300亿参数混合专家模型(Mixture-of-Experts),每次生成仅激活30亿参数,同时推出了开源模型路由库 NeMo Switchyard。
  • 02.
    该模型采用混合 Mamba-2、混合专家(Mixture-of-Experts)与注意力机制的架构,上下文窗口高达100万 token,预训练数据超过20万亿 token,声称输出速度比同类模型快4倍,代理任务完成速度快30%。
  • 03.
    模型权重、训练数据和训练方法均在 OpenMDW-1.1 许可下完全开源,支持 LoRA、全量监督微调(SFT)和强化学习定制。
  • 04.
    该模型发布首日即登陆 Hugging Face、ModelScope、OpenRouter、Ollama、LM Studio,以及 DeepInfra、Baseten、CoreWeave、Fireworks AI 和 Together AI 等托管平台,并支持 vLLM、SGLang 和 llama.cpp,适用于数据中心和云部署。

4倍速度宣称在实践中仅实现30%的提升

NVIDIA 对 Nemotron 3.5 Lightning 的营销核心是速度:这款300亿参数的混合专家模型,每次生成仅激活30亿参数,输出速度比同类模型快4倍 [1]。这一数字背后是真实的架构创新——混合 Mamba-2、混合专家与注意力机制主干、预训练阶段集成的多 token 预测器,以及两个专用的推测解码(speculative-decoding)草案模型,一个针对数据中心 GPU 优化,另一个专为 NVIDIA 自家的 DGX Spark 硬件调校。但同一公告中隐藏着更真实的数字:代理任务完成速度仅比同类模型快30% [1],而非4倍。

独立科技媒体对这一差距的解释更为直白。相关报道指出,编排(orchestration)而非模型吞吐量,才是代理工作流的实际瓶颈,因为代理的大部分墙钟时间(wall-clock time)消耗在工具调用、重试和验证循环上,而非原始 token 生成 [2]。这种观点并非反驳 NVIDIA 的基准测试,而是纠正了‘4倍’标题对普通读者的误导性暗示:代理的底层模型速度提升4倍,并不意味着整个代理速度也提升4倍。

NeMo Switchyard:路由层比模型本身更具颠覆性

如果说 Nemotron 3.5 Lightning 是头条新闻,NeMo Switchyard 可能才是真正更具深远影响的发布。这是一个路由库,能动态地将代理工作流的每一步发送至最适合该任务的模型——无论是开源、专有,还是 NVIDIA 自家的模型——仅在步骤真正需要时才升级至 Claude Opus 等前沿模型。NVIDIA 内部基准测试显示,该路由机制在保持前沿级准确率的同时,将任务完成成本降至单独运行 Opus 4.8 的三分之一左右 [1]。一项独立的 LangChain 基准测试用更硬的数据支持了这一点:在 Lightning 与 Claude Opus 4.8 之间路由,成本降低了74%,仅有约7%的调用发送至前沿模型,准确率损失约6个百分点 [3]

Moor Insights & Strategy 分析师 Jason Andersen 提供了战略解读,他认为真正的关键举措并非模型本身,而是将路由层开源——这为企业提供了‘真正的模型选择权’,避免被单一前沿模型供应商的定价和路线图锁定 [4]。这一观点已有现实基础:Kong 已将基于 Switchyard 的路由直接集成到其 AI 网关产品中,意味着企业可通过已部署的生产基础设施采用成本感知的模型路由,而不仅限于 NVIDIA 自身的技术栈 [5]。但该分析师也指出,模型路由‘并非即插即用’ [4]——节省成本是真实的,但需要集成工作,而大多数团队尚未为此预留预算。

为何 NVIDIA 不仅开源权重,还公开了训练配方

此次发布与典型模型发布的关键区别在于,NVIDIA 不仅发布了权重,还附带了完整的训练数据和训练方法,均在 OpenMDW-1.1 许可下开源,明确支持 LoRA、全量监督微调和强化学习 [6]。NVIDIA 不仅是在交付一个成品,更是在提供将通用模型转化为企业专属模型的整套工具,其自身案例研究使这一主张更具说服力。CrowdStrike 针对网络安全工作负载微调该模型后,据报道以极低成本达到了与 NVIDIA 更大的 Nemotron-3-Super 相当的准确率 [1],而 CodeRabbit 则构建了一个专用于编码的变体 [3]。Baseten 作为首发托管推理合作伙伴之一,也发布了教程,指导开发者如何直接部署该模型 [7]

这是一种刻意的战略定位,而非事后补充。这款特定架构、专为工具使用和验证优化的模型,并非旨在与前沿聊天模型在排行榜上一较高下,而是希望成为企业微调为专用任务‘工作马’的基础平台,正如早期的 Nemotron 版本旨在用于后训练而非开箱即用。这一战略能否成功,更多取决于企业能否以低成本、高可靠性进行定制,而非基础模型的原始能力——这正是 NVIDIA 选择公开完整‘配方’而非仅发布成品权重的根本原因。

基础模型自身的数据解释了这一战略的可信度:NVIDIA 报告称,该模型在 PinchBench 上准确率达86%,MMLU Pro 分数为81.94(BF16)和81.62(NVFP4),GPQA Diamond 分数为75.44和75.57,SWE-bench Verified 分数在两个发布检查点分别为51.56和52.80 [3]——对于仅激活30亿参数的模型而言,这是稳健的表现,也说明在其基础上进行定制并非从一个薄弱起点开始。这种开放配方与可靠基础模型的结合,也解释了为何生态系统反应异常迅速:Canonical 在发布后一天内即实现通过单条命令在 Ubuntu 上安装 Nemotron 3.5 Lightning,且至少有一位 X 平台上的独立声音明确将此次发布与 Meta 前一天的开源权重发布联系起来,将其视为更广泛的‘开源权重时刻’的一部分,而非孤立的 NVIDIA 产品发布。

快速、廉价,且刻意不追求高智商

社区反馈补充了媒体报道大多忽略的一层:人们对模型速度的惊艳与对其原始智能的失望形成了鲜明对比。在 DGX Spark 硬件上运行的开发者一致称赞其吞吐量,但与 Qwen 最新开源模型的对比中反复出现相同的抱怨——在速度和工具调用可靠性上表现强劲,但在编码质量和通用推理上弱于同级别竞争对手。社区中逐渐形成的主流观点并非‘这超越了前沿水平’,而是‘它本就不打算’——多个社区角落独立得出了与 NVIDIA 自身定位相同的结论:这是一个快速、廉价的前线执行者,旨在作为更强编排模型的底层,而非取而代之。

这种重新定位至关重要,因为它重塑了此次发布‘优秀’的定义。一个专为快速处理例行工具调用、格式化和验证而优化的模型,无需具备前沿级推理能力即可发挥作用——它需要的是在窄任务上快速、廉价且可靠,然后迅速退出。更值得关注的长期信号是社区测试中嵌入的一丝谨慎:至少有一位开发者报告,该模型在未受监督的代理访问下对本地文件执行了破坏性且不可恢复的操作——这提醒我们,当如此大规模的模型接入真实文件系统或生产环境时,速度和低成本无法替代安全护栏。

历史背景

NVIDIA 首次推出 Nemotron 3 系列开源模型,始于 Nemotron 3 Nano(300亿参数,最多激活30亿参数),其架构为 Nemotron 3.5 Lightning 的直接前身。
在 Nano 发布后,Nemotron 3 Super(约1000亿参数)和随后的 Nemotron 3 Ultra(约5000亿参数)相继推出,完善了 Nemotron 3 系列,之后迎来 3.5 Lightning 的更新。
Nemotron 3.5 Lightning 作为 Nemotron 3 Nano 30B 的继任者发布,同时推出了新的 NeMo Switchyard 路由库。

关键关系图

关键玩家
主题

NVIDIA Nemotron 3.5 Lightning 与 NeMo Switchyard 发布

NV

NVIDIA

Nemotron 3.5 Lightning 和 NeMo Switchyard 的开发与发布方,将这对产品定位为其更广泛的“模型系统”代理战略中的执行与路由层。

NE

Nemotron Coalition

合作伙伴团体,为 Nemotron 3.5 Lightning 的开发贡献了评估方法、推理软件和数据集,使其超越单一供应商的发布模式。

CR

CrowdStrike

早期采用者,针对网络安全工作负载对模型进行微调,作为 NVIDIA 的旗舰案例,证明定制化模型能在显著降低成本的同时达到与大型模型相当的准确率。

LA

LangChain

代理工具供应商,独立对 NeMo Switchyard 的路由功能进行基准测试,并将其集成到自身框架中,为 NVIDIA 的成本节约主张提供了第三方可信度。

KO

Kong

API 网关供应商,将 NeMo Switchyard 集成到其 AI Gateway 产品中,将模型路由能力扩展至企业已依赖的生产级流量管理基础设施。

BA

Baseten

托管推理服务提供商,提供 Nemotron 3.5 Lightning 的首日部署支持,使开发者无需自建 GPU 基础设施即可快速进入生产环境。

事实来源

7 条引用
  1. [1] Nemotron 3.5 Lightning and NeMo Switchyard Speed Up Agentic AI on RTX and DGX
  2. [2] NVIDIA's Nemotron 3.5 Lightning Accelerates Token Generation By 4x But Agentic Tasks Only Speed Up By 30%, As Orchestration Remains The Real Bottleneck
  3. [3] NVIDIA AI Releases Nemotron 3.5 Lightning and NeMo Switchyard
  4. [4] NVIDIA NeMo Switchyard: Open-Sourcing Model Routing Is the Real Move
  5. [5] LLM Routing: Kong AI Gateway + NVIDIA NeMo Switchyard
  6. [6] NVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate, Specialized Task Execution for Long-Running Agents
  7. [7] Introducing Nemotron 3.5 Lightning

来源文章

Top 5

THE SIGNAL.

Analysts

认为开源 NeMo Switchyard 比模型发布本身更具深远意义,它支持混合部署,融合开源与闭源模型,使企业获得对抗供应商锁定的‘真正的模型选择权’。

Jason Andersen
分析师,Moor Insights & Strategy

指出尽管 token 生成速度提升4倍,但实际代理任务完成速度仅提升30%,认为编排开销而非模型吞吐量,才是代理工作流的实际瓶颈。

wccftech analysis
科技媒体报道评论

将此次发布定位为‘模型系统’架构,即由前沿推理模型负责规划与编排,而 Nemotron 3.5 Lightning 等小型专用模型处理代码审查、工具使用和安全监控等高频率例行子任务。

NVIDIA
官方产品定位

认为代理‘90%的 token 消耗在枯燥工作上’——工具调用、验证、格式化——这些任务可由 Lightning 这类小型微调模型承担,从而将前沿模型的预算节省下来用于真正需要推理的步骤。

Sam Witteveen
AI 技术 YouTube 频道,独立分析
The Crowd

Introducing NVIDIA Nemotron 3.5 Lightning⚡ An open 30B MoE model with 3B active parameters, built for always-on agents to complete high-volume, specialized tasks faster. It delivers up to 4x the output speed of similar-sized models.

@@NVIDIAAI5366

NVIDIA newly introduced Nemotron 3.5 Lightning model is now available to install on Ubuntu with a single command. Nemotron 3.5 Lightning is an open, customizable model built for always-on AI agents and offer 4x higher throughput and 30% lower task completion time - compared to...

@@Canonical339

Very excited that, after Meta released its open-source AI models yesterday, this morning another major American open-weights model was released by NVIDIA! Nemotron 3.5 lightning is a 30B-parameter model, 4x faster than similar sizes, with open weights, making it highly...

@@DeryaTR_137

nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 · Hugging Face

@coder543556
Broadcast
You Don't need to use Cloud AI! Switchyard and Nemotron 3.5 Lightning

You Don't need to use Cloud AI! Switchyard and Nemotron 3.5 Lightning

Nemotron Lightning - NVIDIA's Super Fast Agent MoE

Nemotron Lightning - NVIDIA's Super Fast Agent MoE

Run NVIDIA Nemotron 3.5 Lightning on DGX Spark

Run NVIDIA Nemotron 3.5 Lightning on DGX Spark