NVIDIA 开源 Nemotron 3.5 Lightning:30B 参数只激活 3B,专为 Agent 高频任务打造,单卡就能跑
NVIDIA 今天发布了 Nemotron 3.5 Lightning,一个 300 亿参数的开源大语言模型。它的特别之处在于:虽然总参数量有 300 亿,但每次推理只激活 30 亿参数——这意味着它跑得快、吃得少,而且可以在一张消费级显卡上本地运行。
这个模型不是给"聊天机器人"用的,而是专门为 AI Agent 的高频、重复性任务设计的。
为什么这很重要?
现在的 AI Agent 系统越来越像一个"团队":一个大模型负责规划和决策,多个小模型负责执行具体任务——比如代码审查、安全告警监控、回答账单问题。Nemotron 3.5 Lightning 就是给这些"执行者"准备的。
NVIDIA 官方数据显示,它的输出速度是同类模型的 4 倍,Agent 任务整体完成速度快 30%。在 PinchBench 基准测试中,它在前沿级准确率和速度之间取得了很好的平衡。
核心技术特点
- MoE(混合专家)架构:30B 总参数,3B 活跃参数。每次推理只调用一小部分"专家",大幅降低计算量
- 1M token 上下文窗口:能处理超长文档和对话历史
- 原生支持工具调用和代码生成:适合 Agent 工作流中的工具调用、代码审查等任务
- 开源开放权重:可以自由下载、部署和定制
部署灵活,隐私可控
Nemotron 3.5 Lightning 可以在多种硬件上运行:
- NVIDIA RTX 消费级显卡(个人电脑)
- DGX Spark / DGX Station(工作站)
- NVIDIA Jetson(边缘设备)
- 数据中心和云环境
对于隐私敏感的场景(金融、医疗、法律),模型可以完全在本地运行,数据不出机器。
同步发布 NeMo Switchyard:让多个模型协同工作
和 Nemotron 3.5 Lightning 一起发布的还有 NeMo Switchyard,一个开源的模型路由库。
它的作用是:当你的 Agent 系统里有多个模型时,Switchyard 自动判断每个请求该交给哪个模型处理——简单的任务交给小模型省成本,复杂的任务交给大模型保质量。
NVIDIA 内部测试显示,使用 Switchyard 路由后,在保持前沿级准确率的同时,任务完成成本降到了单独使用 Opus 4.8 的约三分之一。合作方 Boomi 实测实现了 100% 的领域路由准确率,59% 的流量被路由到快 5 倍的微调模型上。
产业合作:已经在用了
多家企业已经在定制和使用 Nemotron 3.5 Lightning:
- CrowdStrike:网络安全场景
- Harvey + Trajectory:法律服务
- CodeRabbit + Baseten:代码审查
- Lila Sciences:科学推理
- Fastino Labs:金融和医疗
企业可以用 NVIDIA NeMo 框架,在自己的领域数据上对模型进行后训练,提升特定任务的准确率。
NVIDIA 还同步发布了 Nemotron-RL-Agentic-Terminal-Pivot 数据集,这是一个用于训练 Agent 编码能力的强化学习数据集。
对谁有用?
- 需要 always-on Agent 的企业:客服、安全监控、代码审查等高频场景,用小模型执行比大模型便宜得多
- 想在本地跑 Agent 的开发者:一张 RTX 卡就能跑,不需要云端 API
- 需要多模型路由降低成本的平台:Switchyard 让"大模型规划 + 小模型执行"的架构更容易落地
需要注意什么
- 3B 活跃参数意味着复杂推理任务可能不如大模型,它的定位是"系统中的专业执行者",不是"全能规划者"
- Agent 整体提速 30%(而非 4 倍),说明编排和协调层仍然是瓶颈,光靠模型快不够
- 开源权重已上线 Hugging Face,但实际部署还需要 TensorRT-LLM 等推理框架配合
---
来源:
- [NVIDIA 官方博客](https://blogs.nvidia.com/blog/nemotron-lightning-switchyard-rtx-dgx/)
- [NVIDIA 开发者技术博客](https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/)
- [CNBC 报道](https://www.cnbc.com/2026/08/11/nvidia-releases-nemotron-3.5-lightning-open-source-ai-model-.html)
参考来源
- https://blogs.nvidia.com/blog/nemotron-lightning-switchyard-rtx-dgx/
- https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/
- https://www.cnbc.com/2026/08/11/nvidia-releases-nemotron-3.5-lightning-open-source-ai-model-.html