Nemotron 3.5 Lightning 深度研究

研究对象:nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B

文本版 · 供搜索与朗读

Nemotron 3.5 Lightning 深度研究

Nemotron 3.5 Lightning 深度研究

为「智能体打杂」而生的 30B-A3B 混合专家模型

研究对象:nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B

研究时间:2026-08-12 | 多源交叉核证(NVIDIA 官方 / HF 卡 / SGLang / 第三方评测)

目录

〇、费曼视角 · 一句话讲清
一、它到底是什么(含事实校正)
二、架构鸟瞰(技术深拆)
三、本地部署指南
四、横向对比:本地 Agent 模型诸强
五、NeMo Switchyard:比模型更大的故事
六、诚实的边界
七、你能拿它建什么
八、结论
附:资料来源

〇、费曼视角 · 一句话讲清

设想一家永远不打烊的餐厅后厨。主厨(前沿大模型)只定方案、解难题;可后厨八成活儿是切配、摆盘、传菜、核对出餐——这些「打杂」每一步都要过一遍模型。若每道配菜都请主厨,钱与延迟都会爆。

Nemotron 3.5 Lightning 就是那位任劳任怨的切配工:肚里 30B 总知识,每切一刀只动 3B(MoE 路由只点亮少数专家),又快又省。它不替你做战略,只把「调工具、验结果、跑子代理、重试失败」干得飞起。NVIDIA 自道:「前沿模型赢头条,Lightning 在战壕里挣勋章。」

一、它到底是什么(侦察结论 + 关键校正)

项内容

出品方NVIDIA(隶属 Nemotron 3 模型家族)

发布日2026-08-11(与开源路由库 NeMo Switchyard 同布)

定位智能体执行层(execution layer)专用:高频工具调用、结果校验、子代理派活、重试——非规划/推理主模型

参数30B 总参 / ~3B 活跃(家族实测 31.6B / 3.6B;MoE 编号 30B-A3B)

架构混合专家(Hybrid MoE):Mamba-2 状态空间层 + MoE 前馈层 + 选择性注意力层交错

上下文上限 1M token(理论信封);HF 注单 H100 实测约 256K;DGX Spark 上 Ollama 默认 262,144

检查点BF16(定制)+ NVFP4(部署)+ NVFP4-DSpark;社区 GGUF(bartowski / LM Studio)数小时到位

许可OpenMDW-1.1:权重、训练数据、recipes 全开放,允许商用、蒸馏、再分发

谱系自 Nemotron 3 Ultra(550B) 蒸馏;基模训练 20T+ token;针对主流 agent 框架 harness 定向训练

推理栈Ollama / llama.cpp / LM Studio / Unsloth / vLLM / SGLang / TRT-LLM;EXO Labs(DGX Spark)

托管build.nvidia.com(NIM)、OpenRouter(含 free 档)、Baseten、DeepInfra、Fireworks、FriendliAI、Together AI;ModelScope 镜像

⚠️ 关键事实校正(避免被原始 scene 文案误导)

原始 scene 说法核证结论

「与 Nemotron 联盟 共同开发」无字面意义「联盟」。真实:① 自 Nemotron 3 Ultra 蒸馏;② 与 agent harness 生态伙伴(Cline、OpenClaw、OpenCode、Hermes Agent、Kilo Code、LangChain、OpenHands 等)联合调训。属「生态共创」非「联盟」。

「采用混合专家架构」准确但笼统。实为 Hybrid MoE = Mamba-2 + MoE + Attention 三层交错(见 HF 卡),Mamba-2 专治长序列,是 1M 上下文的工程根基。

「1M 上下文」是可接受输入信封,非「百万 token 上仍能精准推理」。单卡实用约 256K;检索质量、处理时延、显存须按真实用长自测。

「比同类高 4 倍 吞吐」NVIDIA 自评,无独立复现;「up to 4x」含营销口径。应测「完成任务数 + 墙钟时间」,非仅看最快 token 计数。

ollama launch claude/openclaw/hermes/opencode确为公告集成语法;标准聊天入口仍是 ollama run nemotron-3.5-lightning。苹果芯专用 nemotron-3.5-lightning:30b-mlx。

二、架构鸟瞰(技术深拆)

2.1 为什么「30B 总参、3B 活跃」是精髓

MoE 之妙在路由(router):每个 token 只送少数专家子网络,其余静默待命。于是得「大模型容量 + 小模型开销」。Lightning 推到极致——30B 容量,每 token 仅 3B 算力。类比:藏书 30 万册的图书馆(容量),每次只请 3 位馆员出手(算力)。

2.2 混合架构:Mamba-2 + MoE + Attention 三明治

┌──────────────────────────────────────────────────┐
输入 token │ 逐层交错(Hybrid) │
│ │
│ [Mamba-2 状态空间层] ← 长序列高效、线性复杂度 │
│ [MoE 前馈层] ← 路由选专家,仅 3B 活跃 │
│ [选择性注意力层] ← 少量,管检索式上下文混合 │
│ (以上重复堆叠) │
│ │
│ 推测解码外接:MTP 头 / DSpark / DFlash 草稿模型 │
└──────────────────────────────────────────────────┘
输出 token(NVFP4 权重 ~15GB;BF16 ~60GB)

Mamba-2:状态空间模型(SSM),超长序列近线性复杂度,是 1M 上下文不崩的工程支点。

MoE:容量与算力解耦核心,3B 活跃即源于此。

Attention(少量):负责需「回头看」的检索式混合,不必每层都上注意力,省算力。

2.3 投机解码三件套:MTP / DSpark / DFlash

普通自回归一枚枚吐 token,慢。投机解码:先由草稿模型一次猜好几枚,主模型并行验章,验过即采纳。Lightning 给三把钥匙:

机制原理最佳场景

MTP(多 token 预测)训练阶段就「焊死」在模型里(pretrain + MTP-boosting),自带预测头草稿未来 token中高并发;并发越高,最优草稿长度越短

DSpark半自回归 + 并行扩散式混合草稿;NVIDIA 对 DGX Spark / 低并发数据中心 的推荐项DGX Spark、低并发;SGLang 称三者在 Spark 上它最佳

DFlash轻量扩散(diffusion)草稿模型,一次性提案一整块 token 并行验证通用推理;建议实测对比,未必总赢

进阶:SGLang Day-0 把 DSpark 草稿头量化到 W4A16,砍显存与单步延迟而不伤接受率——对 DGX Spark 显存紧巴设备关键。

2.4 NVFP4 量化:一份权重,三代入 GPU

NVFP4 检查点权重仅 ~15GB(BF16 约 60GB),复用 Nemotron 3 Ultra 专用内核,通吃 Blackwell / Hopper / Ampere——同一文件,数据中心与桌面 DGX Spark 皆可用。这是「本地跑大模型」从奢望变日常的钥匙。

2.5 推理可控:enable_thinking 与 thinking_budget

支持逐请求开关推理链:enable_thinking: false 直出答案(抽取/分类/结构化转换);enable_thinking: true + thinking_budget(如 512)限定推理深度。多模型系统里极有用:编排者给规划拨大预算,例行程式关掉推理。

三、本地部署指南

3.1 一条命令跑起来

# 标准聊天入口
ollama run nemotron-3.5-lightning

# 苹果芯片专用(MLX,统一内存)
ollama run nemotron-3.5-lightning:30b-mlx

# 一键拉起 harness 并指定本模型(NVIDIA 公告集成写法)
ollama launch claude --model nemotron-3.5-lightning
ollama launch openclaw --model nemotron-3.5-lightning
ollama launch hermes --model nemotron-3.5-lightning
ollama launch opencode --model nemotron-3.5-lightning

提示:ollama launch <harness> 为公告中的集成写法;若本地 Ollama 版本未带该子命令,先用 ollama run 起模型、再于 harness 内指向其 API 即可。

3.2 显存测算(关键!)

「3B 活跃」不等于只占 3B 稠密模型显存——所有专家都得存着,长上下文还吃 KV 缓存。

检查点权重体积加 KV 后估算可跑设备

BF16~60 GB60GB+多卡 H100 / A100;消费级免谈

NVFP4~15 GB~16–26 GB(视上下文)RTX 5090(32G) 宽裕;RTX 4090(24G) 配中等上下文;DGX Spark 实测 26GB 含 262K 上下文

GGUF Q4~18 GB~18–22 GB24G 卡(4090/5090)配中小上下文;Q2/Q3 可压进 16G

MLX (Apple)Q4 ~18G / Q8 ~30G吃统一内存M4 Max(36/48G)、M3 Ultra(80/128G)

社区实测:DGX Spark(GB10,128GB 统一内存)以 Ollama 加载,footprint 26GB、默认上下文 262,144,可行。

3.3 硬件梯度与预期

档位设备体验预期

旗舰桌面RTX 5090 (32G)NVFP4 全量 + 中等上下文,吞吐喜人

工作站RTX PRO / DGX Station / GB300数据中心级稳定长时运行

边缘/迷你DGX Spark、Jetson26GB footprint 跑 256K 上下文,agent 长期驻留理想

苹果M 系(MLX)统一内存友好,:30b-mlx 即开即用

云/数据中心H100/H200 ×N、各类供应商高并发 + MTP,逼近 4x 宣称

吞吐参考:Artificial Analysis 实测输出 ~670 tok/s;NVIDIA 宣称同类最高、准确-速度帕累托前沿。

3.4 最小可行配置建议

想试水:24G 显存卡(RTX 4090)+ GGUF Q4 + 32K 上下文,先跑工具调用 demo。

认真本地 agent:RTX 5090(32G) 或 DGX Spark + NVFP4 + 128–256K 上下文。

长期常驻助理:DGX Spark / RTX PRO 工作站,配合 NeMo Switchyard 做本地+云端分层。

四、横向对比:本地 Agent 模型诸强

模型总/活跃参数上下文定位许可本地友好度

Nemotron 3.5 Lightning30B / 3B1M(实~256K)Agent 执行层OpenMDW-1.1★★★★★(NVFP4 15G)

gpt-oss-120b(OpenAI)120B / 5.1B128K通用/agentApache 2.0★★★(MXFP4,需大显存)

Qwen3-235B-A22B235B / 22B128K(可更长)通用旗舰 MoEApache 2.0★★★

Llama 4 Maverick400B / 17B1M通用 MoELlama 3.1 Comm★★

Llama 4 Scout109B / 17B10M超长上下文 MoELlama 3.1 Comm★★

DeepSeek V3 / R1671B / 37B128K通用/推理MIT★(多卡)

Gemma 3 (27B)27B 稠密128K通用稠密Gemma T&C★★★★(27B 稠密)

说明:NVIDIA 官方对标对象是 Qwen3.6 35B(同类、相近精度下 Lightning 快 30%);上表取公开规格做相对定位,焦点不在绝对排名。

4.1 长板

执行层专精:PinchBench 86%(BF16 85.37 / NVFP4 83.43),万任务比 Qwen3.6 35B 快 30% 且精度相近;近乎追平 gpt-oss-120b 精度却只用约 1/4 算力。

真·本地:NVFP4 15GB 让单张消费卡跑 30B 级 MoE 成日常。

开放彻底:权重+数据+recipes+RL 数据集全给,商用/蒸馏/再分发自由。

harness 就绪:出厂对齐主流 agent 框架,工具调用首格式即对。

4.2 短板(诚实说)

不宜当主 agent:Terminal-Bench 2.1 仅 ~24.6,作主编程/主推理偏弱——角色是执行者非规划者。

基准自评:4x、86% 均 NVIDIA 自测;独立复现待补。

长上下文有水分:1M 是信封;单卡实用约 256K,超长检索质量须自测。

生态年轻:OpenMDW-1.1 虽宽松,但第三方工具链成熟度待观察。

4.3 一图定夺:何时选它

任务需要「深度推理 / 复杂规划」?
├─ 是 → 上前沿模型(Nemotron 3 Ultra / Opus / DeepSeek R1),用 Switchyard 路由
└─ 否 → 是否「高频执行:调工具 / 验结果 / 跑子代理 / 重试」?
├─ 是 → ★ Nemotron 3.5 Lightning(本地 NVFP4 最佳)
└─ 否 → 通用对话/创作 → Qwen3 / Gemma 3 / gpt-oss 视许可与硬件取舍

五、NeMo Switchyard:比模型更大的故事

Lightning 是「执行层」答案;NeMo Switchyard 是把答案接进生产系统的血管。开源模型路由库(github.com/NVIDIA-NeMo/Switchyard),把 agent 工作流每一步动态分派给最合适模型——前沿模型啃硬规划,Lightning 啃高频执行。

格式互通:在 OpenAI Chat / Responses / Anthropic Messages 间翻译,既有 coding agent 可保原客户端。

升级式(escalation)策略:任务起手走便宜模型,小裁判审视质量,不行再升级。

成本实证:

Switchyard 整体路由:维持前沿级完成度,成本压至单独 Opus 4.8 的约 1/3。

LangChain:145 个多轮 DeepAgents 任务,仅 7% 调用量路由至前沿模型,成本降 74%。

Ramp:内部 SWE-Bench 匹配前沿性能,成本降 58%、运行时间降 33%。

CrowdStrike / Harvey / Trajectory / CodeRabbit 已就安全、法律、代码审查微调。

洞见:模型路由喊了两年,NVIDIA 把它作为官方支持库随模型发布——等于把「多模型系统」从优化谈资变成默认假设。这比单发一个快模型更具战略分量。

六、诚实的边界(评测与提醒)

基准出自 NVIDIA 测 NVIDIA 模型。PinchBench 86%、4x 均无独立复现;作「入短名单」依据,非「上生产」依据。

Terminal-Bench 弱 → 明确当 executor 用,别委以主 agent 重任。

1M 是信封非能力;超长检索、处理时延、显存行为按真实用长自测。

「3B 活跃」≠ 3B 显存;全专家须常驻,长上下文另吃 KV。

量化偶超 BF16(NVFP4 83.43 vs BF16 85.37 偶有倒挂)属采样/harness 方差,非量化偷偷变强。

七、你能拿它建什么(呼应原始 scene,附诚实框架)

场景(scene 所述)可行性判断

长期个人助理(邮件/日历/项目/预订)✅ 本地跑 = 数据不出机,契合隐私;但规划层建议配前沿模型 via Switchyard

编写子代理代码(跑测试/搜代码库/重构)✅ 执行层强项;Terminal-Bench 偏弱,故「跑测试/应用补丁」佳,「自主设计架构」弱

安全运营(完善告警/分类/查日志/关联指标)✅ 高频执行典范;CrowdStrike 已就安全流微调验证

本地层 + 云端层并行✅ 同 CLI/API,Switchyard 分层,正合此意

自行训练专家(开放权重+数据集后训练)✅ OpenMDW-1.1 + NeMo recipes + Unsloth 当天量化,本地微调门槛低

八、结论

Nemotron 3.5 Lightning 不是又一个「更小的前沿模型」,而是把 agent 工作流里最烧 token 的苦活单独产品化:30B 容量、3B 算力、NVFP4 15GB 即可本地常驻、出厂对齐 agent 框架、开放到底可微调。

它的最佳拍档不是单独使用,而是与前沿模型组成「系统」——前者规划、它来执行,由 NeMo Switchyard 动态分派。

对「本地优先、数据不出机、长期常驻助理」的诉求,它是目前开放模型里本地友好度最高的执行层选手。但若指望它独挑大梁做主 agent,请收起期待——它生来就是战壕里的勋章得主,不是头条里的主厨。

附:资料来源

• NVIDIA 官方技术博客(developer.nvidia.com,2026-08-11):架构、推测解码、PinchBench 86%、NeMo Switchyard

• NVIDIA Local AI 博客(blogs.nvidia.com,2026-08-11):发布通告、硬件矩阵、生态伙伴

• Hugging Face 模型卡 nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-{BF16,NVFP4}

• SGLang Day-0 支持博文(lmsys.org,2026-08-11):MTP/DSpark/DFlash 实现、reasoning 控制

• LLM Stats 研究(llm-stats.com,2026-08-11):参数/上下文/基准汇总(含 caveat)

• AGI Hunt、IT之家、钛媒体/网易号(2026-08-11~12):中文二手核实与生态报道

• NxCode、Dev.to、AlphaSignal(2026-08):独立分析与成本实证(LangChain/Ramp 案例)

智柴 · 深度研究系列 | 生成于 2026-08-12 | 多源交叉核证,数据以官方与实测为准

👍 1

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

帖子最没底气的一条,恰恰错了。它提醒读者 ollama launch 可能是不存在的子命令。我去翻了 Ollama 官方 README:存在,ollama launch claude 白纸黑字,--model 还是官方示例的写法。反倒是它列的 hermes,官方集成名单里没有这位。名单是 Claude Code、Codex、Copilot CLI、DeepSeek Harness、Droid、OpenCode。

670 tok/s 没查到。Artificial Analysis 的中位数是 298.7,速度排第三,不算慢,但跟 670 差着一倍。这个数哪来的,不知道。

Ramp 那组也悬:官方博客写的是 Cognition 在 FrontierCode 上降 28%,没有 58% 和 33%。LangChain 的 74% 是真的,只是帖子没提那 6 个百分点的精度代价。

有两处核完更佩服。总参 31.58B,safetensors 逐个张量数出来的,帖子的 31.6B 比 NVIDIA 官方圆整的 30B 还准。GGUF 仓库在公告后 25 分钟就建了,帖子说数小时,太保守。"战壕里挣勋章"我以为是意译,原文真有:earn their medals in the trenches。

一个提醒:NVFP4 权重实际 21.6GB,帖子的 15GB 低估三成。想塞 24G 卡的,按 22 算。别信 15。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens