Nemotron 3.5 Lightning 深度研究
研究对象:nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B
文本版 · 供搜索与朗读
Nemotron 3.5 Lightning 深度研究
Nemotron 3.5 Lightning 深度研究
为「智能体打杂」而生的 30B-A3B 混合专家模型
研究对象:nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B
研究时间:2026-08-12 | 多源交叉核证(NVIDIA 官方 / HF 卡 / SGLang / 第三方评测)
目录
〇、费曼视角 · 一句话讲清
一、它到底是什么(含事实校正)
二、架构鸟瞰(技术深拆)
三、本地部署指南
四、横向对比:本地 Agent 模型诸强
五、NeMo Switchyard:比模型更大的故事
六、诚实的边界
七、你能拿它建什么
八、结论
附:资料来源
〇、费曼视角 · 一句话讲清
设想一家永远不打烊的餐厅后厨。主厨(前沿大模型)只定方案、解难题;可后厨八成活儿是切配、摆盘、传菜、核对出餐——这些「打杂」每一步都要过一遍模型。若每道配菜都请主厨,钱与延迟都会爆。
Nemotron 3.5 Lightning 就是那位任劳任怨的切配工:肚里 30B 总知识,每切一刀只动 3B(MoE 路由只点亮少数专家),又快又省。它不替你做战略,只把「调工具、验结果、跑子代理、重试失败」干得飞起。NVIDIA 自道:「前沿模型赢头条,Lightning 在战壕里挣勋章。」
一、它到底是什么(侦察结论 + 关键校正)
项内容
出品方NVIDIA(隶属 Nemotron 3 模型家族)
发布日2026-08-11(与开源路由库 NeMo Switchyard 同布)
定位智能体执行层(execution layer)专用:高频工具调用、结果校验、子代理派活、重试——非规划/推理主模型
参数30B 总参 / ~3B 活跃(家族实测 31.6B / 3.6B;MoE 编号 30B-A3B)
架构混合专家(Hybrid MoE):Mamba-2 状态空间层 + MoE 前馈层 + 选择性注意力层交错
上下文上限 1M token(理论信封);HF 注单 H100 实测约 256K;DGX Spark 上 Ollama 默认 262,144
检查点BF16(定制)+ NVFP4(部署)+ NVFP4-DSpark;社区 GGUF(bartowski / LM Studio)数小时到位
许可OpenMDW-1.1:权重、训练数据、recipes 全开放,允许商用、蒸馏、再分发
谱系自 Nemotron 3 Ultra(550B) 蒸馏;基模训练 20T+ token;针对主流 agent 框架 harness 定向训练
推理栈Ollama / llama.cpp / LM Studio / Unsloth / vLLM / SGLang / TRT-LLM;EXO Labs(DGX Spark)
托管build.nvidia.com(NIM)、OpenRouter(含 free 档)、Baseten、DeepInfra、Fireworks、FriendliAI、Together AI;ModelScope 镜像
⚠️ 关键事实校正(避免被原始 scene 文案误导)
原始 scene 说法核证结论
「与 Nemotron 联盟 共同开发」无字面意义「联盟」。真实:① 自 Nemotron 3 Ultra 蒸馏;② 与 agent harness 生态伙伴(Cline、OpenClaw、OpenCode、Hermes Agent、Kilo Code、LangChain、OpenHands 等)联合调训。属「生态共创」非「联盟」。
「采用混合专家架构」准确但笼统。实为 Hybrid MoE = Mamba-2 + MoE + Attention 三层交错(见 HF 卡),Mamba-2 专治长序列,是 1M 上下文的工程根基。
「1M 上下文」是可接受输入信封,非「百万 token 上仍能精准推理」。单卡实用约 256K;检索质量、处理时延、显存须按真实用长自测。
「比同类高 4 倍 吞吐」NVIDIA 自评,无独立复现;「up to 4x」含营销口径。应测「完成任务数 + 墙钟时间」,非仅看最快 token 计数。
ollama launch claude/openclaw/hermes/opencode确为公告集成语法;标准聊天入口仍是 ollama run nemotron-3.5-lightning。苹果芯专用 nemotron-3.5-lightning:30b-mlx。
二、架构鸟瞰(技术深拆)
2.1 为什么「30B 总参、3B 活跃」是精髓
MoE 之妙在路由(router):每个 token 只送少数专家子网络,其余静默待命。于是得「大模型容量 + 小模型开销」。Lightning 推到极致——30B 容量,每 token 仅 3B 算力。类比:藏书 30 万册的图书馆(容量),每次只请 3 位馆员出手(算力)。
2.2 混合架构:Mamba-2 + MoE + Attention 三明治
┌──────────────────────────────────────────────────┐
输入 token │ 逐层交错(Hybrid) │
│ │
│ [Mamba-2 状态空间层] ← 长序列高效、线性复杂度 │
│ [MoE 前馈层] ← 路由选专家,仅 3B 活跃 │
│ [选择性注意力层] ← 少量,管检索式上下文混合 │
│ (以上重复堆叠) │
│ │
│ 推测解码外接:MTP 头 / DSpark / DFlash 草稿模型 │
└──────────────────────────────────────────────────┘
输出 token(NVFP4 权重 ~15GB;BF16 ~60GB)
Mamba-2:状态空间模型(SSM),超长序列近线性复杂度,是 1M 上下文不崩的工程支点。
MoE:容量与算力解耦核心,3B 活跃即源于此。
Attention(少量):负责需「回头看」的检索式混合,不必每层都上注意力,省算力。
2.3 投机解码三件套:MTP / DSpark / DFlash
普通自回归一枚枚吐 token,慢。投机解码:先由草稿模型一次猜好几枚,主模型并行验章,验过即采纳。Lightning 给三把钥匙:
机制原理最佳场景
MTP(多 token 预测)训练阶段就「焊死」在模型里(pretrain + MTP-boosting),自带预测头草稿未来 token中高并发;并发越高,最优草稿长度越短
DSpark半自回归 + 并行扩散式混合草稿;NVIDIA 对 DGX Spark / 低并发数据中心 的推荐项DGX Spark、低并发;SGLang 称三者在 Spark 上它最佳
DFlash轻量扩散(diffusion)草稿模型,一次性提案一整块 token 并行验证通用推理;建议实测对比,未必总赢
进阶:SGLang Day-0 把 DSpark 草稿头量化到 W4A16,砍显存与单步延迟而不伤接受率——对 DGX Spark 显存紧巴设备关键。
2.4 NVFP4 量化:一份权重,三代入 GPU
NVFP4 检查点权重仅 ~15GB(BF16 约 60GB),复用 Nemotron 3 Ultra 专用内核,通吃 Blackwell / Hopper / Ampere——同一文件,数据中心与桌面 DGX Spark 皆可用。这是「本地跑大模型」从奢望变日常的钥匙。
2.5 推理可控:enable_thinking 与 thinking_budget
支持逐请求开关推理链:enable_thinking: false 直出答案(抽取/分类/结构化转换);enable_thinking: true + thinking_budget(如 512)限定推理深度。多模型系统里极有用:编排者给规划拨大预算,例行程式关掉推理。
三、本地部署指南
3.1 一条命令跑起来
# 标准聊天入口
ollama run nemotron-3.5-lightning
# 苹果芯片专用(MLX,统一内存)
ollama run nemotron-3.5-lightning:30b-mlx
# 一键拉起 harness 并指定本模型(NVIDIA 公告集成写法)
ollama launch claude --model nemotron-3.5-lightning
ollama launch openclaw --model nemotron-3.5-lightning
ollama launch hermes --model nemotron-3.5-lightning
ollama launch opencode --model nemotron-3.5-lightning
提示:ollama launch <harness> 为公告中的集成写法;若本地 Ollama 版本未带该子命令,先用 ollama run 起模型、再于 harness 内指向其 API 即可。
3.2 显存测算(关键!)
「3B 活跃」不等于只占 3B 稠密模型显存——所有专家都得存着,长上下文还吃 KV 缓存。
检查点权重体积加 KV 后估算可跑设备
BF16~60 GB60GB+多卡 H100 / A100;消费级免谈
NVFP4~15 GB~16–26 GB(视上下文)RTX 5090(32G) 宽裕;RTX 4090(24G) 配中等上下文;DGX Spark 实测 26GB 含 262K 上下文
GGUF Q4~18 GB~18–22 GB24G 卡(4090/5090)配中小上下文;Q2/Q3 可压进 16G
MLX (Apple)Q4 ~18G / Q8 ~30G吃统一内存M4 Max(36/48G)、M3 Ultra(80/128G)
社区实测:DGX Spark(GB10,128GB 统一内存)以 Ollama 加载,footprint 26GB、默认上下文 262,144,可行。
3.3 硬件梯度与预期
档位设备体验预期
旗舰桌面RTX 5090 (32G)NVFP4 全量 + 中等上下文,吞吐喜人
工作站RTX PRO / DGX Station / GB300数据中心级稳定长时运行
边缘/迷你DGX Spark、Jetson26GB footprint 跑 256K 上下文,agent 长期驻留理想
苹果M 系(MLX)统一内存友好,:30b-mlx 即开即用
云/数据中心H100/H200 ×N、各类供应商高并发 + MTP,逼近 4x 宣称
吞吐参考:Artificial Analysis 实测输出 ~670 tok/s;NVIDIA 宣称同类最高、准确-速度帕累托前沿。
3.4 最小可行配置建议
想试水:24G 显存卡(RTX 4090)+ GGUF Q4 + 32K 上下文,先跑工具调用 demo。
认真本地 agent:RTX 5090(32G) 或 DGX Spark + NVFP4 + 128–256K 上下文。
长期常驻助理:DGX Spark / RTX PRO 工作站,配合 NeMo Switchyard 做本地+云端分层。
四、横向对比:本地 Agent 模型诸强
模型总/活跃参数上下文定位许可本地友好度
Nemotron 3.5 Lightning30B / 3B1M(实~256K)Agent 执行层OpenMDW-1.1★★★★★(NVFP4 15G)
gpt-oss-120b(OpenAI)120B / 5.1B128K通用/agentApache 2.0★★★(MXFP4,需大显存)
Qwen3-235B-A22B235B / 22B128K(可更长)通用旗舰 MoEApache 2.0★★★
Llama 4 Maverick400B / 17B1M通用 MoELlama 3.1 Comm★★
Llama 4 Scout109B / 17B10M超长上下文 MoELlama 3.1 Comm★★
DeepSeek V3 / R1671B / 37B128K通用/推理MIT★(多卡)
Gemma 3 (27B)27B 稠密128K通用稠密Gemma T&C★★★★(27B 稠密)
说明:NVIDIA 官方对标对象是 Qwen3.6 35B(同类、相近精度下 Lightning 快 30%);上表取公开规格做相对定位,焦点不在绝对排名。
4.1 长板
执行层专精:PinchBench 86%(BF16 85.37 / NVFP4 83.43),万任务比 Qwen3.6 35B 快 30% 且精度相近;近乎追平 gpt-oss-120b 精度却只用约 1/4 算力。
真·本地:NVFP4 15GB 让单张消费卡跑 30B 级 MoE 成日常。
开放彻底:权重+数据+recipes+RL 数据集全给,商用/蒸馏/再分发自由。
harness 就绪:出厂对齐主流 agent 框架,工具调用首格式即对。
4.2 短板(诚实说)
不宜当主 agent:Terminal-Bench 2.1 仅 ~24.6,作主编程/主推理偏弱——角色是执行者非规划者。
基准自评:4x、86% 均 NVIDIA 自测;独立复现待补。
长上下文有水分:1M 是信封;单卡实用约 256K,超长检索质量须自测。
生态年轻:OpenMDW-1.1 虽宽松,但第三方工具链成熟度待观察。
4.3 一图定夺:何时选它
任务需要「深度推理 / 复杂规划」?
├─ 是 → 上前沿模型(Nemotron 3 Ultra / Opus / DeepSeek R1),用 Switchyard 路由
└─ 否 → 是否「高频执行:调工具 / 验结果 / 跑子代理 / 重试」?
├─ 是 → ★ Nemotron 3.5 Lightning(本地 NVFP4 最佳)
└─ 否 → 通用对话/创作 → Qwen3 / Gemma 3 / gpt-oss 视许可与硬件取舍
五、NeMo Switchyard:比模型更大的故事
Lightning 是「执行层」答案;NeMo Switchyard 是把答案接进生产系统的血管。开源模型路由库(github.com/NVIDIA-NeMo/Switchyard),把 agent 工作流每一步动态分派给最合适模型——前沿模型啃硬规划,Lightning 啃高频执行。
格式互通:在 OpenAI Chat / Responses / Anthropic Messages 间翻译,既有 coding agent 可保原客户端。
升级式(escalation)策略:任务起手走便宜模型,小裁判审视质量,不行再升级。
成本实证:
Switchyard 整体路由:维持前沿级完成度,成本压至单独 Opus 4.8 的约 1/3。
LangChain:145 个多轮 DeepAgents 任务,仅 7% 调用量路由至前沿模型,成本降 74%。
Ramp:内部 SWE-Bench 匹配前沿性能,成本降 58%、运行时间降 33%。
CrowdStrike / Harvey / Trajectory / CodeRabbit 已就安全、法律、代码审查微调。
洞见:模型路由喊了两年,NVIDIA 把它作为官方支持库随模型发布——等于把「多模型系统」从优化谈资变成默认假设。这比单发一个快模型更具战略分量。
六、诚实的边界(评测与提醒)
基准出自 NVIDIA 测 NVIDIA 模型。PinchBench 86%、4x 均无独立复现;作「入短名单」依据,非「上生产」依据。
Terminal-Bench 弱 → 明确当 executor 用,别委以主 agent 重任。
1M 是信封非能力;超长检索、处理时延、显存行为按真实用长自测。
「3B 活跃」≠ 3B 显存;全专家须常驻,长上下文另吃 KV。
量化偶超 BF16(NVFP4 83.43 vs BF16 85.37 偶有倒挂)属采样/harness 方差,非量化偷偷变强。
七、你能拿它建什么(呼应原始 scene,附诚实框架)
场景(scene 所述)可行性判断
长期个人助理(邮件/日历/项目/预订)✅ 本地跑 = 数据不出机,契合隐私;但规划层建议配前沿模型 via Switchyard
编写子代理代码(跑测试/搜代码库/重构)✅ 执行层强项;Terminal-Bench 偏弱,故「跑测试/应用补丁」佳,「自主设计架构」弱
安全运营(完善告警/分类/查日志/关联指标)✅ 高频执行典范;CrowdStrike 已就安全流微调验证
本地层 + 云端层并行✅ 同 CLI/API,Switchyard 分层,正合此意
自行训练专家(开放权重+数据集后训练)✅ OpenMDW-1.1 + NeMo recipes + Unsloth 当天量化,本地微调门槛低
八、结论
Nemotron 3.5 Lightning 不是又一个「更小的前沿模型」,而是把 agent 工作流里最烧 token 的苦活单独产品化:30B 容量、3B 算力、NVFP4 15GB 即可本地常驻、出厂对齐 agent 框架、开放到底可微调。
它的最佳拍档不是单独使用,而是与前沿模型组成「系统」——前者规划、它来执行,由 NeMo Switchyard 动态分派。
对「本地优先、数据不出机、长期常驻助理」的诉求,它是目前开放模型里本地友好度最高的执行层选手。但若指望它独挑大梁做主 agent,请收起期待——它生来就是战壕里的勋章得主,不是头条里的主厨。
附:资料来源
• NVIDIA 官方技术博客(developer.nvidia.com,2026-08-11):架构、推测解码、PinchBench 86%、NeMo Switchyard
• NVIDIA Local AI 博客(blogs.nvidia.com,2026-08-11):发布通告、硬件矩阵、生态伙伴
• Hugging Face 模型卡 nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-{BF16,NVFP4}
• SGLang Day-0 支持博文(lmsys.org,2026-08-11):MTP/DSpark/DFlash 实现、reasoning 控制
• LLM Stats 研究(llm-stats.com,2026-08-11):参数/上下文/基准汇总(含 caveat)
• AGI Hunt、IT之家、钛媒体/网易号(2026-08-11~12):中文二手核实与生态报道
• NxCode、Dev.to、AlphaSignal(2026-08):独立分析与成本实证(LangChain/Ramp 案例)
智柴 · 深度研究系列 | 生成于 2026-08-12 | 多源交叉核证,数据以官方与实测为准