Nvidia 发布 Nemotron 3.5 Lightning 混合架构模型
Nvidia Nemotron 3.5 Lightning
Nvidia 推出了最新的 Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型,这是一款专为高效推理和自主 Agent 设计的混合架构大语言模型。该模型采用 Mamba-2 与 MoE 及 Attention 层的混合结构,总参数量达 300 亿,但激活参数仅为 30 亿,支持高达 100 万 token 的上下文长度。它可在单张 DGX Spark (GB10) 或 H100 显卡上部署,并配合 DSpark 等推测解码技术显著提升生成速度。从代码生成到复杂推理任务,Nemotron 3.5 Lightning 旨在为开发者提供在本地硬件上运行高性能 AI 应用的解决方案,同时保持商业可用性。
NVIDIA Nemotron 是一个开放模型家族,提供开放权重、训练数据和配方,旨在为构建专用 AI Agent 提供领先的效率和准确性。
HN 评论区
30- NitpickLawyer
这个链接指向的是该模型的 nvfp4 版本,所以这张模型卡里只把它和 bf16 版本做了对比。如果你想看其他类似的模型对比,可以去 bf16 版本的模型卡里找 [1]。
虽然它在大多数基准测试中看起来比 Qwen 的对应模型“落后”,但这里有几点个人看法:
- 在我看来,Nemotron 模型感觉没那么“刷分”或“死板”。这意味着它们的泛化能力稍强一些,或者可以被要求解决与训练数据相似但不完全相同的任务类型(这对 Qwen/DS 模型来说很难做到)
- Nemotron 系列也是开放训练的(提供开放的训练配方和部分公开的训练数据)
- 即使其他方逐渐放弃开放发布模型,Nvidia 也有动力继续推出这类发布。无论第三方实验室有什么其他动机(比如 Meta、Google 的 Gemma,或是那些已上市的中国实验室等),Nvidia 总是要卖硬件的,所以他们推动开放模型的动机显而易见,而且很可能会“永远”持续下去。
[1] - https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-...
- simonw
看到 Qwen3.6 35b-a3b 表现如此出色真是令人惊讶,当然它大了约 20%,但在相同数量的活跃参数下(排除 IFBench),它的分数也高了约 20%。
希望 Qwen 在发布 3.8 版本后,能跟进推出新的 35b-a3b 版本。
- bearjaws
在我的 Mac 上运行很快——约 100 tokens/秒——但它有点“想太多”了。它在推理轨迹中草绘了四种不同的 SVG,最后才返回了一个(很烂的)骑着自行车的鹈鹕:https://tools.simonwillison.net/markdown-svg-renderer#url=ht...
我用了 LM Studio 和这个模型文件:https://lmstudio.ai/models/nvidia/nemotron-3.5-lightning
我用 simonw/llm-coding-agent 做了一个简单的代码代理活动,得到了相当不错(且速度合理)的结果:
llm code -m lmstudio/nvidia/nemotron-3.5-lightning \
'how does auth work?'
https://gist.github.com/simonw/a8741f79280cedc86bcb8d90edfb4... - 耗时不到一分钟。