Nvidia 发布 Nemotron 3.5 Lightning 混合架构模型

Nvidia Nemotron 3.5 Lightning

Nvidia 发布 Nemotron 3.5 Lightning 混合架构模型

Nvidia 推出了最新的 Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型,这是一款专为高效推理和自主 Agent 设计的混合架构大语言模型。该模型采用 Mamba-2 与 MoE 及 Attention 层的混合结构,总参数量达 300 亿,但激活参数仅为 30 亿,支持高达 100 万 token 的上下文长度。它可在单张 DGX Spark (GB10) 或 H100 显卡上部署,并配合 DSpark 等推测解码技术显著提升生成速度。从代码生成到复杂推理任务,Nemotron 3.5 Lightning 旨在为开发者提供在本地硬件上运行高性能 AI 应用的解决方案,同时保持商业可用性。

NVIDIA Nemotron 是一个开放模型家族,提供开放权重、训练数据和配方,旨在为构建专用 AI Agent 提供领先的效率和准确性。
  1. NitpickLawyer

    这个链接指向的是该模型的 nvfp4 版本,所以这张模型卡里只把它和 bf16 版本做了对比。如果你想看其他类似的模型对比,可以去 bf16 版本的模型卡里找 [1]。

    虽然它在大多数基准测试中看起来比 Qwen 的对应模型“落后”,但这里有几点个人看法:

    - 在我看来,Nemotron 模型感觉没那么“刷分”或“死板”。这意味着它们的泛化能力稍强一些,或者可以被要求解决与训练数据相似但不完全相同的任务类型(这对 Qwen/DS 模型来说很难做到)

    - Nemotron 系列也是开放训练的(提供开放的训练配方和部分公开的训练数据)

    - 即使其他方逐渐放弃开放发布模型,Nvidia 也有动力继续推出这类发布。无论第三方实验室有什么其他动机(比如 Meta、Google 的 Gemma,或是那些已上市的中国实验室等),Nvidia 总是要卖硬件的,所以他们推动开放模型的动机显而易见,而且很可能会“永远”持续下去。

    [1] - https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-...

  2. simonw

    看到 Qwen3.6 35b-a3b 表现如此出色真是令人惊讶,当然它大了约 20%,但在相同数量的活跃参数下(排除 IFBench),它的分数也高了约 20%。

    希望 Qwen 在发布 3.8 版本后,能跟进推出新的 35b-a3b 版本。

  3. bearjaws

    在我的 Mac 上运行很快——约 100 tokens/秒——但它有点“想太多”了。它在推理轨迹中草绘了四种不同的 SVG,最后才返回了一个(很烂的)骑着自行车的鹈鹕:https://tools.simonwillison.net/markdown-svg-renderer#url=ht...

    我用了 LM Studio 和这个模型文件:https://lmstudio.ai/models/nvidia/nemotron-3.5-lightning

    我用 simonw/llm-coding-agent 做了一个简单的代码代理活动,得到了相当不错(且速度合理)的结果:

    llm code -m lmstudio/nvidia/nemotron-3.5-lightning \

    'how does auth work?'

    https://gist.github.com/simonw/a8741f79280cedc86bcb8d90edfb4... - 耗时不到一分钟。

同日更多故事

2026-08-11