NVIDIAのNemotron 3.5 Lightning、30Bパラメータで1Mトークンのコンテキストを実現
Nvidia Nemotron 3.5 Lightning
NVIDIAは、MoEハイブリッドアーキテクチャ(Mamba-2 + MoE + Attention)を採用した大規模言語モデル「NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4」を公開した。総パラメータ数は30B、アクティブパラメータは3Bで、最大1Mトークンのコンテキスト長をサポート。DGX SparkやH100などのシングルGPUでのデプロイが可能で、推論高速化のための投機的デコード手法(DSpark、DFlash、MTP)も提供される。日本語を含む多言語対応で、商用利用も可能。
このモデルは、MoEハイブリッドアーキテクチャを採用し、Mamba-2とMoEレイヤーを交互に配置し、一部にAttentionレイヤーを組み込んでいます。
HNでの議論
32- NitpickLawyer
これはnvfp4版のモデルへのリンクで、このモデルカードではbf16版との比較しかしていません。他の類似モデルとの比較をお探しなら、bf16版のモデルカードにあります[1]。
一見、ほとんどのベンチマークでQwen相当のモデルに「遅れている」ように見えますが、個人的なメモをいくつか:
- nemotronモデルは、私には少しベンチマーク最適化されすぎておらず、「頑固」ではないように感じます。つまり、もう少しうまく一般化できるか、トレーニングデータと完全には同一ではないが類似したタスクタイプを解くように指示できるということです(Qwen/DSモデルでは難しいこと)。
- nemotronシリーズはまた、オープントレーニング(オープンなトレーニングレシピと一部の公開トレーニングデータ付き)です。
- NVDAには、他の関係者がモデルのオープンリリースを徐々に放棄しても、この種のリリースを継続するインセンティブがあります。サードパーティの研究所(Meta、GemmaのGoogle、IPOした中国の研究所など)がどんな他のインセンティブを持っていようと、NVDAは常にハードウェアを売りたいので、オープンモデルを推進し続けるインセンティブは明白で、おそらく「永遠に」続くでしょう。
[1] - https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-...
- simonw
私のMacでは速く動作します - 毎秒約100トークン - しかし、少し考えすぎる傾向があります。推論トレースで4つの異なるSVGをスケッチしてから、(悪い)ペリカンが自転車に乗っているものを返しました:https://tools.simonwillison.net/markdown-svg-renderer#url=ht...
LM Studioとこのモデルファイルを使用しました:https://lmstudio.ai/models/nvidia/nemotron-3.5-lightning
この単純なコーディングエージェントアクティビティ(simonw/llm-coding-agentを使用)では、かなり堅実で(そしてかなり速い)結果が得られました:
llm code -m lmstudio/nvidia/nemotron-3.5-lightning \
'how does auth work?'
https://gist.github.com/simonw/a8741f79280cedc86bcb8d90edfb4... - 1分弱かかりました。
- bearjaws
Qwen3.6 35b-a3bがどれだけ健闘しているかを見るのは驚きです。確かに約20%大きいですが、同じアクティブパラメータ数(IFBenchを除く)でスコアも約20%高いです。
Qwenが3.8のローンチに続いて新しい35b-a3bを出すことを期待しています。
- gaodean
Mamba 2アーキテクチャでの開発は、非常に興味深い点です。「通常の」Transformerアーキテクチャに追いついてきているようです。
- kamranjon
これを見て、QwenやGemmaモデルとの性能に少しがっかりするかもしれません - しかし、これは完全にオープンソースのトレーニングパイプラインであり、これは非常に印象的で、ウェイトとともに完全にオープンソースのデータとレシピを持つ、これほど高性能なモデルは他にないと思います。