NVIDIAのNemotron 3.5 Lightning、30Bパラメータで1Mトークンのコンテキストを実現
Nvidia Nemotron 3.5 Lightning
NVIDIAは、MoEハイブリッドアーキテクチャ(Mamba-2 + MoE + Attention)を採用した大規模言語モデル「NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4」を公開した。総パラメータ数は30B、アクティブパラメータは3Bで、最大1Mトークンのコンテキスト長をサポート。DGX SparkやH100などのシングルGPUでのデプロイが可能で、推論高速化のための投機的デコード手法(DSpark、DFlash、MTP)も提供される。日本語を含む多言語対応で、商用利用も可能。
このモデルは、MoEハイブリッドアーキテクチャを採用し、Mamba-2とMoEレイヤーを交互に配置し、一部にAttentionレイヤーを組み込んでいます。