NVIDIAのNemotron 3.5 Lightning、30Bパラメータで1Mトークンのコンテキストを実現

Nvidia Nemotron 3.5 Lightning

NVIDIAのNemotron 3.5 Lightning、30Bパラメータで1Mトークンのコンテキストを実現

NVIDIAは、MoEハイブリッドアーキテクチャ(Mamba-2 + MoE + Attention)を採用した大規模言語モデル「NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4」を公開した。総パラメータ数は30B、アクティブパラメータは3Bで、最大1Mトークンのコンテキスト長をサポート。DGX SparkやH100などのシングルGPUでのデプロイが可能で、推論高速化のための投機的デコード手法(DSpark、DFlash、MTP)も提供される。日本語を含む多言語対応で、商用利用も可能。

このモデルは、MoEハイブリッドアーキテクチャを採用し、Mamba-2とMoEレイヤーを交互に配置し、一部にAttentionレイヤーを組み込んでいます。

同じ日のその他の記事

2026-08-11