Nvidia Nemotron 3.5 Lightning: 30B-Modell läuft auf einer einzelnen GPU

Nvidia Nemotron 3.5 Lightning: 30B-Modell läuft auf einer einzelnen GPU

Nvidia hat Nemotron 3.5 Lightning veröffentlicht, ein hybrides Mixture-of-Experts-Modell mit 30B Parametern (3B aktiv), das für effiziente Inferenz auf einer einzelnen GPU (z.B. DGX Spark oder H100) optimiert ist. Es unterstützt bis zu 1M Token Kontext und nutzt spekulative Dekodierung (DSpark, DFlash, MTP) für schnellere Textgenerierung. Das Modell wurde mit über 20T Token vortrainiert und in mehreren Stufen (Pre-Training, MTP, SFT, RL, PTQ) optimiert. Es ist für autonome Agenten, Chatbots und RAG-Systeme gedacht und unterstützt neben Englisch auch Spanisch, Französisch, Deutsch, Italienisch und Japanisch.

Das Modell unterstützt bis zu 1M Token Kontext und kann auf einer einzelnen GPU wie der DGX Spark (GB10) oder einer H100 ausgeführt werden.

Mehr von diesem Tag

2026-08-11