Hot Chips 2026: High Bandwidth Flash könnte die DRAM-Knappheit lindern
Hot Chips 2026: Applying High Bandwidth Flash (HBF)

High Bandwidth Flash (HBF) verspricht massive Kapazität direkt auf dem Prozessor-Package, ähnlich wie HBM, aber mit SSD-Technologie. Auf dem Hot Chips 2026 Tutorial zeigten Anurag Agarwal und Radhakrishna Giduthuri, wie HBF für Machine-Learning-Workloads eingesetzt werden könnte. Da es noch keine HBF-Produkte gibt, basiert die Analyse auf Simulationen und Projektionen. Die Software-Herausforderungen sind enorm: HBF erfordert blockweise Zugriffe und DMA-Transfers, ähnlich wie bei einem Blockgerät. Die Autoren diskutieren Strategien für vLLM, etwa das Auslagern von MoE-Experten oder KV-Cache in den Flash-Speicher, sowie die Reduzierung von Cross-Device-Kommunikation durch Replikation. Kostentechnisch lohnt sich HBF vor allem bei nicht bandbreitenlimitierten Workloads.
Ich würde so weit gehen zu sagen, dass der Aufwand, HBF zu nutzen, nicht weit von dem entfernt ist, was nötig wäre, um den DRAM-Verbrauch zu reduzieren, indem man Modellgewichte direkt von einer SSD streamt.
- rbanffy
Ich habe das Gefühl, dass Intel Octane ein paar Jahre zu früh abgeschafft hat.
- xnx
Ist das dieselbe Idee, die John Carmack hatte? (https://x.com/ID_AA_Carmack/status/2074248758422864226?lang=...)
"Speicherkosten und -kapazität sind bedeutende Probleme für KI-Beschleuniger.
Im Gegensatz zum Game-Rendering kann die Modellinferenz ein deterministisches Speicherzugriffsmuster haben. Man braucht für Modellgewichte überhaupt keinen 'Direktzugriffsspeicher', und man könnte Kaltstart-Latenzen im Bereich von mehreren Millisekunden tolerieren, solange kontinuierliche Lesezugriffe mit der erforderlichen Bandbreite geliefert würden.
NAND-Flash ist über 100-mal billiger pro GB als HBM, also sollte es dort eine Gelegenheit geben, selbst nachdem man einem Flash-Controller eine 1024-Bit-Schnittstelle mit HBM-Bandbreite gegeben hat.
Man könnte ein spezialisiertes Pin-Protokoll entwickeln, das nur den Pipeline-Transfer von vollständigen 16KB+-Seiten vom Flash zum programmgesteuerten Scratchpad-Speicher des Beschleunigers unterstützt und die Pro-Pin-Leistung gegenüber HBM verbessert, aber es könnte bequemer sein, es weiterhin wie einen echten Direktzugriffsspeicher mit sehr fragilen Leistungsmerkmalen aussehen zu lassen, bei dem alles außer sequenziellen Lesezugriffen von einer 1000-fachen+ Leistungsklippe fällt.
Das hat den Vorteil, dass automatisch bestehende Cache-Hierarchien genutzt werden und ein natürlicher Weg zur Aktualisierung des Flash-Speichers mit neuen Modellgewichten entsteht. Mit der Stream-to-Scratch-Schnittstelle muss der Code komplett neu geschrieben werden, bevor er überhaupt funktioniert, während die RAM-Emulationsschnittstelle zunächst nur extrem langsam startet und man die Änderungen für volle Leistung schrittweise aussortieren kann.
Es kann Fälle geben, in denen es nicht genügend Scratchp[...]"
- rando1234
Wie sind die Haltbarkeits-/Lebensdauereigenschaften dieser Technologie im Vergleich zu herkömmlichem DRAM?