d-Matrix stapelt DRAM direkt auf Logik – 20-mal mehr Bandbreite pro Quadratmillimeter

D-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026

d-Matrix stapelt DRAM direkt auf Logik – 20-mal mehr Bandbreite pro Quadratmillimeter

d-Matrix stellt auf den Hot Chips 2026 den Raptor-Accelerator vor, der 3D-DRAM direkt auf einen TSMC-N4-Logik-Die stapelt. Statt auf HBM setzt das Design auf eine vertikale Verbindung mit 0,3 bis 0,4 pJ pro Bit – etwa zehnmal weniger als HBM4. Eine 72-Karten-Scale-up-Einheit soll ein Frontier-Modell der 3-Billionen-Parameter-Klasse bei 1M Kontext mit rund 1.000 Tokens pro Sekunde und Nutzer bedienen. Die Präsentation zeigt, wie Bank-Mapping, I/O-Leistung und DRAM-Zuverlässigkeit bei 105 °C zusammenhängen.

Raptor’s result claims roughly 1,000 tokens per second per user, serving a 3-trillion-parameter class model with 1M context.

Mehr von diesem Tag

2026-09-14