d-Matrix apila DRAM sobre lógica y promete 1000 tokens por segundo por usuario
D-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026

En Hot Chips 2026, d-Matrix presentó Raptor, un acelerador de inferencia que apila un die lógico de TSMC N4 sobre DRAM 3D mediante stacking face-to-face de 36 µm. La compañía sostiene que este diseño alcanza unos 100 TB/s con un costo energético de 0.37 pJ/bit, muy por debajo de HBM, y que una rack de 72 tarjetas de 32 GB puede servir un modelo de clase 3 billones de parámetros con 1M de contexto a ~1000 tokens por segundo por usuario. d-Matrix también detalló soluciones para sobrefetch, consumo de I/O y confiabilidad térmica a 105 °C.
Raptor’s result claims roughly 1,000 tokens per second per user, serving a 3-trillion-parameter class model with 1M context.