d-Matrix Raptor обещает 1000 токенов в секунду на пользователя для модели на 3 трлн параметров

D-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026

d-Matrix Raptor обещает 1000 токенов в секунду на пользователя для модели на 3 трлн параметров

На Hot Chips 2026 d-Matrix представила Raptor — ускоритель генеративного инференса, где логический кристалл TSMC N4 stacking-ом соединён с 3D-DRAM. По заявлениям компании, 72-карточная стойка вмещает frontier-модель уровня Kimi K3 с контекстом 1M, а сам чип выдаёт около 1000 токенов в секунду на пользователя. Против HBM4 и NVIDIA Rubin R200 заявлена примерно 20-кратная плотность полосы на квадратный миллиметр и 13,5-кратная экономия энергии на ГБ/с.

Retention drops from 32 ms at 85C to 4 ms at 105C, demanding 8 times more refresh while ECC and scrub must keep up.

Ещё за этот день

2026-09-14