HBF: la promesa de flash de alta capacidad en el paquete del chip

Hot Chips 2026: Applying High Bandwidth Flash (HBF)

HBF: la promesa de flash de alta capacidad en el paquete del chip

En el tutorial de Hot Chips 2026, Anurag Agarwal y Radhakrishna Giduthuri presentaron High Bandwidth Flash (HBF), una tecnología que integra memoria flash directamente en el paquete del procesador, similar a HBM. Aunque aún no existen productos, las simulaciones muestran su potencial para cargas de machine learning: podría almacenar expertos de MoE o la caché KV de vLLM, reduciendo la comunicación entre GPUs. Sin embargo, su acceso por bloques y la necesidad de gestión tipo SSD plantean desafíos de software considerables.

Modificar un solo byte puede significar leer un bloque de 64 KB en DRAM, modificarlo y escribir todo el bloque de vuelta a flash.
  1. rbanffy

    Tengo la sensación de que Intel se deshizo de Octane un par de años demasiado pronto.

  2. xnx

    ¿Es esta la misma idea que tuvo John Carmack? (https://x.com/ID_AA_Carmack/status/2074248758422864226?lang=...)

    "El coste y la capacidad de la memoria son problemas importantes para los aceleradores de IA.

    A diferencia del renderizado de juegos, la inferencia de modelos puede tener un patrón de acceso a memoria determinista. No necesitas 'memoria de acceso aleatorio' en absoluto para los pesos del modelo, y podrías tolerar latencias de arranque en frío de varios milisegundos, siempre que las lecturas continuas se entregaran con el ancho de banda necesario.

    La memoria flash NAND es más de 100 veces más barata por GB que la HBM, así que debería haber oportunidad ahí, incluso después de darle a un controlador de flash una interfaz de 1024 bits con ancho de banda de HBM.

    Podrías crear un protocolo de pines especializado que solo soportara transferencia en pipeline de páginas completas de 16KB+ desde el flash a la memoria scratchpad del acelerador gestionada por programa y mejorar el rendimiento por pin sobre HBM, pero podría ser más conveniente hacer que siguiera pareciendo una verdadera memoria de acceso aleatorio con características de rendimiento muy frágiles, donde cualquier cosa que no sean lecturas secuenciales cae por un precipicio de rendimiento de 1000x+.

    Eso tiene la ventaja de usar automáticamente las jerarquías de caché existentes, y proporciona un camino natural para actualizar la memoria flash con nuevos pesos de modelo. Con la interfaz de flujo a scratchpad, el código tiene que ser completamente reescrito antes de que funcione en absoluto, mientras que la interfaz de emulación de RAM empezará siendo extremadamente lenta, y puedes ir resolviendo los cambios incrementalmente para lograr el rendimiento completo.

    Puede haber casos donde no haya suficiente scratchp […]

  3. rando1234

    ¿Cuáles serán las propiedades de durabilidad/vida útil de esta tecnología en comparación con la DRAM tradicional?

Más de este día

2026-08-24