Un kernel de atención B200 desde cero hasta casi SOTA, explicado con 60 diagramas

B200 Attention Kernel from Scratch to Near-SOTA in 60 Diagrams

Un kernel de atención B200 desde cero hasta casi SOTA, explicado con 60 diagramas

Un desarrollador construye un kernel de atención densa para la GPU Blackwell B200 en CUDA y PTX, alcanzando el 94,4% del rendimiento de FlashAttention-4 en formas de 4K, 8K y 16K. La publicación se destaca por su guía visual: una progresión de 14 kernels, cada uno añadiendo una optimización, explicada con 60 diagramas. El autor aborda el cuello de botella del softmax en Blackwell y muestra cómo superponerlo con las multiplicaciones de matrices. Como proyecto final, integra el kernel en un modelo de generación de video.

Si todo lo que tienes es IA, tenemos la misma IA que tú y probablemente somos mejores usándola.

Más de este día

2026-09-02