60 张图从零手写 B200 Attention 内核

B200 Attention Kernel from Scratch to Near-SOTA in 60 Diagrams

60 张图从零手写 B200 Attention 内核

我在博客中从零开始,用 CUDA 和少量 PTX 手写了一个 Blackwell B200 的 Attention 内核。通过 60 张图解,我一步步演示了如何从基准实现优化到接近 FlashAttention-4 的性能。文章不仅拆解了 B200 硬件上的计算瓶颈,还展示了如何将最终内核集成到视频生成模型中。这不仅是代码实现,更是一份关于 GPU 内核优化的视觉指南,帮助读者理解底层原理并建立自己的优化思路。

如果你们拥有的只是 AI,那我们也拥有同样的 AI,而且我们可能更擅长使用它。

同日更多故事

2026-09-02