Hot Chips 2026:HBF 能否拯救 DRAM 短缺?

Hot Chips 2026: Applying High Bandwidth Flash (HBF)

Hot Chips 2026:HBF 能否拯救 DRAM 短缺?

Hot Chips 2026 上提出的 High Bandwidth Flash(HBF)技术,试图将 SSD 的闪存以类似 HBM 的形态封装在计算芯片旁,提供远超 HBM 的容量。但这并非即插即用的内存扩展,软件必须像操作块存储设备一样,通过 DMA 以大块对齐的方式读写数据,甚至需自行管理磨损均衡。演讲者探讨了在 vLLM 中将 MoE 专家或 KV cache 存入 HBF 的潜力,以及利用其大容量减少跨设备通信的策略。然而,HBF 仅在非带宽受限场景下具备成本优势,且软件适配难度极大,甚至可能不如直接流式传输 SSD 数据来得简单。这究竟是 DRAM 短缺的解药,还是过于复杂的死胡同?

利用 HBF 所需的努力,似乎与直接通过 SSD 流式传输模型权重以减少 DRAM 使用量所需的努力相差无几。
  1. rbanffy

    我有种感觉,Intel 把 Octane 砍掉得太早了,早了大概两三年。

  2. xnx

    这是不是 John Carmack 之前提过的同一个想法?(https://x.com/ID_AA_Carmack/status/2074248758422864226?lang=...)

    “内存成本和容量是 AI 加速器的重大瓶颈。

    与游戏渲染不同,模型推理的内存访问模式可以是确定性的。对于模型权重,你根本不需要‘随机存取内存’,只要连续读取能提供所需的带宽,哪怕冷启动延迟达到几毫秒也是可以接受的。

    NAND 闪存每 GB 的成本不到 HBM 的百分之一,所以即便给闪存控制器配上 1024 位接口以达到 HBM 的带宽,这里依然存在巨大的机会。

    你可以设计一种专用的引脚协议,仅支持从闪存到由程序管理的加速器暂存内存(scratchpad memory)的完整 16KB+ 页的流水线传输,从而在单引脚性能上超越 HBM;但或许更方便的做法是让它仍然看起来像真正的随机存取内存,只是性能特性非常脆弱——除了顺序读取,任何操作都会导致性能断崖式下跌,降幅超过 1000 倍。

    这样做的好处是可以自动利用现有的缓存层级,并为用新模型权重更新闪存内存提供一条自然的路径。采用流式到暂存区的接口,代码必须完全重写才能运行;而采用内存模拟接口,起步时虽然极慢,但可以逐步优化以达成全速性能。

    在某些情况下,可能没有足够的暂存区空间 […]"

  3. rando1234

    与传统 DRAM 相比,这项技术的耐用性和寿命表现如何?

同日更多故事

2026-08-24