Hot Chips 2026で注目:HBFはSSDをCPUパッケージに載せる新技術、AIワークロードへの応用を検証

Hot Chips 2026: Applying High Bandwidth Flash (HBF)

Hot Chips 2026で注目:HBFはSSDをCPUパッケージに載せる新技術、AIワークロードへの応用を検証

Hot Chips 2026のチュートリアルで、High Bandwidth Flash(HBF)の可能性が議論された。HBFはSSDと同じフラッシュメモリをHBMのような形でパッケージに搭載し、大容量とそこそこの帯域幅を提供する。ただし、DRAMのように使えるわけではなく、大規模なアラインアクセスが必要で、ソフトウェアがSSDコントローラの役割を担う必要がある。vLLMではMoEエキスパートやKVキャッシュをHBFに置く戦略が検討され、コスト面では帯域幅に余裕のあるワークロードでのメリットが示された。しかし、ソフトウェアの変更は大きく、既存のSSDストリーミングと比べて利点は限定的かもしれない。

HBFを活用するために必要な労力は、SSDからモデルウェイトをストリーミングしてDRAM使用量を削減するために必要な労力と大差ないように思える。
  1. rbanffy

    インテルはオクタンを数年前に廃止したのは早すぎた気がする。

  2. xnx

    これはジョン・カーマックが提唱していたアイデアと同じものだろうか? (https://x.com/ID_AA_Carmack/status/2074248758422864226?lang=...)

    「メモリのコストと容量は、AIアクセラレータにとって重大な問題だ。

    ゲームレンダリングとは異なり、モデル推論は決定的なメモリアクセスパターンを持つ。モデルの重みには『ランダムアクセスメモリ』はまったく必要なく、必要な帯域幅で連続読み出しが提供される限り、数ミリ秒のコールドスタートレイテンシは許容できる。

    NANDフラッシュはGBあたりのコストがHBMの100倍以上安いので、フラッシュコントローラにHBM帯域幅の1024ビットインターフェースを与えた後でも、そこにチャンスがあるはずだ。

    フラッシュからプログラム管理のスクラッチパッドメモリへの16KB以上のフルページのパイプライン転送のみをサポートする専用ピンプロトコルを作れば、ピンあたりの性能をHBMより向上させられるかもしれない。しかし、真のランダムアクセスメモリのように見せかけ、シーケンシャル読み出し以外は1000倍以上の性能低下が起こるという、非常に脆弱な性能特性を持たせる方が便利かもしれない。

    これには、既存のキャッシュ階層を自動的に利用でき、新しいモデルの重みでフラッシュメモリを更新する自然な経路を提供するという利点がある。ストリーム・ツー・スクラッチインターフェースでは、コードが動作する前に完全に書き直す必要があるが、RAMエミュレーションインターフェースは最初は非常に遅いだけで、フルパフォーマンスに向けて変更を段階的に整理できる。

    スクラッチパッドが不足するケースもあるかもしれない[…]」

  3. rando1234

    この技術の耐久性や寿命の特性は、従来のDRAMと比べてどうなるのだろうか?

この日のほかの記事

2026-08-24