Hot Chips 2026: HBF, SSD를 CPU 패키지에 넣은 듯한 고대역폭 플래시, ML에 적용하려면
Hot Chips 2026: Applying High Bandwidth Flash (HBF)

High Bandwidth Flash(HBF)는 SSD와 동일한 플래시 메모리를 사용하지만 HBM처럼 컴퓨트 칩과 같은 패키지에 큐브 형태로 탑재되어, HBM보다 훨씬 높은 용량을 제공하면서도 준수한 대역폭을 목표로 한다. 아직 제품은 없으며, Hot Chips 2026 튜토리얼에서 Anurag Agarwal과 Radhakrishna Giduthuri는 시뮬레이션과 소프트웨어 적응 방안을 다뤘다. HBF는 DMA를 통해 DRAM과 데이터를 주고받으며, 대용량 정렬 블록 단위로만 접근 가능해 SSD 컨트롤러 기능을 소프트웨어가 처리해야 한다. vLLM에서는 MoE 전문가나 KV 캐시를 HBF에 저장하는 방안이 제시됐고, 비용 관점에서는 대역폭 한계에 도달하지 않는 워크로드에 적합하다. 그러나 소프트웨어 변경이 매우 커서 SSD에서 모델 가중치를 스트리밍하는 것보다 어려울 수 있다는 지적도 나온다.
HBF를 활용하는 데 필요한 노력은 SSD에서 모델 가중치를 스트리밍하여 DRAM 사용량을 줄이는 데 필요한 노력과 크게 다르지 않아 보인다.
HN 토론
19- rbanffy
인텔이 옵테인을 몇 년 일찍 버린 것 같은 느낌이 든다.
- xnx
이게 존 카맥이 가졌던 아이디어와 같은 건가요? (https://x.com/ID_AA_Carmack/status/2074248758422864226?lang=...)
"메모리 비용과 용량은 AI 가속기에 있어 중요한 문제입니다.
게임 렌더링과 달리 모델 추론은 결정적인 메모리 접근 패턴을 가질 수 있습니다. 모델 가중치에는 '랜덤 액세스 메모리'가 전혀 필요하지 않으며, 필요한 대역폭으로 연속 읽기가 제공된다면 수 밀리초의 콜드 스타트 지연 시간을 허용할 수 있습니다.
NAND 플래시는 GB당 HBM보다 100배 이상 저렴하므로, 플래시 컨트롤러에 HBM 대역폭의 1024비트 인터페이스를 제공한 후에도 기회가 있을 것입니다.
파이프라인 방식으로 전체 16KB 이상의 페이지를 플래시에서 프로그램이 관리하는 가속기 스크래치패드 메모리로 전송하는 특수 핀 프로토콜을 만들어 HBM보다 핀당 성능을 향상시킬 수 있지만, 실제 랜덤 액세스 메모리처럼 보이게 하되 성능 특성이 매우 취약하여 순차 읽기가 아닌 모든 것이 1000배 이상의 성능 절벽에 떨어지도록 만드는 것이 더 편리할 수 있습니다.
이렇게 하면 기존 캐시 계층을 자동으로 사용할 수 있고, 플래시 메모리를 새 모델 가중치로 업데이트하는 자연스러운 경로를 제공할 수 있다는 장점이 있습니다. 스트림-투-스크래치 인터페이스를 사용하면 코드가 완전히 다시 작성되어야만 작동하지만, RAM 에뮬레이션 인터페이스는 처음에는 매우 느리게 시작되며 전체 성능을 위해 변경 사항을 점진적으로 정리할 수 있습니다.
스크래치패드가 충분하지 않은 경우가 있을 수 있습니다..."
- rando1234
이 기술의 내구성/수명 특성은 기존 DRAM과 비교하여 어떨까요?