High Bandwidth Flash на Hot Chips 2026: как флеш-память на упаковке процессора может изменить ИИ

Hot Chips 2026: Applying High Bandwidth Flash (HBF)

High Bandwidth Flash на Hot Chips 2026: как флеш-память на упаковке процессора может изменить ИИ

На Hot Chips 2026 Anurag Agarwal и Radhakrishna Giduthuri представили High Bandwidth Flash (HBF) — технологию, которая размещает флеш-память на одном корпусе с вычислительным чипом, подобно HBM. HBF обещает гораздо большую емкость, чем HBM, но требует пересмотра подхода к работе с памятью: доступ к ней осуществляется большими выровненными блоками через DMA, как к SSD. В статье разбираются сценарии применения HBF для ИИ-нагрузок: хранение экспертов MoE и KV-кэша в vLLM, снижение межчипового обмена, а также ограничения по пропускной способности и сложности программной адаптации. Автор сомневается, что HBF станет решением проблемы нехватки DRAM, учитывая огромные усилия по адаптации ПО.

Я бы даже сказал, что усилия, необходимые для использования HBF, не сильно отличаются от того, что потребовалось бы для прямого сокращения использования DRAM путем потоковой передачи весов модели с SSD.
  1. rbanffy

    У меня такое ощущение, что Intel избавилась от Octane на пару лет раньше, чем следовало.

  2. xnx

    Это та же идея, что была у Джона Кармака? (https://x.com/ID_AA_Carmack/status/2074248758422864226?lang=...)

    "Стоимость и объём памяти — серьёзные проблемы для ИИ-ускорителей.

    В отличие от рендеринга игр, инференс моделей может иметь детерминированный паттерн доступа к памяти. Для весов модели вам вообще не нужна "память с произвольным доступом", и можно было бы терпеть задержки холодного старта в несколько миллисекунд, лишь бы непрерывное чтение обеспечивалось на необходимой пропускной способности.

    NAND-флеш более чем в 100 раз дешевле за гигабайт, чем HBM, так что здесь должна быть возможность, даже если дать контроллеру флеша 1024-битный интерфейс с пропускной способностью HBM.

    Можно было бы сделать специализированный пин-протокол, который поддерживал бы только конвейерную передачу полных страниц размером 16 КБ+ из флеша в управляемую программой scratchpad-память ускорителя и улучшил бы производительность на пин по сравнению с HBM, но, возможно, удобнее сделать так, чтобы это всё ещё выглядело как настоящая память с произвольным доступом с очень хрупкими характеристиками производительности, где всё, кроме последовательного чтения, обрушивается с утёса производительности в 1000+ раз.

    Это имеет преимущество автоматического использования существующих кэш-иерархий и обеспечивает естественный путь для обновления флеш-памяти новыми весами модели. С интерфейсом поток-в-scratch код должен быть полностью переписан, прежде чем он вообще заработает, в то время как интерфейс эмуляции RAM начнёт просто с чрезвычайно медленной работы, и вы сможете постепенно разобраться с изменениями для полной производительности.

    Могут быть случаи, когда недостаточно scratchp […]

  3. rando1234

    Каковы будут свойства долговечности/срока службы этой технологии по сравнению с традиционной DRAM?

Ещё за этот день

2026-08-24