Как запустить передовые LLM локально: от $2k до $40k за 384GB VRAM

Jamesob's guide to running SOTA LLMs locally

Как запустить передовые LLM локально: от $2k до $40k за 384GB VRAM

Я делюсь своим опытом сборки локальной системы для запуска самых мощных LLM, от бюджетных решений с RTX 3090 до флагманской станции на 4x RTX PRO 6000. Мой подход включает использование PCIe-коммутаторов для прямого обмена данными между видеокартами и оптимизацию BIOS для максимальной производительности. Это позволяет запускать модели уровня Claude Opus, такие как GLM-5.2, с невероятной скоростью и полным контролем над данными.

Если Dario и Altman вызывают у вас дискомфорт, прочитайте это, чтобы понять, как запустить новый вид вычислений локально.
  1. Aurornis

    Я часто экспериментирую с локальными LLM. Я потратил на железо больше, чем следовало бы. У меня есть друзья из местного сообщества, которые потратили еще больше.

    Мое предупреждение всем: умерьте ожидания и внимательно читайте мелкий шрифт. Большая сборка в статье начинается с бюджета в $40K, но затем включает 4 видеокарты по $12K каждая. Для тех, кто считает, эта сборка обойдется скорее в 50–55K.

    Локальные установки также часто полагаются на квантование и такие техники, как REAP, чтобы уместить модели в доступное железо. Вы прочтете много утверждений о том, что 4-битное квантование не теряет качество, но эти заявления основаны на измерениях расхождения Кульбака-Лейблера на небольшом корпусе. Попробуйте использовать одну из таких 4-битных моделей для задач с длинным контекстом в программировании, и качество заметно упадет. Даже для некодирующих задач, таких как анализ данных, я могу зафиксировать существенную разницу в качестве между 4-битными моделями, 8-битными квантами и иногда даже полным 16-битным исходником.

    Эта статья также поощряет использование модели REAP, что означает, что кто-то вырезал часть весов, чтобы сделать её меньше. Идея состоит в том, чтобы удалить веса, менее полезные для определенных задач, но, опять же, это снизит общее качество вывода.

    Ловушка в том, что люди говорят: «Я запускаю GLM-5.2 локально!», и это звучит потрясающе, если посмотреть на бенчмарки GLM-5.2. Однако они на самом деле не запускают GLM-5.2, они запускают модель, полученную на основе GLM-5.2, которая отбрасывает большую часть битов и убирает некоторых экспертов. Это […]

  2. jacobgold

    > «~$40k На этом уровне цен вы получаете следующий шаг в интеллекте модели. Что-то очень близкое к Claude Opus.»

    Это эквивалентно 16,8 годам использования Claude Opus 4.8 или Codex GPT 5.5 по цене $200/мес.

    Я большой поклонник запуска локальных моделей, но они по-прежнему безумно дороги, имеют более низкое качество и могут быть опасны (если в них внедрен бэкдор). Я искренне желаю, чтобы это было не так.

  3. kgeist

    >$40k дает вам почти Opus

    GLM 5.2 — это «почти Opus», и для комфортного инференса ему нужно как минимум 8x H200 (так что это ближе к $400k, чем к $40k).

    Они предлагают использовать эту модифицированную модель:

    > REAP-обрезанная (≈22% экспертов удалено), Int8-mix NVFP4 квантованная версия GLM-5.2, ≈594B параметров.

    Мне интересно, как она поведет себя на практике вне бенчмарков. Qwen3.6, даже при 6-битном квантовании, часто застревает в циклах при рассуждениях. А здесь они еще и удалили некоторых экспертов. Я имею в виду, иногда 8-битная или 16-битная маленькая модель может быть умнее лоботомизированной большой модели. Я слышал, что консенсус таков: для программирования не стоит опускаться ниже 8 бит.

    Кроме того, не совсем понятно, сколько контекста остается доступным, когда вы пытаетесь уместить лоботомизированную модель в 4 RTX 6000. Все, что ниже 100k, едва ли пригодится, так как часто происходит компрессия еще до того, как модель успеет собрать необходимый контекст.

    P.S. нашел в репозиториях контекст 240k

  4. datadrivenangel

    «Отличный вариант — 2x RTX 3090 с общим объемом VRAM 48GB. Тогда вы сможете запустить Qwen3.6-27B, что является отличной моделью.»

    Хочу лишь отметить, что за $3k можно взять M5 MacBook Pro с 48GB общей памяти, и это не будет гигантским ящиком. Также стоит рассмотреть вариант выделить эти деньги на облачного провайдера хостинга, что будет как минимум немного, а возможно и значительно дешевле. Конечно, круто иметь возможность запускать модели локально.

  5. GTP

    Существует также промежуточный вариант: если у вас есть 128GB VRAM (сейчас на рынке есть несколько вариантов с такой памятью в архитектуре единой памяти), вы можете запускать DeepSeek V4 flash с хорошей скоростью через DwarfStar. Я сам не буду тратить на это деньги, но мое интуитивное чувство подсказывает, что это будет правильным компромиссом для многих людей.

  6. api

    Чипы Apple серии M заслуживают упоминания как еще один вариант, особенно учитывая, что вы получаете целый ноутбук Mac или настольную рабочую станцию.

    У них есть единая память и приличная производительность инференса, и для некоторых версий они могут быть дешевле видеокарт, особенно если вы возьмете высокопроизводительную модель серии M предыдущего поколения с большим объемом ОЗУ или восстановленную.

    Я читал, что у Apple есть планы предложить больше ОЗУ во всех своих моделях, как только пройдет «бутылочное горлышко» памяти, и что будущие GPU и NPU серии M будут еще лучше для локального инференса, поэтому в будущем я ожидаю, что Apple станет серьезным предложением для локального инференса и рабочих станций для исследований в области ИИ.

    А как насчет GPU от AMD и Intel Arc? Они не получают столько внимания, но я слышал, что они могут быть привлекательными для определенных конфигураций локальных LLM.

    Однако на данный момент, думаю, мы находимся в ситуации «рынка арендаторов» для вычислительных мощностей LLM. Если вам нужна конфиденциальность, возможно, лучше арендовать время GPU в сыром виде или использовать spot-ценообразование у различных провайдеров. Вероятно, строить свою систему имеет смысл только если у вас есть экстремальные потребности в конфиденциальности/безопасности или если вы просто хотите это сделать, потому что это круто.

  7. ineptech

    Стоит добавить и мой собственный опыт, так как я только на этой неделе настроил локальную LLM. Я выбрал карту на 32GB от Intel под названием Arc B70, которая дешевле, чем 3090, и имеет больше памяти, но с более медленной шиной памяти. исправлено удаление неточности, спасибо diablod3

    Я выбрал это, потому что а) модели, которые я хотел использовать, немного слишком велики, чтобы комфортно поместиться в 24GB, плюс мне нужно место для нескольких дополнительных небольших моделей для автодополнения и распознавания речи, и б) у меня уже был дешевый сервер, который можно использовать, а двойные GPU потребовали бы обновления материнской платы, блока питания и, вероятно, корпуса.

    Настройка была определенно немного хитрой. Линейка Intel требует пакет драйверов «level zero» для поддержки чего-то под названием SYCL (по сути, версия CUDA от Intel, насколько я понимаю), и его было непросто заставить работать. Я запускаю llama.cpp в контейнере Docker, что также потребовало некоторых танцев с бубном, чтобы контейнер увидел карту. Также нужно ядро последних нескольких месяцев.

    Но как только я все настроил, результаты очень впечатляют для инвестиций в $1k. Qwen 3.6 35B при q4 квантовании занимает около 3/4 памяти и выдает около 88 токенов/сек. Так что, если вам нужна модель приличного размера дешево, это один из путей.

  8. turova

    Для qwen3.6-27b вы также можете запустить вариант q4 с полным контекстом ~250K на одной 3090. Это достаточно быстро, чтобы не раздражать, поэтому прирост скорости от 2x 3090 для меня не того стоит. Запуск q6 на 2x 3090 с половинной скоростью и меньшим контекстом — это вариант, но вы все равно не сможете конкурировать с SOTA-моделями, поэтому, если у вас уже нет 2x 3090, я бы сказал, что одна — лучшая инвестиция при текущих ценах. Её достаточно для многих задач, особенно с хорошо настроенным harness.

Ещё за этот день

2026-07-07