1 триллион токенов в месяц: сколько нужно GPU?
How many GPUs is 1M/B/T tokens?

Калькулятор Cedana оценивает, сколько GPU требуется для обработки 1 триллиона токенов в месяц на моделях вроде Llama 3.3 70B. Для H100 базовая оценка — 367 GPU, но диапазон широк: от 211 до 853. Самый сильный фактор неопределённости — скорость генерации: при 1500 токенов в секунду нужно 244 GPU, при 450 — уже 814. Утилизация тоже критична: 80% дают 229 GPU, 30% — 611. Для B200 базовая оценка всего 92 GPU.
Одна копия модели требует 3 V100 GPU (77 ГБ против 32 ГБ). Считайте результат для V100 теоретическим.
- DiabloD3
Этот калькулятор, в общем-то, бесполезен. Разные модели работают по-разному, нельзя их обобщённо определять по количеству параметров, а модели, которые он перечисляет, похоже, просто подставляют количество параметров за вас.
Он также упускает большинство карт, используемых для инференса, ограничиваясь только относительно новыми картами Nvidia. Даже если это предназначалось исключительно для дата-центров, для клиентов AMD он был бы бесполезен.
А что касается различий между моделями, он также не понимает размер kv-кэша, сколько одновременных сессий нужно обслуживать, накладные расходы на вычисления при квантовании kv-кэша, а также накладные расходы на вычисления при квантовании модели. Он также не знает, что такое MTP и DFlash, и не может увеличить ваш эффективный tps в соответствии с ними.
В качестве примера: сравните квант Qwen 3.8 Q4_K_M от Unsloth (4.5 BPW), приличная модель поменьше, без MTP вы получите базовый уровень, скажем, около 3-6 TPS на 100 Вт. Со встроенной моделью MTP вы приближаетесь к 6-12 TPS на 100 Вт; затем переключите кванты на IQ4-XS от Byteshape (3.84 BPW) и используйте их рекомендованный драфтер Dflash, и вы уже в районе 15-30 TPS
... но если я накалякаю в калькуляторе "27B, 27B активных, 4-бит, 1B в день", это, похоже, нижняя граница моей цифры без MTP: 1B в день = 11574 в секунду, он рекомендует 3x B200, каждый B200 — 1200 Вт, так что 11574 / (1200*3) = 3.215, однако реальные результаты были бы в 2-10 раз выше.
Также, цитируя сайт: "Результаты для A100 и V100 на больших моделях являются теоретическими.". Инференс в малых масштабах [...]
- dannyw
Извините, но это похоже на вайб-кодированный маркетинговый шлак, который крайне неточен.
Во-первых, здесь полностью отсутствует учёт кэширования промптов/KV, которое, как мы все теперь знаем, по сути необходимо, особенно для рабочих нагрузок в масштабе.
Во-вторых, похоже, все бенчмарки основаны на размере батча 1.
Никто, запускающий кластер из B200 или H100, не занимается инференсом с размером батча 1.
И что ещё хуже, калькулятор предполагает, что вы запускаете модели с окном контекста 0 токенов? Это колоссально влияет на количество GPU.
Я не придираюсь к мелочам или намеренным упрощениям, но оценки, которые он выдаёт, чудовищно неточны в несколько раз.