Один разработчик обучил LLM на 3.8 млрд параметров за $998, обойдя GPT-2

Training a 3.8B LLM to 0.384 CORE for $998 – Hugo Vergnes

Hugo Vergnes в одиночку обучил модель little-lm 3.8B, набравшую 0.384 балла CORE — заметно выше, чем у GPT-2 (0.2565) и nanochat d32 (0.310). Обучение на 65 млрд токенов заняло 43 часа на восьми B200 и стоило $998. Автор описывает, что сработало (Muon, FP8, ClimbMix, fused cross-entropy), а что нет, и разбирает инженерные компромиссы, позволяющие уложиться в тысячу долларов.

Я потратил шесть дней вычислений, чтобы построить модель хуже, чем модель в семь раз меньше, из 2019 года.

Ещё за этот день

2026-09-10