Ein 3,8B-LLM für 998 Dollar trainiert – und GPT-2 deutlich geschlagen
Training a 3.8B LLM to 0.384 CORE for $998 – Hugo Vergnes
Hugo Vergnes hat in Abendstunden ein 3,8-Milliarden-Parameter-Modell trainiert, das auf dem CORE-Benchmark 0,384 erreicht – für 998 Dollar in 43 Stunden auf gemieteten B200-GPUs. Inspiriert von nanochat zeigt er, wie ein einzelner mit wenigen tausend Dollar ein Modell bauen kann, das GPT-2 (0,2565) weit hinter sich lässt. Der Bericht beschreibt, was funktionierte, was nicht und welche Infrastruktur sich auszahlte.
Irgendwo zwischen „nanoGPT-Spielzeug“ und „du brauchst ein Forschungslabor“ gibt es eine große, kaum beschriebene Region, in der eine einzelne Person mit ein paar tausend Dollar ein sinnvolles Modell trainieren kann.