Ein 3,8B-LLM für 998 Dollar trainiert – und GPT-2 deutlich geschlagen

Training a 3.8B LLM to 0.384 CORE for $998 – Hugo Vergnes

Hugo Vergnes hat in Abendstunden ein 3,8-Milliarden-Parameter-Modell trainiert, das auf dem CORE-Benchmark 0,384 erreicht – für 998 Dollar in 43 Stunden auf gemieteten B200-GPUs. Inspiriert von nanochat zeigt er, wie ein einzelner mit wenigen tausend Dollar ein Modell bauen kann, das GPT-2 (0,2565) weit hinter sich lässt. Der Bericht beschreibt, was funktionierte, was nicht und welche Infrastruktur sich auszahlte.

Irgendwo zwischen „nanoGPT-Spielzeug“ und „du brauchst ein Forschungslabor“ gibt es eine große, kaum beschriebene Region, in der eine einzelne Person mit ein paar tausend Dollar ein sinnvolles Modell trainieren kann.

Mehr von diesem Tag

2026-09-10