Magic trainiert trillionen-Parameter-Modelle mit 50x weniger Rechenleistung als DeepSeek
>10x More Efficient Pretraining
Frontier-Pretraining galt bisher als Spiel für Großlabore mit 100.000 Chips. Magic zeigt: Mit algorithmischer Effizienz erreicht das Team DeepSeek V4 Pro Base mit rund 50x weniger FLOPs – etwa 0,5 Mio. Dollar auf GB200. Nach weiterem 10x-Scaling übertrifft das Modell alle offenen Base-Modelle bei Perplexity-Evals. Die Effizienz entsteht aus Dutzenden Änderungen an Architektur, Optimizer, Trainingsziel und Datenkuratierung – kein einzelner Trick.
Wir sind wahrscheinlich das kleinste Team der Welt, das trillionen-Parameter-Modelle trainiert. Der Einfluss, den eine einzelne Person mit starkem Urteilsvermögen haben kann, war noch nie so groß.
- woadwarrior01
Sie haben eine Geschichte darin, großspurige Behauptungen wie diese[1] aus dem Jahr 2024 aufzustellen, ohne sichtbare Produkte oder Forschung.
[1]: https://magic.dev/blog/100m-token-context-windows (auch in ihrem Blogpost verlinkt)
- simonw
> Wir erreichen DeepSeek V4 Pro Base mit ~50x weniger FLOPs – das ist etwa die Hälfte des Pretraining-Computes von GPT3, oder ~$0,5M auf GB200.
Wenn das stimmt, ist das eine wirklich große Sache.
- pvillano
Viele Leute setzen ihr Geld auf unendliches Wachstum für immer von KI-Leistung, Compute-Nutzung, Nutzerbasis, Abonnementpreis.
Ich denke, die Kosten werden für immer sinken.
- ansk
Ich weiß nicht genug über die spezifischen Modelle, mit denen sie vergleichen, um das definitiv zu sagen, aber es sieht für mich so aus, als würden sie ihre vortrainierten Modelle mit nachtrainierten Modellen anderer vergleichen.
Die Metrik, auf der ihre 10x-Behauptung basiert (Bits-pro-Byte), ist genau die Metrik, die während des Vortrainings optimiert wird. Nachtrainierte Modelle werden feinabgestimmt, um andere Metriken zu optimieren, was bekanntermaßen der Leistung bei Bits-pro-Byte-Evaluierungen schadet. Daher werden Bits-pro-Byte-Evaluierungen ein vortrainiertes Modell immer vorteilhaft im Vergleich zu einem vergleichbaren Modell erscheinen lassen, das ebenfalls ein Nachtraining durchlaufen hat.
Kann jemand bestätigen, ob die Modelle, mit denen sie vergleichen (DeepSeek V4, Kimi K2 und Nemotron 3 Ultra), nachtrainiert wurden?
- ismael_rr
Super großartig. Ich wünschte, sie würden das Paper darüber veröffentlichen, was sie getan haben, um das zu erreichen. Ich erinnere mich, dass nous das Token-Superposition-Paper veröffentlicht hat, das die Pretraining-FLOPs etwas verbessert hat, aber nicht um das 50-fache: https://nousresearch.com/token-superposition. Ich frage mich, ob sie auch einige coole Tokenisierungsstrategien gefunden haben