NanoGPT Speedrun: 153 autonome KI-Läufe, Fable 5 führt mit Rekord von 2.726

NanoGPT Speedrun Frontier

NanoGPT Speedrun: 153 autonome KI-Läufe, Fable 5 führt mit Rekord von 2.726

Prime Intellect hat 153 autonome Läufe von 18 Frontier-Modellen auf dem nanoGPT-Optimizer-Speedrun durchgeführt und die Ergebnisse veröffentlicht. Fable 5 erzielte mit claude-code den besten validierten Rekord von 2.726 und schloss 81,7 % der Lücke zum menschlichen Ergebnis. Die Studie vergleicht Modelle wie Opus 5, Kimi K3, GPT-5.6 Sol und DeepSeek V4 Pro unter gleichen Budgets und stellt 41 vollständige Agent-Trajektorien mit Tool-Calls, Subagenten und Scratchpads zur Verfügung.

Wir haben 153 autonome Läufe über 18 Frontier-Modelle auf dem nanoGPT-Optimizer-Speedrun durchgeführt.
  1. lhl

    Es ist ziemlich interessant, das auf der Trainingsseite zu sehen. Ich habe die meisten dieser Modelle verwendet, um halbautonom (tageweise) an Kernel-Optimierungen zu arbeiten (außer Fable – es hat fast sofort die Schutzmechanismen ausgelöst und mich damals auf Opus 4.8 zurückgestuft). Ich denke, für viele Leute könnte das das größte Problem sein, obwohl es so aussieht, als ob Opus 5 immer noch gut abschneidet.

    Ich habe festgestellt, dass die Modelle (insbesondere GPT-Modelle), wenn man sie unbeaufsichtigt und ohne Richtung lässt, in Kaninchenlöcher geraten, aber mit dem richtigen Gerüst scheint es ziemlich gut zu funktionieren. Meine allgemeine Schleife besteht darin, mit einer Ideenfindungs- und Profiling-Phase zu beginnen, die Anzahl der Läufe zu begrenzen, bevor ich gezwungen bin, zum nächsten Punkt auf der Liste überzugehen, und dann zu iterieren, möglicherweise mit Modellen mit "frischem Blick". Das könnte wahrscheinlich vollständig automatisiert werden, aber ich schaue gerne einmal am Tag vorbei und sehe, was passiert, und lenke um.

  2. vibe42

    "Fast jedes Modell findet die gleichen gewinnbringenden Ideen. Was die besten Spuren unterscheidet, ist, was ein Experiment hinterlässt. Sie bewahren schwache Signale lange genug auf, um sie zu validieren, aber sie haben auch ein besseres Verständnis der Ergebnisse."

    Ich bin neugierig, ob ein Gerüst, das hilft, Signale in einem Verlaufsprotokoll zu bewahren, das Ergebnis verändern würde.

    Außerdem bin ich neugierig, ob unterschiedliche Ziel-Prompts das Ergebnis verändert hätten. Nicht viel Prompt-Engineering; kleine Unterschiede wie "betrachte neuartige Lösungen, behalte schwache Signale im Auge".

    Meiner Meinung nach haben sie ziemlich viel GPU-Zeit für denselben Ziel-Prompt aufgewendet.

  3. nsingh2

    Was ist hier mit sol los? Die Anmerkung sagt, dass es viel Zeit mit Warten verbringt, hat es die Zeit einfach nicht effektiv genutzt (z. B. durch parallele Läufe), sodass sein Graph auf der Zeitachse gestreckt ist?

    Ich sehe auch Anmerkungen wie bei Opus 5, dass es ein Lauf mit einer älteren seriellen Version von program.md war, also sind die Graphen keine vollständigen Äpfel-zu-Äpfel-Vergleiche?

    Edit: Der Blog scheint diese Punkte zu adressieren: https://www.primeintellect.ai/blog/measuring-autonomous-rese...

  4. totetsu

    "Wir haben 153 autonome Läufe über 18 Frontier-Modelle auf dem nanoGPT-Optimizer-Speedrun durchgeführt."

    Äh... okay... aber was ist ein Lauf... Blog lesen.

    "Wir wollen messen, wie gut Frontier-Modelle Forschung betreiben können..." "...wir haben 153 autonome Läufe auf dem nanoGPT-Optimizer-Speedrun durchgeführt."

    Okay, aber was ist ein Optimizer-Lauf und welche Verbindung hat er dazu, gut in Forschung zu sein?

    "Zum Vergleich: Die interne automatisierte KI-Forschungsbewertung von Anthropic optimiert ein Modell auf einem CPU-Knoten."

    Also sollte ich mir ansehen, was Anthropic getan hat, um es zu verstehen?

    Warum erklären sie nicht einfach in ihrem Blog, was es bedeutet?

  5. espadrine

    Ich wäre an einer dritten X-Achse mit Dollar interessiert.

    Zeit hängt manchmal mehr von der Inferenzinfrastruktur ab (insbesondere bei systolischen Chips) als von der Modellqualität (und Anbieter drehen an Stellschrauben, um höhere Batches zu unterstützen, auf Kosten der Latenz).

    Tokens sind nicht immer vollständig zwischen Modellen äquivalent.

Mehr von diesem Tag

2026-08-23