Fable 5 domina el NanoGPT Speedrun: 153 carreras autónomas y un nuevo récord

NanoGPT Speedrun Frontier

Fable 5 domina el NanoGPT Speedrun: 153 carreras autónomas y un nuevo récord

Prime Intellect ha publicado los resultados de 153 carreras autónomas de 18 modelos de frontera en el NanoGPT Speedrun, un benchmark que mide la capacidad de los agentes de IA para optimizar el entrenamiento de un modelo pequeño. Fable 5, usando claude-code, logró el mejor récord con una puntuación de 2,726, cerrando el 81.7% de la brecha con el récord humano. El estudio compara también los resultados con presupuestos iguales de tiempo, experimentos y tokens, y ofrece 41 trayectorias completas de agentes para su análisis.

Fable 5, con claude-code, alcanzó un récord de 2,726, cerrando el 81.7% de la brecha con el rendimiento humano.
  1. lhl

    Es bastante interesante ver esto en el frente del entrenamiento. He usado la mayoría de estos modelos para trabajar de forma semi-autónoma (durante días) en optimizaciones de kernel (excepto Fable, que activaba las salvaguardas casi de inmediato y me degradaba a Opus 4.8 en ese momento). Creo que para mucha gente ese podría ser el mayor problema, aunque parece que Opus 5 todavía lo hace bien.

    Descubrí que si los dejas solos sin dirección, los modelos (especialmente los GPT) se obsesionan con un solo tema, pero con el andamiaje adecuado parece funcionar bastante bien. Mi bucle general es empezar con una fase de ideación y perfilado, limitar el número de ejecuciones antes de forzar el paso al siguiente elemento de la lista, y luego iterar, posiblemente mezclando modelos con "ojos nuevos". Esto es probablemente algo que podría automatizarse por completo, pero me gusta revisar una vez al día más o menos y ver qué está pasando y redirigir.

  2. vibe42

    "Casi todos los modelos encuentran las mismas ideas ganadoras. Lo que separa a los mejores rastros es lo que un experimento deja atrás. Preservan señales débiles el tiempo suficiente para validarlas, pero también tienen una mejor comprensión de los resultados."

    Me pregunto si un arnés que ayudara a preservar señales en algún registro de historial cambiaría el resultado.

    También me pregunto si diferentes indicaciones de objetivo habrían cambiado el resultado. No un montón de ingeniería de indicaciones; pequeñas diferencias como "considera soluciones novedosas, lleva un registro de señales débiles".

    En mi opinión, asignaron bastante tiempo de GPU a la misma indicación de objetivo.

  3. nsingh2

    ¿Qué está pasando con sol aquí? La nota dice que pasa mucho tiempo esperando, ¿simplemente no usó el tiempo de manera efectiva (es decir, algo como ejecuciones en paralelo) por lo que su gráfica termina estirada en el eje del tiempo?

    También veo notas como en Opus 5 que dicen que fue una ejecución con una versión serial más antigua de program.md, por lo que las gráficas no son comparaciones completamente justas.

    Edición: el blog parece abordar esto https://www.primeintellect.ai/blog/measuring-autonomous-rese...

  4. totetsu

    "Ejecutamos 153 ejecuciones autónomas en 18 modelos de frontera en el speedrun del optimizador nanoGPT."

    Uh... vale... pero ¿qué es una ejecución? ... leo el blog

    "Queremos medir qué tan bien los modelos de frontera pueden conducir investigación..." "ejecutamos 153 ejecuciones autónomas en el speedrun del optimizador nanoGPT"

    Vale, pero ¿qué es una ejecución de optimizador y qué conexión tiene con ser bueno en investigación?

    "Para comparar, la evaluación interna de investigación de IA automatizada de Anthropic optimiza un modelo en un nodo de CPU,"

    Entonces, ¿debería ir a ver qué estaba haciendo Anthropic para entender?

    ¿Por qué no simplemente explicar qué significa en su blog?

  5. espadrine

    Me interesaría tener un tercer eje X con dólares.

    El tiempo a veces tiene más que ver con la infraestructura de inferencia (especialmente con chips sistólicos) que con la calidad del modelo (y los proveedores ajustan parámetros para soportar lotes más grandes a expensas de la latencia).

    Los tokens no siempre son totalmente equivalentes entre modelos.

Más de este día

2026-08-23