Un pequeño transformer logra 44% en ARC-AGI-1 por solo 67 centavos

44% on ARC-AGI-1 in 67 cents

Un pequeño transformer logra 44% en ARC-AGI-1 por solo 67 centavos

Un investigador entrenó un transformer pequeño desde cero en 1.5 horas en una GPU 5090, alcanzando un 44% en el benchmark ARC-AGI-1 por un costo total de 67 centavos. El modelo supera a muchos LLMs y iguala el rendimiento de TRM/HRM, con mejoras en eficiencia de muestra y costo. El enfoque utiliza entrenamiento supervisado en tokens de salida, embeddings por tarea y 3D RoPE, y logra un 7% en ARC-2. El código está disponible en GitHub.

No entiendo por qué otros no lo descubrieron. Es solo un transformer con la representación más obvia. Este benchmark ha estado abierto durante 6 años, fue de alto perfil y tenía un premio de un millón de dólares.
  1. evilmathkid

    ¡Hola! Autor aquí. Sorprendido de ver esto en HN ahora. ¡Feliz de responder cualquier pregunta!

    Algo de contexto sobre esto:

    - Esto NO es un LLM. Es un pequeño transformer autorregresivo entrenado desde cero. Uno de los puntos era que problemas extremadamente complejos pueden abordarse sin LLMs.

    - Hasta la v1 de este resultado, este benchmark solo había sido escalado por LLMs o sus fine-tunes (por supuesto, con enormes costos de entrenamiento). Otros intentos funcionaron más o menos bien pero usaban arquitecturas muy complejas o cantidades extremadamente altas de cómputo de entrenamiento. Nadie esperaba que un transformer AR simple funcionara tan bien, a tan bajo costo y con tan pocas muestras de entrenamiento.

    - La eficiencia de muestra es uno de los problemas sin resolver más importantes en IA hoy en día. Eso es lo que estaba apuntando con este trabajo. Sabemos que es fácil aumentar la eficiencia de muestra aumentando el cómputo/parámetros, por lo que era importante restringir el costo tanto como fuera posible (también por eso el Parameter Golf de OpenAI tenía cómputo fijo y por qué Modded NanoGPT se considera muy eficiente en muestras).

    - ¿Se puede mejorar el rendimiento? Sí, pero la competencia está en curso, así que no puedo hablar de ello.

    - Personalmente creo que los modelos frontera de hoy pueden ser superados entrenando desde cero. Aún no lo he probado, aunque.

    - Dato curioso: era nuevo en ML cuando publiqué esto por primera vez (dic '25). Básicamente usé ARC como una forma de aprender ML.

  2. foota

    > Estoy de acuerdo en que es raro ver conjuntos de problemas en la vida real donde todos los problemas se dan a la vez. Incluso si es así (como un examen), los humanos generalmente solo pueden intentar uno a la vez.

    Solo un pequeño fragmento que me pareció interesante. Siempre leía ~todo el examen antes de empezar. Tanto para encontrar los problemas más accesibles para mí, como porque a veces me ayuda a resolver el resto de las preguntas :-)

  3. foota

    > Prohibir el entrenamiento fuera de línea/preentrenamiento. Los modelos deben entrenarse desde cero después de la presentación.

    Anteriormente esto se consideraba una regla imposible. Mi modelo demuestra que esto es posible.

    Garantiza que no se pueda usar datos sintéticos.

    Hace la comparación justa entre diferentes modelos. De lo contrario, algunos modelos como los LLMs pueden maximizar el benchmark ARC usando cantidades descomunales de entrenamiento fuera de línea. (Dado que el benchmark ha existido durante mucho tiempo, se han creado muchos conjuntos de datos similares a ARC).

    No soy investigador de ML, así que los resultados pueden variar, pero... ¿cómo podría un modelo aprender a responder estas preguntas de ARC-AGI sin entrenamiento previo?

  4. lackoftactics

    Parece un buen día para ti, top 5 en Kaggle con una publicación como esta. Parece que estarás en un avión a SF en breve.

  5. bee_rider

    Creo(?) que ya has hecho un buen trabajo explicando esta crítica para personas semi-informadas. Pero, ¿puedes simplificarlo aún más para aquellos de nosotros que estamos casi completamente fuera del circuito?

    > Entrenar con los rompecabezas de evaluación es hacer trampa / "entrenar con el test"

    > No, esto es falso. "Entrenar con el test" se refiere específicamente a entrenar con las etiquetas de los datos de prueba. Las etiquetas no fueron entrenadas.

    > Además, ARC es un benchmark de metalearning, así que se supone que debes aprender de los rompecabezas de evaluación.

    > Jerga: ARC tiene un conjunto de rompecabezas de entrenamiento y un conjunto de rompecabezas de evaluación. Cada rompecabezas tiene pares de ejemplo y pares de prueba. Un par consiste en una cuadrícula de entrada + cuadrícula de salida.

    > En ARC, la etiqueta es solo la cuadrícula de salida del par de prueba en un rompecabezas de evaluación.

    > Estas etiquetas no fueron entrenadas. Están ocultas. Puedes eliminarlas de antemano si lo deseas.

    Creo que lo que entiendo aquí es que el test viene con un lote de problemas de entrenamiento, con los que todos están de acuerdo en que puedes entrenar. Pero quizás los problemas de evaluación también vienen con ejemplos de entrada/salida (para ayudar a definir el problema) y entrenar con ellos es controvertido. No puedo ver por qué sería controvertido, pero ¿es esa la crítica?

  6. xeonax

    Aún más genial es su mención en "about me" de salvar su propia vida https://mvakde.github.io/ > Me salvé a mí mismo en una emergencia médica (los médicos no sabían qué era la rabdomiólisis).

  7. rappatic

    No tengo ningún tipo de experiencia en ML, pero siempre he pensado en la eficiencia de muestra como el gran problema sin resolver de la IA. Los humanos tenemos una eficiencia de muestra increíblemente buena; a menudo podemos aprender algo de manera duradera con solo uno o dos ejemplos. Esta es el área principal en la que los LLMs están muy, muy por detrás de nosotros.

  8. kvn95ss

    > Además, no estoy seguro de si el "razonamiento general" siquiera existe. Quizás los humanos también estamos especializados.

    He estado preguntándome lo mismo. Ahora estamos expuestos a tantos estímulos que nos engañamos pensando que esto es la norma: tener una comprensión razonable de todo, a menos que se requiera especialización.

Más de este día

2026-09-01