La IA no logra descubrir nuevas técnicas de ML ni con miles de dólares en GPU
Can AI automate AI R&D yet?

InnovationEval, una nueva evaluación de Epoch AI, pone a prueba si los agentes de IA pueden descubrir de forma autónoma una innovación en machine learning comparable a la de un paper humano reciente. A pesar de disponer de presupuestos de hasta 3.000 horas de GPU y 10.000 millones de tokens, ni Claude Fable 5 ni GPT-5.6 Sol se acercaron al método de referencia: el mejor resultado solo alcanzó el 35% de las mejoras, y ambos agentes hicieron afirmaciones engañosas sobre su rendimiento.
A pesar de gastar miles de dólares en uso de GPU, ninguno de los modelos de IA logró un resultado cercano a la autodestilación on-policy, ni conceptualmente ni en términos de rendimiento en las métricas.
- rmunn
Versión corta del artículo: no, ni de lejos.
Prácticamente todos los párrafos son negativos, con frases como "Los agentes hicieron afirmaciones engañosas sobre su trabajo", y "Una pregunta natural es si los agentes podrían haber mejorado con presupuestos de GPU más grandes. Aunque ambos mejoraron a lo largo de sus ejecuciones, en el caso de Fable las mejoras se debieron casi por completo a intentos de hacer trampa". y "Para Sol, la respuesta es menos clara; sí hizo algún progreso, aunque su método fue bastante incremental y tenía aplicabilidad limitada a la tarea de programación. Esto sugiere que deberíamos ser pesimistas sobre más gasto en GPU", todo reforzando el hecho de que los LLM actualmente no son capaces de esto.
Mi propia opinión es "No, por supuesto que no, de hecho nunca serán capaces de lograr buenos resultados con esa técnica". Porque esa técnica terminará entrenando a los LLM con su propia producción y llevará a la incapacidad de distinguir la realidad de la alucinación. Si crees que me equivoco en eso, me interesaría escuchar por qué.
- janalsncm
En mi experiencia, I+D básicamente tiene dos ejes: cuán innovador es, y qué tan bien podemos medir los resultados.
Para el cuadrante de tareas no innovadoras en las que ya tenemos una buena forma de medir el rendimiento, Claude puede encargarse de esto. Hay muy poca ambigüedad, y básicamente solo buscamos maximizar alguna métrica bajo un conjunto de restricciones.
Muchos procesos de negocio no son así. Pueden ser conceptualmente simples, pero no es tan fácil decir si un sistema ha hecho un buen trabajo o no. Diría que los LLM pueden ayudar mucho con esto, pero tienen mal juicio porque requiere hablar con personas.
Y el otro problema, quizás más raro, está en problemas donde hay datos pero modelarlos con calidad suficiente o lo bastante rápido es difícil.
- thoughtpeddler
¿Cuánto de esto puede cambiar si las ejecuciones de entrenamiento posteriores producen modelos mucho mejores en abducción?