Los agentes de código 'piensan' hasta 25 pasos por delante de sus propias ediciones
Coding agents think ahead of time

Un estudio de KTH Royal Institute of Technology revela que los modelos de lenguaje que impulsan a los agentes de codificación representan internamente el estado del programa en el que trabajan, incluso antes de que se materialicen los cambios. Mediante sondas de regresión logística sobre los estados ocultos, los investigadores logran predecir si el código compila, pasa las pruebas o introduce regresiones, con un AUC de hasta 0.83. El hallazgo más sorprendente es que estas representaciones se adelantan a las ediciones del agente: las sondas pueden predecir el resultado de cambios futuros hasta 25 pasos antes de que ocurran, un fenómeno que denominan 'horizonte de programación latente'. Además, las sondas transfieren entre benchmarks sin reentrenamiento, abriendo nuevas vías para la interpretabilidad mecanicista de los agentes de codificación.
Las representaciones internas de los agentes de codificación se adelantan a sus propias ediciones: las sondas entrenadas para predecir el resultado de cambios futuros logran un rendimiento superior al azar hasta aproximadamente 25 pasos antes de que se materialicen.