Cómo logré un kernel 232 veces más rápido con auto-investigación y Codex
Auto-research with codex: How I achieved a 232x Faster Kernel

En el concurso de GPU Mode y Core Automation, el autor implementó una factorización QR compacta por reflectores de Householder en GPU, logrando un speedup de 232x sobre la línea base y quedando en el puesto 12 de 183 participantes. Usó Codex y un bucle de iteración con el CLI popcorn para probar y enviar más de 1500 soluciones. El artículo detalla su estrategia: aprender lo suficiente para hacer mejores preguntas, usar el algoritmo de Householder por bloques con actualización WY, y diversificar ideas para escapar de máximos locales.
Los agentes anhelan bucles de retroalimentación ajustados; les permiten escalar la colina a su antojo.