¿Están los laboratorios de IA 'pelicanmaxxeando'?

Are AI Labs Pelicanmaxxing?

¿Están los laboratorios de IA 'pelicanmaxxeando'?

Un experimento con 1.008 SVGs de siete modelos de IA revela que no hay evidencia de que los laboratorios optimicen sus modelos para el famoso benchmark informal del pelícano en bicicleta. A pesar de que el prompt de Simon Willison se ha convertido en una prueba de referencia, los resultados muestran que los pelícanos y las bicicletas no se dibujan mejor que otros animales y vehículos, ni siquiera ajustando por dificultad. El análisis estadístico no encuentra efectos significativos específicos del benchmark, sugiriendo que los laboratorios no están 'pelicanmaxxeando'.

Si los laboratorios de IA entrenaran con el benchmark, esperarías que los pelícanos estuvieran en la cima; en cambio, están en la mitad inferior.

Más de este día

2026-07-22