Los benchmarks de rendimiento que todos citan están mal medidos
Bad benchmarks and evals: Senior SWE-Bench, napkin math, and winter tires

Dan Luu analiza tres benchmarks que la gente cita como referencia: las tablas de napkin math para estimar latencias, los leaderboards de DeepSWE y Senior SWE-Bench, y la creencia de que los neumáticos de invierno superan a los all-season. En el primer caso, el código mide lecturas de memoria en paralelo en lugar de latencia real, y los números de SSD aleatorio resultan sospechosos por accesos desalineados y solapados.
Jamie notó que no hay dependencia de datos entre las iteraciones del bucle, así que las lecturas de memoria aquí ocurren en paralelo.