Почему бенчмарки врут: от napkin math до зимних шин
Bad benchmarks and evals: Senior SWE-Bench, napkin math, and winter tires

Dan Luu разбирает три вида бенчмарков: таблицы napkin math для оценки производительности, лидерборды AI-моделей вроде Senior SWE-Bench и сравнение зимних и всесезонных шин. Он показывает, что код для замеров случайного доступа к памяти и SSD содержит ошибки, а выводы о шинах основаны на разумных, но неполных данных. Автор призывает не доверять слепо готовым цифрам и лидербордам.
Джейми отметил, что между итерациями цикла нет зависимости по данным, поэтому чтения памяти здесь происходят параллельно.