Revisé 30 tarjetas de modelos de frontera: estos son los benchmarks que reportan los laboratorios

I checked 30 frontier model cards. Here are the benchmarks labs report

Revisé 30 tarjetas de modelos de frontera: estos son los benchmarks que reportan los laboratorios

Un análisis de 30 tarjetas de modelos de frontera revela qué benchmarks publican realmente los laboratorios. Aunque los líderes suelen mostrar resultados en MMLU, GPQA y HumanEval, la cobertura varía enormemente: algunos omiten pruebas de seguridad, otros no reportan varianza o reproducibilidad. La falta de estandarización dificulta comparaciones justas y oculta debilidades en áreas como razonamiento multimodal o agentes. El artículo aboga por transparencia y sugiere que los usuarios exijan métricas más completas y verificables.

La ausencia de un estándar común en los benchmarks reportados permite a los laboratorios presentar solo sus mejores resultados, ocultando fallos en tareas críticas.

Más de este día

2026-08-16