Anthropic lidera el nuevo Artificial Analysis Intelligence Index v4.2

Anthropic lidera el nuevo Artificial Analysis Intelligence Index v4.2

Artificial Analysis ha lanzado una actualización intermedia de su Intelligence Index, la v4.2, para seguir el ritmo del rápido avance de la frontera de la IA. Esta versión incorpora dos nuevas evaluaciones: AA-Briefcase, que mide el trabajo de conocimiento agéntico en proyectos complejos, y GDP.pdf, que evalúa el razonamiento sobre documentos extensos. Además, aumenta al 40% el peso de los conjuntos de prueba privados para evitar que los laboratorios manipulen los resultados. En el ranking, Claude Fable 5.1 de Anthropic lidera, seguido de GPT-6 Astra de OpenAI, que muestra una mejora de 4 puntos sobre GPT-5.6 Sol.

Hemos retenido deliberadamente las actualizaciones para mantener el índice estable durante los recientes lanzamientos de modelos importantes, pero con la frontera moviéndose tan rápido en las últimas semanas, sentimos que es importante ofrecer una actualización intermedia inmediata para asegurar que nuestro índice siga siendo tan relevante y útil como siempre.
  1. throwaway13337

    No tengo idea de cómo artificial analysis llegó a ser algo que alguien se tomara en serio. ¿Este es su nuevo conjunto de benchmarks?

    Un vistazo a su nuevo índice muestra que lo que sea que estén midiendo, no es útil.

    Pasa una hora con Gemini 3.8 y dime que ese modelo pertenece a 2026. Se siente como si el modelo tuviera Alzheimer. Se confunde acerca de si lo que lee es lo que hizo. Simplemente increíblemente malo.

    No he probado Muse Spark 1.3. Pero debe haber sido un milagro desde 1.2 para alcanzar ese puesto.

    Vibraciones de periodismo de videojuegos por todas partes.

  2. redox99

    Se dieron cuenta de que Astra teniendo la misma puntuación que Sol era una tontería, así que se apresuraron a actualizar el índice para que se ajuste a lo que la gente espera.

    El índice anterior era claramente malo (Astra es mucho mejor que Sol), pero también es poco científico retocarlo así.

  3. jascha_eng

    En mi opinión, el índice de omnisciencia que tienen tiene la mayor correlación con la utilidad real de los modelos.

    https://artificialanalysis.ai/evaluations/omniscience

    > Mide la fiabilidad del conocimiento y la alucinación. Recompensa las respuestas correctas, penaliza las alucinaciones y no tiene penalización por negarse a responder.

    Esto es muy útil porque te hace confiar realmente en la salida de un modelo. Una puntuación alta en benchmarks no es tan útil porque un modelo sobreentrenado para responder siempre dará respuestas equivocadas con confianza. Pero este índice mide con qué frecuencia es correcto mientras penaliza las respuestas incorrectas, de modo que una puntuación alta significa que puedes confiar más en este modelo y cuando no sabe, es más probable que te diga que realmente no sabe en lugar de inventarse cosas.

    Fable también rinde mucho mejor que Opus 5 aquí, lo que se correlaciona fuertemente con la fortaleza percibida a pesar de que los modelos rinden de manera similar en, por ejemplo, DeepSWE.

    Astra es un gran salto desde Sol y rinde igual o ligeramente mejor que Fable aquí.

  4. sanxiyn

    Es muy desafortunado que hayan aumentado el peso de SciCode del 8% al 10%. SciCode es un benchmark roto: ver https://arxiv.org/abs/2608.04975.

  5. __jl__

    Esto es realmente un gran logro: "Astra domina la frontera de tokens de salida"

    Muchos laboratorios usaron un mayor tiempo de pensamiento para impulsar las puntuaciones de los benchmarks y el rendimiento. La mayoría de los modelos chinos estuvieron haciendo eso durante un tiempo. Google y Anthropic también.

    No OpenAI. 5.6 ya era mucho más eficiente en tokens que otros modelos y Astra supera a Sol en eficiencia de tokens por un amplio margen.

    Edición: Solo para dejar claro el punto: Astra (max) tiene la segunda puntuación más alta y el tercer número más bajo de tokens de salida (entre los modelos mostrados por AA).

Más de este día

2026-09-05