Claude Fable 5.1 возглавляет обновлённый Artificial Analysis Intelligence Index v4.2

Artificial Analysis выпустила промежуточное обновление своего индекса интеллекта — v4.2. В него добавлены более сложные и реалистичные задачи, а также частные тестовые наборы для предотвращения «накрутки» результатов. Ключевые изменения: новая оценка AA-Briefcase для агентных задач в сфере интеллектуального труда, тест GDP.pdf на длинный контекст (4 592 страницы), удаление насыщенного GPQA Diamond и увеличение доли закрытых тестов до 40%. Согласно результатам, лидирует Anthropic с моделью Claude Fable 5.1, за ней следует OpenAI GPT-6 Astra, а Meta замыкает тройку.
Мы намеренно сдерживали обновления, чтобы сохранить стабильность индекса в период крупных релизов моделей, но с таким быстрым движением границы возможностей мы решили выпустить промежуточное обновление, чтобы индекс оставался актуальным и полезным для пользователей.
- throwaway13337
Понятия не имею, как artificial analysis добились того, что кто-то стал воспринимать их всерьёз. Это их новый набор бенчмарков?
Беглый взгляд на их новый индекс показывает, что что бы они ни измеряли, это бесполезно.
Проведите час с gemini 3.8 и скажите мне, что эта модель относится к 2026 году. Ощущение, что у модели Альцгеймер. Она путается, является ли то, что она читает, тем, что она сделала. Просто безумно плохо.
Я не пробовал muse spark 1.3. Но должно быть, это чудо, раз с 1.2 она поднялась на такой рейтинг.
Отдаёт журналистикой о видеоиграх.
- redox99
Они поняли, что одинаковый балл у Astra и Sol — это глупо, поэтому поспешили обновить индекс, чтобы он соответствовал ожиданиям людей.
Старый индекс был явно плохим (Astra намного лучше Sol), но и подгонять его вот так — ненаучно.
- jascha_eng
По моему мнению, их индекс всеведения имеет наибольшую корреляцию с реальной полезностью моделей.
https://artificialanalysis.ai/evaluations/omniscience
> измеряет надёжность знаний и галлюцинации. Он вознаграждает правильные ответы, штрафует за галлюцинации и не штрафует за отказ отвечать.
Это очень полезно, потому что позволяет действительно доверять выводу модели. Высокий балл на бенчмарках не так полезен, потому что модель, переобученная всегда отвечать, будет давать уверенно неправильные ответы. Но этот индекс измеряет, как часто она права, штрафуя за неправильные ответы, так что высокий балл означает, что этой модели можно больше доверять, и когда она не знает, она с большей вероятностью скажет, что действительно не знает, а не выдумает.
Fable также показывает гораздо лучшие результаты, чем opus 5, что очень сильно коррелирует с воспринимаемой силой, несмотря на то, что модели показывают схожие результаты, например, на DeepSWE.
Astra — большой скачок по сравнению с sol и показывает результаты на уровне или немного лучше, чем fable.
- sanxiyn
Очень жаль, что они увеличили вес SciCode с 8% до 10%. SciCode — сломанный бенчмарк: см. https://arxiv.org/abs/2608.04975.
- __jl__
Это действительно большое достижение: "Astra доминирует на границе выходных токенов"
Многие лаборатории использовали увеличенное время размышлений для повышения результатов бенчмарков и производительности. Большинство китайских моделей так делали какое-то время. Google и Anthropic тоже.
Но не OpenAI. 5.6 уже была намного эффективнее по токенам, чем другие модели, и Astra с большим отрывом превосходит Sol по эффективности токенов.
Примечание: Просто чтобы пояснить: Astra (max) имеет второй по величине балл и третье наименьшее количество выходных токенов (среди моделей, показанных AA).