Claude Fable 5.1登顶,GPT-6 Astra效率领跑
Artificial Analysis Intelligence Index v4.2

Artificial Analysis Intelligence Index v4.2正式发布,通过引入AA-Briefcase和GDP.pdf等更具现实挑战的测试集,大幅提升了评估的复杂性。新版指数将40%的权重分配给私有测试集,有效防止模型针对评测进行优化。榜单上,Anthropic的Claude Fable 5.1位居榜首,OpenAI的GPT-6 Astra紧随其后,并在输出Token效率上展现出显著优势。此次更新不仅反映了前沿模型的快速迭代,也标志着评估标准正从单纯的能力测试转向更贴近真实工作场景的实战检验。
我们正加速推进即将发布的v5版本中的部分功能,通过中期更新来紧跟前沿发展。