Opus 5 登顶 Artificial Analysis 智能榜单

Opus 5 is currently #1 on Artificial Analysis Intelligence Leaderboard

Opus 5 登顶 Artificial Analysis 智能榜单

Artificial Analysis 最新发布的 Intelligence Index v4.1 榜单显示,Opus 5 在综合智能评估中荣登榜首。该榜单整合了 GDPval-AA v2、Terminal-Bench v2.1、GPQA Diamond 等九大核心评测维度,全面考量模型在推理、代码生成及事实可靠性上的表现。除了智能分数,报告还深入对比了各模型的 Token 成本、推理速度及上下文窗口大小。数据揭示,在追求高智能的同时,不同模型在成本效益和响应延迟上存在显著差异,为开发者选择最适合的 AI 工具提供了详实的数据支撑。

Artificial Analysis Intelligence Index v4.1 整合了九大评估维度,包括 GDPval-AA v2、Terminal-Bench v2.1 以及 GPQA Diamond,旨在全面衡量模型的推理能力与知识可靠性。
  1. andy99

    在竞争如此激烈的情况下,#1 的排名其实用处不大,因为你得如履薄冰,生怕触发了那些要么直接拒绝、要么把你降级到另一个模型的审查机制(所谓的“安全护栏”)。出于这个原因,我几乎完全停止使用 Claude(除了某些遗留工作流),因为可靠性比拿到 61 分还是 57 分更重要。在我看来,Claude 是受限制最多、最不可靠的模型(介于审查机制和身份验证之间——虽然我本人没遇到过后者),他们为最新发布所做的那些微不足道的基准测试优化根本不值一提。

  2. chmod775

    更有趣的发现是,它依然是第二昂贵的模型(仅次于 Fable 5),而且差距巨大。

    至少有两个模型(GPT-5.6、Kimi K3)的得分与它持平(差距约 1-2%),但成本只有一半。

  3. didibus

    有趣的是这点:

    按智能指数排名的顶级 AI 模型是:1. Claude Opus 5 (Adaptive Reasoning, Max Effort) (61),2. Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) (60),3. Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (60),4. GPT-5.6 Sol (max) (59),以及 5. Claude Opus 5 (Adaptive Reasoning, High Effort) (59)。

    这意味着 Opus5 在 Xhigh 模式下依然比 Sol 在 max 模式下更聪明,而 Opus5 在 High 模式下与 Sol 在 max 模式下持平。

    这就让 Opus5 High 等同于 Sol max,现在我很好奇这两者之间的价格和速度差异是多少?

  4. firasd

    非常有趣的是,其中一个组成部分是“AA-Omniscience Index”(AA 全知指数)。

    AA-Omniscience Index(越高越好)衡量知识的可靠性和幻觉情况。它奖励正确答案,惩罚幻觉,且对拒绝回答不扣分。

    这似乎是参数量/密度的良好代理指标,排名情况如下:Claude Fable 5(带 fallback)、Gemini 3.1 Pro Preview、Claude Opus 5 (Max)、Grok 4.6 (high)、Gemini 3.6 Flash、GPT 5.6 Sol (Max)。

    我早就觉得 Gemini 3.x 系列有“大模型的味道”了。

  5. aarondong

    在过于兴奋之前,先看看智能与成本矩阵:https://artificialanalysis.ai/models?intelligence-index-toke...

  6. nu11ptr

    我在这场竞赛中没有任何利益相关,但在我看来,这让 GPT-5.6 Sol Max 看起来更香了。它的成本大约只有一半,性能却几乎完全一样。这也正好说明了 Fable 到底有多贵,毕竟相对于 GPT 5.6 来说,Opus 5 依然这么贵。

  7. kristopolous

    我之前发过,但我有一个非常简单的 shell 工具可以追踪这些图表,地址在:

    https://github.com/day50-dev/aa-eval-email

    这个也能用:

    $ curl day50.dev/art-analysis.sh | bash

    Artificial Analysis 知道我的这个工具,我正在和他们合作改进他们的 API。

  8. zormino

    我很想看看结果,特别是对于那些拥有 150 万和 200 万上下文窗口的模型,如果前 75% 的上下文被无关信息填满,表现会如何。

同日更多故事

2026-07-24