Claude Opus 5.5 智能、性能与价格深度解析

Claude Opus 5.5 Intelligence, Performance and Price Analysis

Claude Opus 5.5 智能、性能与价格深度解析

Artificial Analysis 发布了最新的 Intelligence Index v4.3.2,通过 AA-Briefcase、Terminal-Bench 等 10 项严苛评测,对 Claude Opus 5.5 进行了全方位体检。报告不仅量化了其在 Agentic knowledge work 和 Professional document reasoning 中的表现,还深入剖析了每单位智能任务的 Token 消耗与成本结构。从 Cache Hit 价格策略到 Context Window 的实际效能,数据揭示了该模型在推理能力与商业成本之间的平衡点。对于正在评估 LLM 部署方案的技术决策者而言,这份关于性能边界与性价比的实测报告,提供了比官方宣传更直观的参考坐标。

AA-Omniscience Index 衡量知识的可靠性与幻觉情况,奖励正确回答,惩罚幻觉,且对拒绝回答不施加任何惩罚。
  1. simonw

    这是 "max" 推理设置的页面。xhigh 的页面是 https://artificialanalysis.ai/models/claude-opus-5-5-xhigh,而 medium(默认设置)的页面是 https://artificialanalysis.ai/models/claude-opus-5-5-medium

    我用 max 设置尝试生成 "一只骑自行车的鹈鹕的 SVG" 失败了两次,因为两次都在它还在分析问题时就耗尽了 128,000 个 token 的预算。

    我怀疑 "max" 可能几乎毫无用处,如果它这么容易就陷入过度思考,以至于根本给不出回应。

    其中一次尝试的完整记录在这里——展开 "Reasoning trace" 部分即可看到:https://tools.simonwillison.net/markdown-svg-renderer?url=ht...

  2. lhk931122

    它的能力绝对不应该比 Fable 更强。这看起来像是一个紧密的对比,但我找不到具体细节。我会用它来测试一下实际感知到的性能。

  3. breckenedge

    这些评测会在发布几周后重新运行吗?我昨天开始用我们内部数据集做这件事,发现 Sol 的性能已经回退到和 Luna 持平了。当然这只是单次运行,但我越来越担心的一点是:模型提供商急于证明他们是最强的,用户纷纷切换过去,然后他们就把地毯抽走了。

  4. dogscatstrees

    Opus 5.5 的输出风格和简洁度相比 Opus 5 有了非常大的提升。我预测 Opus 5 将会是一个突然被大量用户抛弃的版本。

  5. hglaser

    与 Opus 5 相比,在高强度任务对高强度任务的对比下,单次任务成本减半。这真的很棒。

    编辑:https://artificialanalysis.ai/models/claude-opus-5-5?models=...

同日更多故事

2026-09-22