Qwen3.8 Max 登顶 agentic index 榜首

Qwen3.8 Max now ranked as the best overall model by agentic index

Qwen3.8 Max 登顶 agentic index 榜首

独立评测机构 Artificial Analysis 更新了最新的 agentic index 榜单,Qwen3.8 Max 凭借在 GDPval-AA v2 和 𝜏³-Banking 等关键代理任务中的卓越表现,成功超越众多竞品,荣登综合模型榜首。这次排名不仅反映了 Qwen3.8 Max 在工具调用、自主规划及复杂问题解决上的强大能力,也标志着开源与闭源模型在智能体工作流领域的竞争进入新阶段。对于开发者而言,这意味着在追求高智能与低成本平衡时,Qwen3.8 Max 已成为一个极具竞争力的选择。

Qwen3.8 Max 在代理能力基准测试的加权平均值中表现最佳,代表了 Artificial Analysis Intelligence Index 中的最高水平。
  1. jjcm

    这里的主要结论是:中国已经追平了。SOTA 模型之间的差距如此之小,以至于很难从智能层面直接比较——你必须亲自上手体验,看哪个更适合你。

    我真正兴奋的是 27B 模型。3.6 依然是本地部署的王者,如果 3.8 能带来同样的改进,它真的能让本地部署成为默认选项。我很想在 3.8 上运行一个完全由本地驱动的持久化 Agent。

  2. d2p

    我点进去看的时候,显示 Qwen 以 55.4 分位居榜首,Opus Max 是 55.3 分。我有截图。

    然后我点出去再点回来,排名变了:Qwen 掉到第二,分数变成 58.4,而 Opus Max 以 59.2 分登顶。

    两种情况我都有截图。图表上方的描述在两种情况下完全一样:

    > Artificial Analysis Agentic Index

    > Represents the weighted average of agentic capabilities benchmarks in the Artificial Analysis Intelligence Index (GDPval-AA v2, ³-Banking)

    到底发生了什么?分数怎么可能在几秒钟内变化这么大?

  3. eli

    我相信这个结果。它在故障排查方面极其出色。我给 Qwen 和 Kimi K3 布置了同一个令人头疼、复杂且间歇性出现的 Bug 去追踪。Kimi 在理解现有代码方面稍好一些,但 Qwen 构建了一些诊断工具,并对日志数据进行了出色的统计分析。Qwen 离真相更近得多。

    我非常期待他们即将发布的更小版本的 Qwen 3.8。如果能轻松在本地运行,那就太棒了。

  4. onomojo

    任何显示 Opus 5 是最佳的基准测试,对我来说都失去了可信度。任何真正每天使用 Opus 5 的人都知道我在说什么。

  5. seizethecheese

    在 Intelligence Index 中,Opus 依然排名第一,其次是 Fable、GPT 5.6、Kimi K3,然后是 Qwen 3.8 max。https://artificialanalysis.ai/#intelligence

    我们的排行榜综合了 Arena ELO、AA Intelligence index、延迟和速度,排名如下:

    #1 Opus 5

    #2 Kimi K3

    #3 Qwen3.8 Max

    #4 GPT 5.6 Sol

    来源:http://pellmell.ai/leaderboard.

    这个排名波动很大,取决于当前哪个提供商的吞吐量和延迟表现最好。

  6. embedding-shape

    很奇怪,如果根据他们其中一个指数 Qwen 现在是“最佳”,为什么页面 https://artificialanalysis.ai/agents/coding-agents 甚至一次都没提到 "Qwen"?

  7. theropost

    Anthropic 有点疯了。前几天晚上,我的 Max 账户里有 $260 的额度用于额外使用。眼看就要过期了,我想着启动一个 Agent 群集来深入挖掘并对一些旧的冷代码库做一些深度修改……结果不到 25 分钟,$260 就烧光了。它甚至没进入实施阶段,大部分时间只是写了一堆没用的计划。这真让我大开眼界,看到了他们打算怎么向用户收费……价格简直贵得离谱。

  8. petercooper

    希望这能归结为他们预告的那些小版本。根据我的经验,Qwen 模型最接近某些依赖工具的任务所需的“知识少一点,智能多一点”(是的,这两者高度相关!)的理想状态。即使是 3.5 2B 版本,也能很容易通过提示词让它始终依赖工具,而不是急于得出错误结论(尽管正如你所料,它的实际编码能力非常糟糕)。

同日更多故事

2026-08-06