Qwen3.8 Max 登顶 agentic index 榜首
Qwen3.8 Max now ranked as the best overall model by agentic index

独立评测机构 Artificial Analysis 更新了最新的 agentic index 榜单,Qwen3.8 Max 凭借在 GDPval-AA v2 和 𝜏³-Banking 等关键代理任务中的卓越表现,成功超越众多竞品,荣登综合模型榜首。这次排名不仅反映了 Qwen3.8 Max 在工具调用、自主规划及复杂问题解决上的强大能力,也标志着开源与闭源模型在智能体工作流领域的竞争进入新阶段。对于开发者而言,这意味着在追求高智能与低成本平衡时,Qwen3.8 Max 已成为一个极具竞争力的选择。
Qwen3.8 Max 在代理能力基准测试的加权平均值中表现最佳,代表了 Artificial Analysis Intelligence Index 中的最高水平。
HN 评论区
341- jjcm
这里的主要结论是:中国已经追平了。SOTA 模型之间的差距如此之小,以至于很难从智能层面直接比较——你必须亲自上手体验,看哪个更适合你。
我真正兴奋的是 27B 模型。3.6 依然是本地部署的王者,如果 3.8 能带来同样的改进,它真的能让本地部署成为默认选项。我很想在 3.8 上运行一个完全由本地驱动的持久化 Agent。
- d2p
我点进去看的时候,显示 Qwen 以 55.4 分位居榜首,Opus Max 是 55.3 分。我有截图。
然后我点出去再点回来,排名变了:Qwen 掉到第二,分数变成 58.4,而 Opus Max 以 59.2 分登顶。
两种情况我都有截图。图表上方的描述在两种情况下完全一样:
> Artificial Analysis Agentic Index
> Represents the weighted average of agentic capabilities benchmarks in the Artificial Analysis Intelligence Index (GDPval-AA v2, ³-Banking)
到底发生了什么?分数怎么可能在几秒钟内变化这么大?
- eli
我相信这个结果。它在故障排查方面极其出色。我给 Qwen 和 Kimi K3 布置了同一个令人头疼、复杂且间歇性出现的 Bug 去追踪。Kimi 在理解现有代码方面稍好一些,但 Qwen 构建了一些诊断工具,并对日志数据进行了出色的统计分析。Qwen 离真相更近得多。
我非常期待他们即将发布的更小版本的 Qwen 3.8。如果能轻松在本地运行,那就太棒了。
- onomojo
任何显示 Opus 5 是最佳的基准测试,对我来说都失去了可信度。任何真正每天使用 Opus 5 的人都知道我在说什么。
- seizethecheese
在 Intelligence Index 中,Opus 依然排名第一,其次是 Fable、GPT 5.6、Kimi K3,然后是 Qwen 3.8 max。https://artificialanalysis.ai/#intelligence
我们的排行榜综合了 Arena ELO、AA Intelligence index、延迟和速度,排名如下:
#1 Opus 5
#2 Kimi K3
#3 Qwen3.8 Max
#4 GPT 5.6 Sol
来源:http://pellmell.ai/leaderboard.
这个排名波动很大,取决于当前哪个提供商的吞吐量和延迟表现最好。
- embedding-shape
很奇怪,如果根据他们其中一个指数 Qwen 现在是“最佳”,为什么页面 https://artificialanalysis.ai/agents/coding-agents 甚至一次都没提到 "Qwen"?
- theropost
Anthropic 有点疯了。前几天晚上,我的 Max 账户里有 $260 的额度用于额外使用。眼看就要过期了,我想着启动一个 Agent 群集来深入挖掘并对一些旧的冷代码库做一些深度修改……结果不到 25 分钟,$260 就烧光了。它甚至没进入实施阶段,大部分时间只是写了一堆没用的计划。这真让我大开眼界,看到了他们打算怎么向用户收费……价格简直贵得离谱。
- petercooper
希望这能归结为他们预告的那些小版本。根据我的经验,Qwen 模型最接近某些依赖工具的任务所需的“知识少一点,智能多一点”(是的,这两者高度相关!)的理想状态。即使是 3.5 2B 版本,也能很容易通过提示词让它始终依赖工具,而不是急于得出错误结论(尽管正如你所料,它的实际编码能力非常糟糕)。