Qwen3.8 27B 在 Artificial Analysis 获 52 分

Qwen3.8 27B scores 52 on Artificial Analysis

Qwen3.8 27B 在 Artificial Analysis 获 52 分

Artificial Analysis 发布了最新的 Intelligence Index v4.1.1 评估报告,Qwen3.8 27B 模型在综合智能指数中取得了 52 分的成绩。该指数涵盖了 GDPval-AA v2、GPQA Diamond、Humanity's Last Exam 等九项严苛测试,全面衡量了模型在推理、知识可靠性及幻觉控制方面的表现。报告不仅对比了开源与闭源模型的智能差异,还深入分析了每单位智能指数的运行成本与 Token 消耗。数据显示,Qwen3.8 27B 在保持高推理能力的同时,展现了极具竞争力的性价比,为开发者在 RAG 工作流和复杂任务处理中提供了新的选择。

AA-Omniscience Index 越高越好,它衡量知识的可靠性与幻觉程度,奖励正确回答,惩罚幻觉,且对拒绝回答不扣分。
  1. beltsazar

    作为对比,Qwen3.6 27B 的得分为 38,这在它所属的小模型类别(4B–40B)中是最高的。

    Qwen3.8 27B 则超越了所有中型模型(40B–150B)。它的得分与 DeepSeek V4 Flash 0731 持平,后者在大模型类别(> 150B)中排名第 5。

    来源:

    - https://artificialanalysis.ai/models/open-source/small

    - https://artificialanalysis.ai/models/open-source/medium

    - https://artificialanalysis.ai/models/open-source/large

  2. Balinares

    再次证明,Qwen 3.8 27B 击败了 Opus 4.6,这到底是怎么回事。

    既好笑又有点吓人,我到现在还不敢相信。这模型在游戏 PC 上就能跑得不错!Opus 4.6 才发布 6 个月,当时还被广泛认为是以绝对优势领先的 SOTA(最先进模型)!他们到底是怎么把相当于 2026 年 2 月前沿 SOTA 水平的能力塞进 27B 参数的?!

    更重要的是,既然一个足够好的模型能在几年前发布的 GPU 上运行,那投入史无前例的巨额债务去建设怪兽级数据中心还有什么意义?

    接下来的几个月肯定会很精彩,毫无疑问……

  3. x313

    我上周末大量使用了这个模型,它真的很聪明,也很怪异。

    在高级推理层面,它表现得非常有“代理感”(agentic)。像目标追踪和工具调用这些基础功能它做得很好,但不仅如此,它对解决问题有着近乎痴迷的执着,为了找到解决方案会做出一些疯狂或不寻常的事情。这实际上让我想起了 GPT-5.6-Sol-max,后者同样有着这种痴迷特质。

    它得分超过 Opus 4.6 一点也不让我惊讶。Opus 的世界知识要好得多,但在代理任务上更像“人”——有点懒惰且缺乏创造力,基本上在显而易见的方案失败后就放弃了。这些新模型更像是在施法,它们在寻找解决方案时是如此富有创造力和坚持不懈。

  4. K0IN

    我大量使用了 Qwen 3.6 27B(超过 10 亿 token)和 DeepSeek V4 Flash(旧版也用了 20 亿+ token)。

    我实在无法理解新的 3.8 版本竟然击败了新的 DeepSeek V4 Flash(在我看来,后者是最好的日常 coding 模型之一)。

    这发布太疯狂了,而且尺寸非常适合日常/本地使用。

    不过我会对这个模型进行广泛测试。

  5. kmike84

    我有一个内部自动化基准测试,大致遵循我的工作流,我一直在上面测试各种本地和云端模型。Qwen 3.8 27B 表现非常出色。它的理解是正确的,研究能力比例如 glm 的更强(我很喜欢 glm),实现过程也很好且谨慎。

    Qwen 3.8 27B 看起来并没有为了刷分而优化(benchmaxxed)。这些

同日更多故事

2026-08-17