GLM-5.3 智能与成本深度解析

GLM-5.3 Artificial Analysis Benchmarks

GLM-5.3 智能与成本深度解析

Artificial Analysis 发布了针对 GLM-5.3 (max) 的最新评测,通过其 v4.1.1 版智能指数,从 GDPval-AA v2、Terminal-Bench v2.1 到 GPQA Diamond 等九大维度,全方位拆解了该模型的推理能力与知识可靠性。报告不仅对比了开源与闭源模型的权重差异,更通过 AA-Omniscience 指数量化了幻觉率,揭示了模型在长上下文推理中的真实表现。更关键的是,文章深入分析了每单位智能任务的 Token 消耗与美元成本,帮助开发者在性能与价格之间找到最优的帕累托前沿。对于关注大模型落地成本与效能的团队而言,这份数据提供了极具参考价值的决策依据。

虽然模型智能通常能跨应用场景转化,但针对特定用例,某些评估指标可能更为关键。
  1. scotttrinh

    我喜欢按‘单次任务成本’和‘单次任务输出 Token 数’这两个指标来对比模型,因为它们衡量了我关心的两点:成本效率和 Token 效率。以下是 GLM-5.3 与其他得分相近的模型,以及与 GLM-5.2 的对比,方便关注这些指标的朋友少点几次鼠标:

    模型 得分 单次任务成本 单次任务输出 Token 数

    -------------------------------------------------------------------------

    GLM-5.3 (max) 59.5 $0.68 41,107

    GLM-5.2 (max) 53.0 $0.56 32,200

    Claude Opus 5 (high) 61.5 $1.52 21,353

    GPT-5.6 Sol (max) 60.9 $1.23 16,879

    Grok 4.6 (high) 60.9 $0.84 21,735

    Kimi K3 (max) 59.7 $0.84 25,474

    GPT-5.6 Sol (xhigh) 59.0 $0.87 11,098

    Claude Opus 5 (medium) 58.6 $0.98 12,459

    Qwen3.8 Max 58.1 $1.13 38,287

    Qwen3.8 2.4T A95B 57.7 $0.95 32,472

    Claude Opus 4.8 (max) 57.3 $1.65 33,557

    GPT-5.6 Sol (high) 57.3 $0.52 7,545

    Muse Spark 1.2 (xhigh) 56.8 $0.40 30,430

    GPT […]

  2. glub

    我在 GLM 5.3 发布当天就测试过了,Artificial Analysis 的分析非常准确。这确实是个好模型。

    但我最大的感触其实是另一件事。我用闭源模型太久了,都快忘了看到推理过程 Token 是什么感觉。

    用 GPT 或 Claude 时,你只能寄希望于意图被准确捕捉,Agent 拥有所有信息和所需工具,因为直到它胡乱输出几百万个 Token、浪费几百美元、运行了 8 个小时后,你才会看到类似“嗯,看来这里没有 nix flake,我不应该全局安装某个东西”这样的内容。而用 GLM 这类模型,你直接就能在问题刚萌芽时就将其掐灭。

  3. yipinwong

    不过话说回来,我目前还找不到理由从极其廉价的 Luna 模型换过去,那个模型相当“智能”,而且很契合我的工作流。

  4. Escapade5160

    Sol 是个被低估的模型。我今天弃用了 Claude,转投 codex。再也没了 Claude 那些令人作呕的矫揉造作的文风。

  5. BinRoo

    小心那些列出的基准测试。比如 SciCode 和 EnterpriseOps:https://shukla.io/blog/2026-08/gym.html

同日更多故事

2026-08-18