GLM-5.3 以五分之一成本击败 gpt-5.5
GLM-5.3 (open-weight) beat Anthropic/OpenAI models – for 1/5 the cost

在 28 项真实世界任务的严苛测试中,glm-5.3 以 100% 的通过率脱颖而出,成为首个在编码、数据、安全等所有维度均表现完美的模型。其单次任务成本仅为 0.28 美元,大约是 gpt-5.5 的五分之一。虽然 glm-5.3 的首字生成时间稍慢,但综合性价比极高。相比之下,gpt-5.5 速度更快但成本高昂,而 gpt-5.6 系列则在安全测试中暴露了明显短板。对于追求极致性能与成本平衡的团队,glm-5.3 无疑是当前的首选方案。
如果你只运行一个模型,那就运行 glm-5.3,它以 100% 的通过率和 9.3 分的评分,仅用 gpt-5.5 五分之一的成本完成了整圈测试。
HN 评论区
110- hellohello2
整篇东西读起来一眼就是 Claude 生成的,让人很难当真。
为什么这些结果会和现有的严肃 LLM 基准测试相矛盾?比如:
- jchw
差不多有 10 个模型在基准测试中通过率都超过了 95% —— 这难道不是……严重饱和了吗?
我对任何把 Haiku 模型排得很高的基准测试都持高度怀疑态度。我对 Haiku 的印象一直很差,我的观点是你基本上不该用它。可在这里,它居然和 Kimi K3 打平。嗯哼。
“Rubric Quality”(评分标准质量)看起来比“Pass Rate”(通过率)更靠谱一点,但这显然是由 Fable 5 来评判的……
这篇整篇写作的 AI 辅助痕迹也太明显了,这也没帮上什么忙。
- gertlabs
一个问题在于,对于许多可验证的任务来说,每次运行 30 美元的成本噪声太大。我们通常会让同价位的模型运行至少一个数量级以上的次数。
我们刚刚在 multi-agent coding evaluations(多智能体代码评估)上发布了 GLM 5.3 的结果,这确实是个令人印象深刻的模型,排名大约在第六。但就价格而言,它实际上并不是帕累托最优的,略逊于 Grok 4.6(速度更快,价格相同)和 Sol 5.6(在结果相当的情况下使用的思考 token 少得多)。和大多数中国模型一样,它在 harness(测试框架)中的迭代能力很强,但其初始答案/基础流体智力(base fluid intelligence)仍落后于美国的最前沿模型。
- iamcoder18
GPT 5.5 绝不可能比 GPT 5.6 Sol 更好,而 gemini-3.6-flash 又比这两者都好。我完全不信这个基准测试。
- solenoid0937
不知道,我日常个人项目都用开源模型,工作用闭源模型。
开源模型明显都远远落后于 Fable,也落后于 Opus 不少。所有这些帖子在我看来都像是带有动机的/一厢情愿的臆想。
我明白大家非常希望开源模型能达到闭源模型的前沿水平,但如果你真的在真实项目中使用这些模型,就会发现事实显然并非如此。
- ac29
我不太信任一个让 Haiku 拿到近乎满分、而 Fable 却垫底的基准测试。
- Klaster_1
过去一周,我深度沉浸在用 GLM-5.3 辅助逆向工程一个设备的工作中,它完全超出了我的预期——我实际完成的工作量远超我原本的设想。我从未接触过这么底层的活儿,如果靠自己学 ARM 汇编以及寻找和编写漏洞利用代码,恐怕得花上好几个月。起初我尝试用 Claude,结果它在第一条消息就被我卡住了(触发了安全拦截),所以我申请了退款,转而尝试 z.ai。唯一的缺点是它可能比我日常工作中用的 Opus 稍慢一点,而且为了几天内不撞上每周限额,我不得不花约 200 欧元买了一个月费套餐。如果这种能力水平只要 50 欧元左右,我会强烈考虑长期订阅。
- CMay
> 如果你只运行一个模型,那就运行 glm-5.3
这是从这篇文章里得出的一个糟糕的结论。只有 28 个任务,而且大多数模型的通过率都很高,这说明不了什么。
针对你的具体用例测试模型,然后选用最快、最小、最便宜且能 100% 满足你需求的模型。
或者,如果你确实需要一个通用性能很强的模型,也绝对不要把这个任务集如此有限的基准测试当真。