GLM-5.3:涌现的网络安全能力

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

GLM-5.3:涌现的网络安全能力

我们仅通过扩大后训练规模就推出了 GLM-5.3。在 GLM-5.2 构建的 IndexShare、SAO 和 slime 技术栈基础上,我们投入更多计算资源在多样化的长周期任务环境中进行训练。结果显示,GLM-5.3 在复杂编码任务上比前代提升 50%,在 Terminal Bench 3.0 等公开基准测试中达到开源最先进水平。更令人意外的是,随着训练规模扩大,模型涌现出强大的网络安全能力,在 CyberGym 漏洞发现基准上表现优异,在利用链上的性能更是翻倍。我们已与多家安全团队合作,在真实代码库中发现了数千个漏洞,部分漏洞潜伏长达 40 年。两周后,在完成安全评估与加固后,我们将开源模型权重。

随着我们扩大后训练规模,网络安全能力的发展速度超出了我们的预期。
  1. leobuskin

    昨天我买了 18 美元的 GLM 官方订阅(5.2 版本,但新版本已经在一些文档中泄露了),并配合 Claude Code 框架搭建好了……结果几乎立刻就升级到了 80 美元的套餐。这是第一个同意进行正规安全研究(红队场景)的模型,执行过程无缝流畅,包括 WP 插件的 0-day 漏洞、RCE、6.8 内核漏洞利用适配等——同时还与另一个充当防守方的 GLM 智能体进行对抗(遵循 HF 的故事线)!

    我理解这类模型可能被恶意行为者利用,但将其公开可用是公平的(万一紧急情况,它也能站在你这边)。我认为,改变世界走向更好的方向的是这种能力,而不是那些安全护栏。

  2. z4y5f3

    看来他们正在大规模扫描开源软件(OSS)和流行软件,并披露发现的漏洞:https://cvd.z.ai/

    其中大多数处于禁运期,但似乎这里有很多来自各类流行软件的 CVE,其中许多被评定为严重或高危。

    我理解“人们没有主动去查找”这个论点,但此类扫描的成本似乎每周都在降低,而且 Anthropic 的 Project Glasswing 项目按理说早就该发现这些了?

  3. aliljet

    这绝对还略逊于 Sol 和 Fable,但也就差那么一点点。结果简直离谱。目前还没有令人信服的经济理由让我们因为那种荒谬的“重置成瘾”而抛弃 OpenAI,但感觉我们正处于临界点。

    大家是如何在本地以超大规模量化(mega quantized)的方式运行这类模型的?距离权重发布才两周,但这目前仍然是 GLM 5.2 加上后训练魔法的产物。

  4. hypfer

    我可能只是带着积极偏见去读这段文字,但有没有可能它写得少了一些硅谷营销垃圾的感觉,更像是研究人员写的?

    它确实让人觉得尊重我和我的时间。

    谢谢,Z.AI。

    当你的组织高层是真正的大学教授时,差别有多大,真是令人惊叹。

  5. aand16

    > Mythos 5 依然遥遥领先,在 181 和 247 项任务中表现突出。这三者的模式是一致的:基准测试在利用链上的位置越高,与封闭前沿的差距就越大。能力增长最快的地方,恰恰是我们落后最远的地方。

    我很欣赏他们没有借此机会自我吹嘘。

  6. jjcm

    和我在 Gemini 3.7 flash 线程里展示的是同一个图像转 HTML 测试。注意 GLM 不是多模态模型,但它仍然通过编写 Python 脚本来检查图像并提取元素,生成了类似的结果。

    原图:https://image.non.io/neonRamenDesigns.webp

    GLM 5.3 构建版:https://html.non.io/neonRamenGLM5.3

    用于对比的 Opus 5 构建版:https://html.non.io/neonRamen

    在没有视觉能力的情况下,它做得非常出色。我很惊讶它能提取出这么多细节。

    Opus 的那个版本仍然明显更好,但这在意料之中,因为它是多模态的。很好奇 Z.ai 未来的版本在这方面会达到什么水平。

  7. wxw

    > 我们对 GLM-5.3 所做的全部就是扩展后训练(Scaling post-training)。

    很喜欢这句开场白。哇,结果真棒。

    > 随着智能体能力的提升,扩展后训练的难点大多从模型本身转移到了环境上。

  8. virgildotcodes

    OpenAI 和 Anthropic 应该直接让人们访问这些网络安全模型。

    否则,我们将面临这样一个世界:攻击者使用开源和闭源模型,而防守方只是一小群维护者,这些人可能高度依赖 Anthropic 和 OpenAI,对于他们来说,仅仅获得批准去使用当月流行的开源模型版本可能并非易事。

  9. vmware508

    苹果明年将发布搭载 M7 芯片的 MacBook Pro / Mac Mini,它们将能够以原生速度在本地运行免费的 LLM。所有软件开发者的笔记本都将被替换为运行本地模型,从而通过取消 Claude Code 订阅来节省大量开支。

    开发者赢了。苹果股价将一飞冲天。其他一切都将下跌。不客气。

  10. bertili

    这大致将与 Kimi K3 持平,但仅使用其三分之一的参数量。

    就在 4 周前,

同日更多故事

2026-08-14