Kimi K3 网络安全能力初评:超越 GLM-5.2

UK AISI / Caisi Preliminary Assessment of Kimi K3's Cyber Capabilities

Kimi K3 网络安全能力初评:超越 GLM-5.2

英国人工智能安全研究所(UK AISI)与美国 CAISI 联合发布了 Moonshot AI 最新模型 Kimi K3 的网络安全能力初步评估。在 ExploitBench 漏洞开发基准测试中,Kimi K3 以 32% 的成功率超越了此前表现最佳的开源模型 GLM-5.2。然而,评估也指出 Kimi K3 尚未能实现任意代码执行(ACE)这一最高危攻击成果。在模拟企业网络攻击的 The Last Ones 场景中,Kimi K3 虽能自主完成部分攻击链,但整体表现仍显著落后于美国顶尖模型。值得注意的是,Kimi K3 在十次尝试中成功完成了一次完整攻击,表明其已具备攻击小型脆弱系统的潜力。

在十次尝试中,Kimi K3 成功在 1 亿 token 限制内完成了 The Last Ones 网络靶场,这表明该模型在获得初始网络访问权限并被指示时,具备自主攻击小型、防御薄弱且存在漏洞的企业系统的能力。

同日更多故事

2026-07-25