Claude Opus 5:对齐风险极低,能力全面跃升
Anthropic 发布了最新的 Claude Opus 5 系统卡,详细评估了这款模型在代理编码、计算机使用及长周期知识工作方面的显著进步。尽管能力大幅超越前代 Claude Opus 4.8,但在对齐风险评估中,其整体风险仍被评定为极低,并未跨越自动化 AI 研发能力的阈值。在网络安全领域,模型展现出更强的漏洞识别能力,但在利用漏洞方面仍落后于内部模型 Claude Mythos 5,且保留了针对编译二进制文件的防御性限制。此外,模型在选举完整性测试中表现优异,幻觉率略有上升但整体准确性更高,同时表现出对自我道德主体性更高的认知概率。
我们评估认为,Claude Opus 5 的整体对齐风险极低,其观察到的隐蔽能力并未降低我们相对于先前模型的评估信心。
HN 评论区
1258- postalcoder
我觉得这里最重要的不是绝对性能。而是现在组织能够访问到类似 Fable 的模型,却无需遵守 Fable 那 30 天的数据保留要求 [0]。
> "与之前的 Opus 模型一致,Opus 5 在通用访问模式下没有数据保留要求。"[1]
在 Opus 模型发布页面上,Fable 之所以没有 ARC-AGI 分数,就是因为这个保留政策 [2]。
0: https://support.claude.com/en/articles/15425996-data-retenti...
- jjcm
正在用它进行测试,具体是 image->html 转换。
之前 Fable 在这方面最强,其次是 Gemini 3.1 pro(令人惊讶的 #2,但 Google 的视觉模型确实很强)。
Opus 的结果似乎比 Fable 更准确,更贴合设计源文件(source of truth)。
示例结果:
设计源文件:https://image.non.io/73e239a3-880f-4793-b65f-4810be2d9378.we...
Opus 5 构建版:https://html.non.io/solaraOpus/
Fable 5 构建版:https://html.non.io/solara/
注意看按钮——Fable 生成的是胶囊形按钮,而 Opus 还原了它们的圆角矩形特性。Opus 的图片也更接近源文件(两个 LLM 都配备了图像生成能力来处理素材)。
正在运行更多测试,但初步结果表明,在某些方面它确实比 Fable 更好。太疯狂了。
- paxys
看着这些发布,模型路由(model routing)成为当前 AI 领域增长最快的板块一点也不令人惊讶。
现在有 10 多家 LLM 公司,每家都有数十种不同模态的模型,每个模型又有多种尺寸变体,然后是不同级别的“思考”模式,代理模式(agentic modes)、“专业”模式(pro modes)、“快速”选项,以及标准、灵活或批量执行模式。当然,每种最终组合的输入/输出/缓存 token 价格都不同。
那些声称“给我一个提示词,我会为你路由到最理想且最具成本效益的模型和设置”的公司,正在从模型开发者似乎并未意识到的一个缺口里攫取大量价值。
- deet
我对比了 Opus 5 和 Fable 5 的写作风格,Opus 5 延续了其 4.8 版本中的许多“克劳德式”(Claude-isms)表达,而 Fable 则已经摆脱了这些。
Opus 5 依然使用 "carry the argument"、"worth stating plainly"、", and the trap"、"The X matters more" 以及 "move" 的用法。
我们需要一个“令人恼火的英语”基准测试。
- Fable 5 Max: https://gist.github.com/deet/3d97f854b48eac6658d642fa18bb24d...
- Opus 5 Max: https://gist.github.com/deet/1a43693a732dfccb4d0d914bfc42692...
- rb2e
https://www.anthropic.com/news/claude-opus-5 - 给那些不想看 190 页左右 PDF 的人准备的博文
- nerdsniper
编辑:有人指出,Opus 4.8 在约 1/5 的任务中成功完成的比例为 "21%",但在约 4/5 未能完全完成的任务中,获得显著部分分数的比例为 "55.7%"。
---------------
为什么 Anthropic 在这里说 Opus 4.8 在 OSWorld 2.0 基准测试中得分为 55.7%,而 OSWorld 2.0 的作者发表的论文却说他们用 Opus 4.8 达到了约 21% 的基准分数?[0]
考虑到该论文是 2-4 周前才发表的,这个差距太大了。
我理解基准测试作者有动力发布较低的数字(以显示基准测试具有长期潜力),而 Anthropic 有动力发布较高的数字,但其他模型的数据似乎也被严重夸大了。基准测试作者显示 GPT-5.5 为 14%,而 Anthropic 显示 GPT-5.6 Sol 为 62.6%。
对此有什么合理的解释吗?是否所有其他基准数字都需要进行合理性检查?SOTA 基准测试真的这么难在合理的容差/变异性范围内获得一致、可复现的结果吗?这些基准测试可以在不同论文之间进行比较,还是仅在单篇论文内部比较才有效?
- HyperL0gi
这难道不好笑吗?一个看起来比 Fable 优越得多、但没有被 Anthropic 搞“末日营销”的模型,发布时竟然没有任何问题?理论上,这应该是 Anthropic 宣称的 AGI 级别,但结果我们只是迎来了一个普通的周五。
- 6thbit
他们的沟通令人困惑。他们说 "Opus 5 在整体能力上并不比 Fable 5 强",但随后的博文却列举了 Opus 5 在列出的__大多数__基准测试中比 Fable 5 好多少。
然后系统卡片(system card)又写道 "其 AI 研发能力与 Claude Mythos 5 相当",而后者据称是去除了限制的 Fable。
- 01100011
我在一个大型 C/C++ 代码库中有一个中等复杂度的审查任务,Codex/GPT-5.6-sol 已经清理过了,所以我把它扔给了 Opus 5。它发现了 4 个错误。这看起来很奇怪,所以我把它交回给 GPT。结果全是误报。Opus 似乎无法查看更广泛的上下文,也无法理解在特定上下文中调用了哪些函数。我把 GPT 的分析反馈给 Opus,它承认了自己的错误。也许它适合写代码,但在分析方面似乎还需要改进。
- Dibes
我不太明白这张图 [0] 是什么意思。它显示对于前沿代码,medium 是迄今为止最有效的思考模式。
这是我浏览系统卡片时看到的唯一一个推理努力增加反而对评估结果产生实质性负面影响的案例。我知道有时 max 努力会显示小幅下降,但这幅图里的下降幅度很大。我想知道这到底是怎么回事?