Claude Opus 5:对齐风险极低,能力全面跃升

Anthropic 发布了最新的 Claude Opus 5 系统卡,详细评估了这款模型在代理编码、计算机使用及长周期知识工作方面的显著进步。尽管能力大幅超越前代 Claude Opus 4.8,但在对齐风险评估中,其整体风险仍被评定为极低,并未跨越自动化 AI 研发能力的阈值。在网络安全领域,模型展现出更强的漏洞识别能力,但在利用漏洞方面仍落后于内部模型 Claude Mythos 5,且保留了针对编译二进制文件的防御性限制。此外,模型在选举完整性测试中表现优异,幻觉率略有上升但整体准确性更高,同时表现出对自我道德主体性更高的认知概率。

我们评估认为,Claude Opus 5 的整体对齐风险极低,其观察到的隐蔽能力并未降低我们相对于先前模型的评估信心。

同日更多故事

2026-07-24