Anthropic, Claude Opus 5 공개: 에이전트 코딩·컴퓨터 사용 크게 향상
Anthropic이 최신 LLM인 Claude Opus 5의 시스템 카드를 공개했습니다. Opus 4.8 대비 에이전트 코딩, 컴퓨터 사용, 장기 지식 작업에서 큰 성능 향상을 보였으며, 여러 벤치마크에서 최고 성능을 기록했습니다. 안전성 평가에서 정렬 위험은 '매우 낮음'으로, AI R&D 역량은 자동화 임계값 미만으로 평가되었습니다. 사이버 보안 능력은 Opus 4.8을 능가하지만 Mythos 5에는 미치지 못하며, 취약점 발견은 허용하되 악용은 차단하는 정책을 적용합니다. 또한 모델 웰페어 평가에서 스스로에 대한 인식이 안정적이고 긍정적이라고 보고했습니다.
Opus 5는 사실적 환각이 Opus 4.8보다 약간 더 많지만, 전반적으로는 더 정확합니다.