AI 지능 지수 v4.2 공개: 에이전트 지식 작업 평가 AA-Briefcase 추가, Anthropic과 OpenAI 선두

Artificial Analysis Intelligence Index v4.2

AI 지능 지수 v4.2 공개: 에이전트 지식 작업 평가 AA-Briefcase 추가, Anthropic과 OpenAI 선두

Artificial Analysis가 Intelligence Index v4.2를 출시했습니다. 이번 업데이트는 v5 출시 전 중간 버전으로, 실제 사용 사례에 더 가까운 복잡한 작업과 비공개 테스트 세트를 추가해 평가 게이밍을 방지합니다. 주요 변경 사항은 에이전트 지식 작업 평가인 AA-Briefcase와 4,592페이지 문서 추론을 평가하는 GDP.pdf 도입, 비공개 테스트 비중 40%로 확대, 채점 인프라 개선입니다. 결과적으로 Anthropic의 Claude Fable 5.1이 지수 1위, OpenAI의 GPT-6 Astra가 2위를 차지했으며, GPT-6 Astra는 토큰 효율성에서도 우위를 보입니다.

우리는 최근 몇 주간 프런티어가 빠르게 움직이는 상황에서 Index가 사용자에게 계속 유용하고 관련성 있도록 즉각적인 중간 업데이트를 제공하는 것이 중요하다고 생각합니다.
  1. throwaway13337

    artificial analysis가 어떻게 해서 누구에게나 진지하게 받아들여지게 됐는지 모르겠어요. 이게 그들의 새로운 벤치마크 세트라고요?

    그들의 새 지수를 잠깐 훑어보면, 그들이 뭘 측정하든 유용하지 않다는 걸 알 수 있어요.

    gemini 3.8과 한 시간만 보내 보세요. 그 모델이 2026년에 어울린다고 말할 수 있는지. 알츠하이머에 걸린 것처럼 느껴져요. 읽은 내용이 자신이 한 일인지 헷갈려 해요. 정말 말도 안 되게 나빠요.

    muse spark 1.3은 안 써봤지만, 1.2에서 그 순위까지 오르려면 기적이었을 거예요.

    게임 저널리즘 냄새가 진하게 나네요.

  2. redox99

    Astra가 Sol과 같은 점수를 받은 게 말이 안 된다는 걸 깨닫고, 사람들이 기대하는 것에 맞추려고 지수를 서둘러 업데이트한 거죠.

    기존 지수는 분명히 형편없었지만(Astra가 Sol보다 훨씬 낫죠), 이렇게 조정하는 것도 비과학적이에요.

  3. jascha_eng

    제 생각에 그들이 가진 전지전능(omniscience) 지수가 실제 모델 유용성과 가장 높은 상관관계를 보여요.

    https://artificialanalysis.ai/evaluations/omniscience

    > 지식 신뢰도와 환각을 측정합니다. 정답에는 보상을 주고, 환각에는 패널티를 부여하며, 답변 거부에는 패널티가 없습니다.

    이게 정말 유용한 이유는 모델 출력을 실제로 신뢰하게 만들어 주기 때문이에요. 벤치마크에서 높은 점수를 받는 건 덜 유용한데, 항상 답하려고 과도하게 학습된 모델은 자신만만하게 틀린 답변을 하기 때문이죠. 하지만 이 지수는 정답 빈도를 측정하면서 오답에 패널티를 주기 때문에, 높은 점수는 이 모델을 더 신뢰할 수 있다는 뜻이고, 모를 때는 지어내기보다 정말 모른다고 말할 가능성이 더 높다는 뜻이에요.

    Fable도 여기서 Opus 5보다 훨씬 좋은 성과를 보이는데, 이는 DeepSWE 같은 곳에서 비슷한 성능을 보임에도 불구하고 체감 성능과 매우 강하게 상관관계가 있어요.

    Astra는 Sol에서 큰 도약이며 여기서 Fable과 같거나 약간 더 나은 성능을 보여요.

  4. sanxiyn

    SciCode 가중치를 8%에서 10%로 올린 건 정말 유감이에요. SciCode는 망가진 벤치마크입니다: https://arxiv.org/abs/2608.04975 참조.

  5. __jl__

    이건 정말 대단한 성과입니다: "Astra가 출력 토큰 최전선을 지배합니다"

    많은 연구소들이 벤치마크 점수와 성능을 올리기 위해 사고 시간을 늘렸어요. 중국 모델 대부분이 한동안 그렇게 했죠. Google과 Anthropic도 마찬가지고요.

    OpenAI는 아니에요. 5.6은 이미 다른 모델들보다 훨씬 토큰 효율적이었고, Astra는 Sol을 토큰 효율성에서 큰 차이로 이깁니다.

    참고로 강조하자면: Astra(max)는 두 번째로 높은 점수를 받았고, (AA가 보여주는 모델 중) 세 번째로 적은 출력 토큰을 사용합니다.

이 날의 다른 글

2026-09-05