GLM-5.3 오픈웨이트 모델, Anthropic·OpenAI 능가—비용은 1/5
GLM-5.3 (open-weight) beat Anthropic/OpenAI models – for 1/5 the cost

에드 야우(Ed Yau)가 운영하는 Ed-o-meter 리더보드가 17개 주요 LLM을 28개 실제 업무 과제로 평가한 결과, 오픈웨이트 모델 GLM-5.3이 100% 통과율과 9.3점(루브릭)을 기록하며 1위를 차지했다. 전체 비용은 0.28달러로, GPT-5.5의 약 5분의 1 수준이다. GPT-5.5는 더 빠른 응답(13.2초)을 제공하지만 비용이 1.43달러로 높다. 저비용 워크호스로는 GPT-5.6-luna(0.064달러)가 꼽혔고, 품질 대비 속도는 kimi-k3가 루브릭 9.5로 최고를 기록했다. 다만 fable-5와 opus-5는 일부 작업을 거부해 순위가 낮아졌으며, GPT-5.6 계열은 보안 취약점이 드러났다.
glm-5.3은 보드에서 처음으로 코딩, 데이터, 실제 세계, 보안, 도구 사용 등 다섯 가지 코너를 모두 100%로 통과한 모델이다.
HN 토론
110- hellohello2
이건 전체적으로 Claude가 생성한 것처럼 읽혀서 진지하게 받아들이기 어렵네요.
왜 이런 결과들이 LLM을 벤치마킹하는 기존의 진지한 시도들과 모순될까요? 즉:
- jchw
거의 10개의 모델이 >95%의 벤치마크를 통과하고 있는데, 이건... 상당히 과포화된 거 아닌가요?
저는 또한 Haiku 모델을 매우 높게 평가하는 벤치마크에 대해 정말 회의적입니다. 저는 Haiku에 대해 철저히 실망했고, 기본적으로 사용하면 안 된다는 의견을 가지고 있습니다. 그런데 여기서는 Kimi K3와 동률을 이루네요. 흠.
'Rubric Quality'는 'Pass Rate'보다 조금 더 현실적으로 보이지만, 분명히 Fable 5에 의해 평가된 것 같습니다...
이 전체 글도 분명히 매우 많이 AI의 도움을 받은 것처럼 보여서, 신뢰도에 도움이 되지 않습니다.
- gertlabs
한 가지 문제는 실행당 30달러가 많은 검증 가능한 작업에 대해 정말 노이즈가 크다는 것입니다. 우리의 경우 GLM 5.3 가격대의 모델에 대해 보통 최소한 한 자릿수 이상 더 많은 비용이 듭니다.
우리는 방금 멀티 에이전트 코딩 평가에서 GLM 5.3 결과를 발표했는데, 확실히 인상적인 모델로 약 6위에 올랐습니다. 가격 대비로는 실제로 파레토 최적이 아니며, Grok 4.6(더 빠르고 같은 가격)과 Sol 5.6(비슷한 결과에 훨씬 적은 추론 토큰 사용)에 약간 뒤처집니다. 대부분의 중국 모델과 마찬가지로, 하네스에서 반복하는 데 뛰어나지만 첫 답변/기본 유동 지능은 미국의 프론티어보다 아래입니다.
- iamcoder18
GPT 5.5가 GPT 5.6 Sol보다 낫다는 것은 말도 안 되고, gemini-3.6-flash가 둘 다보다 낫다는 것도 말도 안 됩니다. 저는 이 벤치마크를 전혀 신뢰하지 않겠습니다.
- solenoid0937
모르겠어요, 저는 개인 프로젝트에는 매일 오픈 모델을 사용하고, 업무에는 클로즈드 모델을 사용합니다.
오픈 모델은 확실히 Fable보다 훨씬 뒤떨어져 있고 Opus보다도 상당히 뒤떨어져 있습니다. 이 모든 게시물은 동기 부여된/희망적인 생각처럼 읽힙니다.
사람들이 오픈 프론티어가 클로즈드 프론티어와 같은 수준이기를 간절히 바라는 건 이해하지만, 실제 프로젝트에서 모델을 사용해 보면 그렇지 않다는 것이 너무 명백합니다.
- ac29
Haiku가 거의 완벽한 점수를 받고 Fable이 꼴찌로 동률인 벤치마크는 신뢰할 수 없을 것 같네요.
- Klaster_1
지난 주 동안 저는 GLM-5.3의 도움으로 기기를 리버스 엔지니어링하는 일에 깊이 몰두했고, 제 기대를 훨씬 뛰어넘었습니다. 실제로 제가 생각했던 것보다 훨씬 더 많은 것을 성취할 수 있었습니다. 저는 이런 저수준 작업을 해본 적이 없어서 ARM 어셈블리를 배우고 취약점을 찾고 익스플로잇을 작성하는 데 몇 달이 걸렸을 것입니다. 처음에는 Claude로 시도했지만, 첫 메시지에서 차단되어 환불을 받고 z.ai를 사용해 보기로 했습니다. 유일한 단점은 제 직장에서 쓰는 Opus보다 조금 느릴 수 있다는 점과 주간 한도에 며칠 만에 부딪히지 않으려고 월간 요금제로 약 200유로를 지불해야 했다는 점입니다. 이 정도 성능이 50유로 정도라면 장기 구독을 진지하게 고려했을 것입니다.
- CMay
> 하나의 모델을 실행한다면 glm-5.3을 실행하세요
이건 이 글에서 얻을 수 있는 끔찍한 결론입니다. 28개의 작업과 대부분의 모델에 대한 높은 통과율로는 거의 아무것도 알 수 없습니다.
사용 사례에 맞는 모델을 테스트하고, 사용 사례를 100% 충족하는 가장 빠르고 작고 저렴한 모델을 사용하세요.
또는 정말로 강력한 일반화 성능을 가진 모델이 필요하다면, 이렇게 제한된 작업 세트로 이런 벤치마크를 진지하게 받아들이지 마세요.