JevBench v1.3.0, 52개 시스템 중 Jev 1.13.0이 1위

Show HN: JevBench, a reproducible benchmark for typed decision models

JevBench v1.3.0, 52개 시스템 중 Jev 1.13.0이 1위

Benchmark Heaven이 자체적으로 만든 JevBench v1.3.0은 534개의 의사결정(220개 고난도 포함)에 대해 52개 시스템을 평가하고, Intelligence·Calibration·Speed·Cost를 각 25%씩 기하평균한 JevBench Score로 순위를 매긴다. TypeSafe의 Jev 1.13.0이 74.4점으로 1위를 차지했고, SemIf(Qwen3.5-4B)가 73.1점, djev(Maisa, diffusion-gemma)가 73.0점으로 그 뒤를 이었다. GPT-5.6 Luna(low)는 Intelligence 95로 가장 높았지만 비용 효율에서 밀려 14위에 머물렀다. 모든 결과는 독일 서버에서 한 번에 하나의 요청으로 실행되었으며, 하네스와 태스크, 채점 규칙은 MIT 라이선스로 공개되어 있다.

JevBench는 Jev급 의사결정 모델을 위한 Benchmark Heaven 자체 벤치마크로, 상태와 제한된 루브릭을 입력하면 타입이 지정된 답이 나온다.

이 날의 다른 글

2026-09-22