PostHog, 추론으로 의사결정 모델 Jeeves 공개…JevBench 하드에서 0.865 달성

Jeeves. Reasoning improves Jev-like decision models

PostHog, 추론으로 의사결정 모델 Jeeves 공개…JevBench 하드에서 0.865 달성

PostHog가 Jev 스타일 의사결정 모델에 추론을 결합한 Jeeves를 공개했다. Qwen3.5-9B 기반 9B 모델로, LoRA와 포인터 헤드를 붙이고 SFT와 CISPO로 훈련했다. 학습에 쓰지 않은 테스트 데이터에서 0.889로 Kev-9B(0.822)와 Jev(0.857)를 앞섰고, JevBench 공개 하드 티어에서도 0.865를 기록했다. 예/아니오, 객관식, 평점 질문을 한 요청에서 처리하며, H100 한 장에서 사고 없이 약 0.3초, 사고 시 중앙값 3.3초가 걸린다. 전체 훈련 코드와 데이터도 함께 공개됐다.

지식 질문에서는 Jev에 뒤진다(MMLU 0.793 대 0.900, MMLU-Pro 0.739 대 0.840).
  1. HarHarVeryFunny

    Jev가 필요 없다고 주장하려는 사람들이 이렇게 많다는 건, 잃을 게 있는 쪽—Anthropic과 OpenAI 직원들—의 astroturfing일 수밖에 없다.

    좋든 싫든, 똑같이 저렴하고 빠른 걸 내놓지 않는 한 기업들은 Jev를 쓸 거다.

    이전에 LLM이 차지하고 있던 비즈니스 자동화 시장에서 얼마나 많은 부분이 위험에 처했는지 궁금하다.

  2. sharih

    이게 p90 17초라면 대체 무슨 의미가 있나? 그럴 바엔 LLM을 쓰는 게 낫지. Jev의 아름다움은 엄청나게 저렴하고 미친 듯이 빠르다는 데 있는데.

  3. TN1ck

    다른 모델들을 테스트할 때 쓰던 벤치마크로 방금 한 번 돌려봤다. (독일 축구 트윗에서 아이러니를 감지하는 건데) 48GB M5 Pro에서 트윗 100개를 판단하는 데 30분 넘게 걸렸다. 생각하는 데 확실히 오래 걸린다.

    성능은 Jev보다 꽤 낮았지만, 내가 테스트한 다른 오픈 의사결정 모델들보다는 높았다 (68개 정답 vs Jev 79개 정답 - [1] 참고). moderation 벤치마크도 돌리고 있는데, 내 컴퓨터에서는 아마 몇 시간 걸릴 듯하다.

    [1] https://tn1ck.com/blog/jevdit

  4. itzikkatz

    멋진 엔지니어링이긴 한데, p90 레이턴시 17초는 빠르고 저렴해야 하는 Jev급 모델의 취지를 무색하게 만든다. 그 와중에 MMLU에서 10점을 잃는 건 더 도움이 안 되고.

  5. thm

    Ask Jeeves - 한 바퀴 돌아 제자리로 오는 데 꼬박 30년이 걸렸네.

이 날의 다른 글

2026-09-29