0.8B 모델이 집에서 훈련돼 22ms 만에 결정을 내린다

Jeff – Jev-compatible 0.8B decision models, trained at home, ~30 ms

0.8B 모델이 집에서 훈련돼 22ms 만에 결정을 내린다

Jeff는 Qwen3.5와 Gemma 4를 파인튜닝한 0.8B 및 2B 제로샷 분류 모델로, Jev와 동일한 요청 형식을 사용한다. 상황과 선택지를 설명하면 단일 포워드 패스로 각 선택지에 대한 보정된 확률을 반환한다. RTX PRO 6000에서 약 22ms, Apple M4 Max에서 28ms가 소요된다. 5개 벤치마크에서 0.8B 모델은 79.1%, 2B 모델은 83.1%의 정확도를 기록해 Jev의 83.0%에 근접하거나 능가한다. 모든 훈련은 로컬 하드웨어에서 이루어졌으며, 합성 데이터는 오픈 모델로 생성되었다.

제로샷이란 선택지가 무엇이든 될 수 있음을 의미한다: 지원 대기열, 사용자 의도, 조정 레이블, 음성 명령, 게임 동작 등. 카테고리가 훈련 데이터에 나타날 필요는 없다. 설명하면 Jeff가 선택한다.
  1. adrithmetiqa

    이해가 부족한 점 양해 부탁드립니다만, Jev 같은 기능이 모든 프런티어 모델에 바로 내장되기까지 얼마나 걸릴까요?

  2. AgentMasterRace

    현재 제 사용 사례에서 Jev와 비교해봤는데 매우 부정확합니다. 70% 대 94%. 분류 용도로는 받아들일 수 없습니다.

  3. trebligdivad

    상업용 LLM 사용 중 분류가 차지하는 비중은 얼마나 될까요? 기업들이 완전한 LLM이 필요 없다는 걸 깨달았을 때 비즈니스 AI 지출과 데이터센터 사용량에 무슨 일이 일어날지 궁금해서요.

  4. phlipski

    특정 연령대 분들을 위해 말하자면 - Askjev.com이 아직도 사용 가능하다는 사실이 놀랍습니다.

  5. imranq

    Jev나 의사결정 유형 모델을 스키마 출력 제약을 덧붙인 LLM으로 대체할 수 있다고 말하는 모든 분들은 핵심을 완전히 놓치고 있습니다. 중요한 건 높은 품질과 함께 극단적인 속도와 비용 효율성인데, 이런 KV-cache 트릭을 쓰더라도 LLM으로는 둘 다 얻을 수 없습니다.

  6. velominati

    Typesafe는 Jev의 기반 기술에 대해 꽤 조용히 넘어갔습니다. 속도와 비용을 보면 제 가설은 LLM처럼 토큰을 입력하지 않는다는 겁니다. 즉 모든 단어를 반복하며 각 단어 사이의 연결을 그리는 방식이 아니라는 거죠. 그건 o(n^2) 문제이고, 그래서 LLM이 확장될수록 그렇게 비싼 겁니다.

  7. qtalen

    멋지네요, 마침 로컬에 배포할 수 있는 의사결정 모델을 찾고 있었는데 여기 있네요. 정말 감사합니다!

  8. danbrooks

    이런 유형의 프로젝트는 매우 유용해 보입니다. Jev를 둘러싸고 많은 화제가 있었지만, 로컬에서 실행되고 파인튜닝할 수 있는 모델이 있다는 건 정말 큰 도움이 됩니다.

이 날의 다른 글

2026-09-28