Jev는 확률 분포를 제대로 맞추지 못한다
How accurately calibrated is Jev?

TypeSafe의 System One 분류 모델 Jev가 물리 문제에서 반환하는 확률 분포의 정확도를 1,000개 설정으로 테스트했다. Jev는 균일 분포에서 TV 0.77을 기록했고, 푸아송 분포에서는 0.65로 무작위 추측(0.64)과 비슷했다. 또한 분포를 지나치게 뾰족하게 예측하고 꼬리 부분에 불필요한 확률을 할당하는 경향을 보였다. 저자는 JevEval과 같은 자동 평가 도구의 신뢰성에 의문을 제기한다.
Jev가 완전히 포기하고 가능한 모든 선택에 확률을 균등하게 분배한다면 평균 TV는 0.546이 된다. 하지만 Jev는 0.518을 기록한다.
HN 토론
13- clarle
인간에게 물어보는 것도 같은 종류의 문제를 겪지 않을까?
인간 집단에게 동전 던지기의 앞면 또는 뒷면에 대한 무작위 분포를 생성하라고 요청하면, 실제 동전 던지기의 분포와 비슷하지 않을 것이다. 왜냐하면 우리도 우리만의 편향을 가지고 있기 때문이다. [1]
[1] "앞면이야 뒷면이야?"--이진 선택에서의 도달 가능성 편향" - https://pubmed.ncbi.nlm.nih.gov/24773285/
- amluto
나는 이 상황을 계속 생각해 왔다. 저자가 Jev 같은 모델에서 원하는 것은 내가 원하는 것과 전혀 다르다고 생각한다.
> 나는 답이 잘 알려진 질문들로 이것을 확인해 보기로 했다. 예를 들어:
> 질량 m인 고전 입자가 온도 T에서 열역학적 평형 상태에 있는 계에 놓여 있다. 이 입자의 속도 v는 얼마인가?
이것을 모델에 입력하면, 내가 원하는 답은 "모델과 주어진 상태의 조합은 당신의 사전 지식에 유용하게 더할 것이 없다"이다.
만약 내가 맥스웰-볼츠만 분포를 알고 싶다면, 찾아보거나 유도하거나 아니면 멋진 LLM에게 대신 해달라고 요청할 수 있다(추론 토큰과 시간을 좀 써야 한다 – 초고속 추론 시스템을 쓰지 않는 한, 50ms 안에 이 답을 얻지는 못한다). [0]
비슷하게, 들어오는 고객 지원 요청 중 73%가 스팸/사기라는 것을 알고 싶다면, 그것을 측정해야 한다 – 그것은 내 시스템의 속성이고, 수동 분류와 데이터베이스 쿼리가 필요하며, 당신의 고객 지원 시스템이 보게 될 비율과는 다른 비율일 것이다. 나는 내 분류기가 이것을 알기를 기대하지도 않고 원하지도 않는다(내 데이터로 수동 학습된 전통적인 분류기를 사용하지 않는 한, 그리고 Jev의 요점은 바로 이것을 피하는 것이다).
Jev 같은 시스템에서 내가 원하는 것은 내가 제공하는 샘플별 데이터의 결과로 확률이 어떻게 변하는지 알려주는 것이다. 그리고 이 볼츠만 분포 질문의 경우, 그것은 아무것도 아니다: 나는 아무 데이터도 제공하지 않았고 분류기는 아무것도 추론할 수 없다.
[0] 재 [...]
- dvt
> 그래서 Jev는 실제로 어떤 분포가 올바른지 알고 있지만, 그것을 생성하는 데 실패한다
이런 주장은 깊이 분석될 필요가 있다. 모델에는 창발적 능력[1]이 있고, 의미론이 실제로 학습된다는 것을 보여주는 많은 증거가 있다고 생각한다(Word2Vec). 그리고 일부 수학도 학습될 수 있는 것처럼 보인다(예: 모듈러 산술). 하지만 진정한 답을 생성하는 내부 메커니즘이 어디에 있는지, 그리고 단지 어떤 분포에 운이 좋아서 답이 맞아 보이는 것인지 정확히 말하기는 어렵다.