모델이 멍청해진 게 아니라, 추론 방식이 바뀐 것이다

Fable 5 – Median thinking declined in August

한 사용자가 6주간 데이터를 수집·분석한 결과, 모델의 추론 능력이 8월 한 달 내내 하락했고 여러 날에 걸쳐 변동했다. 일부 변동은 특정 제품 발표·출시와 맞물렸다. 그는 xhigh나 max effort 수준을 꾸준히 사용했지만, 실제 호출 대부분은 사고 토큰을 거의 받지 못했고 긴 추론이 이뤄진 경우도 공개된 벤치마크 수준에 거의 도달하지 못했다고 밝혔다. 결론은 모델이 너프됐는지 묻지 말고, 어떤 추론 체제(inference regime)를 제공받았는지 물어야 한다는 것이다.

다음에 모델이 더 멍청하게 느껴질 때, 모델이 '너프'됐는지 묻지 마라. 대신 당신이 어떤 추론 체제(inference regime)를 제공받았는지 물어라.

이 날의 다른 글

2026-09-21