왜 Opus 5는 작업하기에 더 나빠 보일까?
Why does Opus 5 feel worse to work with?
저자와 동료들은 Opus 5가 Opus 4.7, Opus 4.8, Fable보다 작업하기에 더 나쁘다고 느낍니다. 성능은 더 좋지만, 의도가 불분명할 때 질문을 하지 않고, 가정을 확인하지 않으며, 계획을 임의로 수정하기 때문입니다. 이는 벤치마크 점수를 높이기 위한 훈련이 모델이 모호함에 대해 대담한 가정을 하도록 만들기 때문입니다. 실제 코딩 에이전트에서는 명확한 지시가 어렵기 때문에, 중간에 질문하는 에이전트가 더 신뢰할 만합니다.
실생활은 벤치마크가 아닙니다. 모든 질문에 보장된 정답이 있는 것도 아니고, 정답 집합조차 없을 수 있으며, 실제 결과가 걸려 있는 상황에서 에이전트가 최선의 추측만 하길 원하지 않습니다.