Ask HN: 마지막으로 frontier 모델만이 할 수 있었던 작업은 무엇이었나요?

Ask HN: What was the last task where only a frontier model could do it?

저는 open (weight) 모델이 frontier보다 6개월 뒤처져 있지만 대부분의 '작업'에는 충분하다는 주장을 자주 봅니다. 지난 한 달 동안 GLM/DeepSeek/Kimi/Qwen이 실패하고 Opus/Fable/GPT가 성공한 구체적인 작업이 있었다면 공유해 주시기 바랍니다. 맥락 부족에 대한 불만도 자주 보이므로 템플릿을 제공하겠습니다.

저는 최근에 복잡한 코드베이스에서 미묘한 버그를 찾는 작업을 했습니다. DeepSeek은 원인을 찾지 못했지만, GPT-4는 정확히 지적해 냈습니다. 하지만 돌아보면, 충분한 시간과 노력을 들였다면 저도 찾을 수 있었을 것입니다.
프론티어 모델이 필요한 작업은 거의 없었습니다. 대부분의 경우, 좋은 엔지니어링과 오픈 모델로 충분했습니다. 그러나 매우 복잡한 추론이 필요한 특정 연구 작업에서는 GPT-4가 유일하게 작동했습니다.
저는 법률 문서 요약 작업에서 Kimi가 실패하고 Opus가 성공한 경우를 경험했습니다. 하지만 이는 모델의 차이라기보다는 훈련 데이터의 차이 때문이었을 수 있습니다.