Prime Intellect, 18개 최첨단 모델로 nanoGPT 스피드런 대회에서 Fable 5가 81.7% 격차 해소
NanoGPT Speedrun Frontier

Prime Intellect가 nanoGPT 옵티마이저 스피드런에서 18개 최첨단 모델을 대상으로 153회의 자율 실행을 진행했습니다. Fable 5가 2,726의 기록으로 81.7%의 격차를 해소하며 1위를 차지했고, Opus 5, Kimi K3 등이 그 뒤를 이었습니다. 각 모델의 성능을 동일 예산 하에서 비교했으며, 모든 실행의 상세 추적(traces)을 공개합니다.
Fable 5는 81.7%의 격차를 해소하며 2,726의 기록을 세웠습니다.
HN 토론
35- lhl
훈련 측면에서 보니 꽤 흥미롭네요. 저는 이 모델들 대부분을 커널 최적화에 반자동으로(며칠씩) 갈아넣는 데 사용해 봤습니다(Fable은 제외 — Fable은 거의 즉시 가드레일에 걸려서 그 당시 Opus 4.8로 강등되곤 했죠). 많은 사람들에게 그게 가장 큰 문제일 수도 있겠지만, Opus 5도 여전히 잘하는 것 같습니다.
방향을 지정하지 않고 내버려 두면 모델들(특히 GPT 모델들)이 한 가지에 파고들지만, 적절한 스캐폴딩을 사용하면 꽤 잘 작동하는 것 같습니다. 제 일반적인 루프는 아이디어 구상 및 프로파일링 단계로 시작하고, 다음 항목으로 강제로 넘어가기 전에 실행 횟수를 제한한 다음, 반복하면서 '새로운 시각'을 가진 모델들을 섞는 것입니다. 이건 완전히 자동화할 수 있을 수도 있지만, 저는 하루에 한 번 정도 확인하면서 상황을 보고 방향을 바꾸는 것을 좋아합니다.
- vibe42
『거의 모든 모델이 동일한 승리 아이디어를 찾습니다. 최고의 트레이스를 구분 짓는 것은 실험이 남긴 것입니다. 그들은 약한 신호를 검증할 수 있을 만큼 오래 보존하지만, 결과에 대한 더 나은 이해도 가지고 있습니다.』
역사 로그에 신호를 보존하는 데 도움이 되는 하네스가 결과를 바꿀 수 있을지 궁금하네요.
또한 다른 목표 프롬프트가 결과를 바꿨을지도 궁금합니다. 프롬프트 엔지니어링을 많이 하는 게 아니라 '새로운 해결책을 고려하고, 약한 신호를 추적하라' 같은 작은 차이 말이죠.
제 생각에 그들은 동일한 목표 프롬프트에 꽤 많은 GPU 시간을 할당했습니다.
- nsingh2
sol은 어떻게 된 건가요? 메모에 시간을 많이 기다리며 보낸다고 되어 있는데, 시간을 효과적으로 사용하지 못한 것(예: 병렬 실행 같은 것)이라서 그래프가 시간 축으로 늘어난 것인가요?
또한 Opus 5에 대한 메모를 보면 program.md의 이전 직렬 버전으로 실행된 것이라고 되어 있어서, 그래프가 완전히 동등한 비교는 아닌 것 같은데요?
편집: 블로그에서 이 문제를 다루는 것 같습니다 https://www.primeintellect.ai/blog/measuring-autonomous-rese...
- totetsu
『우리는 nanoGPT 옵티마이저 스피드런에서 18개 최첨단 모델에 걸쳐 153개의 자율 실행을 수행했습니다.』
어.. 알겠는데.. 그런데 '실행'이 뭔데… 블로그 읽어봐
『우리는 최첨단 모델이 연구를 얼마나 잘 수행할 수 있는지 측정하고 싶습니다…』『우리는 nanoGPT 옵티마이저 스피드런에서 153개의 자율 실행을 수행했습니다.』
좋아, 그런데 옵티마이저 실행이 뭐고, 그것이 연구를 잘하는 것과 무슨 관련이 있지?
『비교를 위해, Anthropic의 내부 자동화 AI R&D 평가는 CPU 노드에서 모델을 최적화합니다.』
그러니까 내가 Anthropic이 무엇을 하고 있는지 찾아봐야 이해할 수 있다는 거야?
그냥 블로그에서 그 의미를 설명하지 않는 이유는 뭐지..
- espadrine
달러로 된 세 번째 X축이 있으면 좋겠습니다.
시간은 때로는 모델 품질보다 추론 인프라(특히 시스톨릭 칩)에 더 관련이 있습니다(그리고 제공업체는 지연 시간을 희생하면서 더 높은 배치를 지원하도록 설정을 조정합니다).
토큰은 모델 간에 항상 완전히 동등하지는 않습니다.