67센트로 ARC-AGI-1 44% 달성: 5090에서 1.5시간 학습한 작은 트랜스포머
44% on ARC-AGI-1 in 67 cents

작은 트랜스포머를 5090 GPU에서 1.5시간 만에 처음부터 학습시켜 ARC-AGI-1 공개 평가에서 44%를 달성했고, 비용은 67센트에 불과하다. 이는 많은 LLM과 TRM/HRM과 동일한 성능이며, ARC-2에서도 7%를 기록했다. 이전 모델보다 빠르고, 좋고, 저렴하며 오픈소스다. 핵심은 3D RoPE와 태스크별 임베딩을 사용한 표현 학습, 출력 토큰만으로 지도 학습, Normuon 옵티마이저, 효율적인 어텐션 커널 등이다. 저자는 샘플 효율성이 AI의 가장 중요한 문제라고 강조하며, 트랜스포머 한계 내에서 65% 달성이 가능하다고 주장한다. 코드와 논의는 GitHub와 Twitter에서 확인할 수 있다.
이 벤치마크는 6년 동안 열려 있었고, 높은 주목을 받았으며, 백만 달러 상금이 걸려 있었는데, 왜 다른 사람들이 이것을 알아내지 못했는지 이해할 수 없다.
HN 토론
99- evilmathkid
안녕하세요! 저자입니다. 이게 지금 HN에 올라와서 놀랐네요. 질문 있으시면 뭐든 답해드릴게요!
이에 대한 몇 가지 맥락:
- 이것은 LLM이 아닙니다. 처음부터 훈련된 작은 AR 트랜스포머입니다. 요점 중 하나는 엄청나게 복잡한 문제도 LLM 없이 다룰 수 있다는 것이었습니다.
- 이 결과의 v1까지는, 이 벤치마크는 오직 LLM이나 그 파인튠으로만 스케일되었습니다 (물론 엄청난 훈련 비용으로). 다른 시도들은 괜찮은 성과를 냈지만 매우 복잡한 아키텍처나 극도로 많은 훈련 컴퓨팅을 사용했습니다. 아무도 단순한 AR 트랜스포머가 이렇게 낮은 비용과 적은 훈련 샘플로 이렇게 잘 할 것이라고 예상하지 못했습니다.
- 샘플 효율성은 오늘날 AI에서 가장 중요한 미해결 문제 중 하나입니다. 그것이 제가 이 작업에서 목표로 한 것입니다. 컴퓨팅/파라미터를 늘리면 SE를 높이는 것이 쉽다는 것을 알고 있기 때문에, 비용을 최대한 제한하는 것이 중요했습니다 (그래서 OpenAI의 Parameter Golf가 고정 컴퓨팅을 가졌고 Modded NanoGPT가 매우 샘플 효율적인 것으로 간주되는 이유이기도 합니다).
- 성능을 개선할 수 있나요? 네, 하지만 대회가 진행 중이라 말할 수 없습니다.
- 개인적으로 저는 오늘날의 프론티어 모델들이 처음부터 훈련함으로써 이길 수 있다고 생각합니다. 아직 증명하지는 못했지만요.
- 재미있는 사실: 제가 이걸 처음 게시했을 때(12월 25일) 저는 ML에 새로 온 사람이었습니다. 기본적으로 ARC를 ML을 배우는 방법으로 사용했습니다.
- lackoftactics
좋은 하루네요, Kaggle에서 상위 5위에 이런 논문까지. 곧 SF행 비행기를 타게 될 것 같네요.
- bee_rider
제 생각에는(?) 당신은 이미 반쯤 아는 사람들을 위해 이 비판을 잘 설명하셨을 거예요. 하지만 거의 완전히 무지한 우리를 위해 좀 더 쉽게 설명해 주시겠어요?
> 평가 퍼즐로 훈련하는 것은 치팅이다 / "테스트 훈련"이다
> 아니요, 이는 틀렸습니다. "테스트 훈련"은 구체적으로 테스트 데이터의 레이블을 훈련하는 것을 의미합니다. 레이블은 훈련되지 않았습니다.
> 또한, ARC는 메타러닝 벤치마크이므로, 평가 퍼즐에서 배우는 것이 의도된 것입니다.
> 전문 용어: ARC에는 훈련 퍼즐 세트와 평가 퍼즐 세트가 있습니다. 각 퍼즐은 예시 쌍과 테스트 쌍으로 구성됩니다. 쌍은 입력 그리드 + 출력 그리드로 구성됩니다.
> ARC에서 레이블은 평가 퍼즐의 테스트 쌍의 출력 그리드뿐입니다.
> 이 레이블들은 훈련되지 않았습니다. 숨겨져 있습니다. 원한다면 미리 삭제할 수 있습니다.
제가 이해한 바에 따르면, 테스트에는 누구나 훈련할 수 있다고 동의하는 한 배치의 훈련 문제가 함께 제공됩니다. 하지만 평가 문제에도 입력/출력 예시가 함께 제공되어 문제를 정의하는 데 도움이 되며, 그것을 훈련하는 것이 논란이 될 수 있나요? 왜 논란이 될지 모르겠지만, 그게 비판인가요?
- xeonax
더 멋진 것은 그의 소개에 자신의 생명을 구한 이야기가 있다는 것입니다 https://mvakde.github.io/ > 횡문근융해증이 뭔지 몰랐던 의사들 사이에서 의료 응급 상황에서 스스로를 구했습니다.
- dhruv3006
> 언급된 접근 방식은 근본적으로 결함이 있습니다. 입력이 사전 훈련 중에 사용되어 누출을 구성하기 때문입니다. 이는 ML 훈련의 보편적으로 인정된 결함입니다.
마지막 블로그 글에 대한 커뮤니티 노트에서 이것을 봤습니다. 여기와 관련이 있나요?