Codex로 232배 빠른 커널 만들기: GPU Mode 대회에서의 자동 리서치
Auto-research with codex: How I achieved a 232x Faster Kernel

GPU Mode와 Core Automation이 주최한 자동 리서치 대회에서, 저는 Codex를 활용해 배치된 정사각 행렬의 compact Householder QR 분해를 구현했습니다. 183명 중 12위를 차지했고, 베이스라인 대비 232배의 속도 향상을 달성했습니다. 이 글에서는 제 접근 방식, 학습 내용, 그리고 대회 중 겪은 병목 현상을 공유합니다. 특히, 에이전트가 빠른 피드백 루프를 활용해 성능을 개선하는 '루프 엔지니어링'의 중요성을 강조합니다. 14일 동안 1500회 이상의 제출을 통해 커널을 최적화했습니다.
에이전트는 빠른 피드백 루프를 갈망합니다. 그들은 이를 통해 마음껏 언덕을 오를 수 있습니다.