ML 연구 에이전트는 왜 벤치마크에 과적합되지 않는가
Why don't machine learning research agents overfit?
ML 모델은 동일한 벤치마크로 수년간 반복 평가해도 과적합되지 않는다. Amazon Science 연구진은 그 이유를 압축에서 찾는다. 성공한 에이전트의 전략을 16개 토큰 수준의 정보 병목에 통과시켜도 새로운 에이전트가 동일한 성능을 재현했다는 실험 결과는, 에이전트가 데이터를 암기한 것이 아니라 실제 구조를 학습했음을 보여준다. 압축은 설명이자 진단 도구다.
성공한 에이전트의 전략을 정보 병목에 통과시키면, 기억이 없는 새로운 에이전트가 원래 에이전트의 성능을 재현할 수 있다. 이는 그 전략이 암기된 데이터가 아닌 실제 구조를 포착했음을 의미한다.