Почему агенты для ML-исследований не переобучаются на бенчмарках
Why don't machine learning research agents overfit?
Новое исследование Amazon Science объясняет, почему ML-модели не переобучаются на бенчмарках, несмотря на многократную итеративную настройку. Оказывается, успешные стратегии агентов сильно сжимаемы: если сжать стратегию до 16 токенов, новый агент без памяти воспроизводит результаты исходного. Это означает, что агент улавливает реальную структуру данных, а не запоминает их. Сжатие служит и диагностикой: стратегии, которые действительно переобучаются, теряют свои преимущества при прохождении через информационное узкое место.
Машинное обучение по своей сути — это обобщение, а не запоминание.