Jane Street: вес данных в обучении LLM меняет знак при росте модели

A study of sequence weighting at scale

Jane Street: вес данных в обучении LLM меняет знак при росте модели

Jane Street исследовала, как вес отдельных последовательностей в обучении влияет на снижение лосса. Оказалось, что эффективный показатель степени p* ведёт себя немонотонно: у малых моделей он близок к нулю, у средних растёт, а у крупных снова падает. Это значит, что маленькие модели учат общие паттерны, средние — пропорционально весам данных, а большие — все паттерны независимо от веса. Результаты получены на трёх семействах моделей, включая Qwen 2.5.

Taken together, our results are consistent with a general trend: as models transition from small to medium scale, they transition from learning general patterns independent of data weight to learning data-specific patterns proportional to the data weights.

Ещё за этот день

2026-09-22