数据加权缩放规律:非单调的意外发现
A study of sequence weighting at scale

Jane Street 团队深入研究了数据加权在不同规模语言模型中的缩放规律,发现了一个反直觉的非单调现象。在小规模模型中,模型倾向于学习通用模式,忽略数据权重;随着模型进入中等规模,它们开始根据权重比例学习特定数据模式;而当模型规模进一步增大时,它们又能无视权重差异,掌握数据中的所有模式。这一发现挑战了传统的 Chinchilla 式缩放定律外推方法,表明简单的线性外推在数据混合策略上可能失效。研究团队通过引入“有效序列权重指数”量化了这一过程,并指出在大规模训练中识别此类异常行为对于避免错误的超参数外推至关重要。
随着模型从小规模过渡到中等规模,它们从学习独立于数据权重的通用模式,转变为学习与数据权重成比例的数据特定模式。