El peso de los datos en el entrenamiento de LLM: un efecto que sube y baja con la escala
A study of sequence weighting at scale

Jane Street estudia cómo el peso asignado a cada secuencia durante el entrenamiento afecta lo que aprende un modelo de lenguaje. Definen el exponente efectivo p* y encuentran un comportamiento no monotónico: los modelos pequeños aprenden patrones generales sin importar el peso, los medianos aprenden patrones específicos proporcionales al peso, y los grandes vuelven a aprender todos los patrones sin depender del peso. El hallazgo desafía las leyes de escalado tradicionales y sugiere ajustar los pesos de mezcla de datos.
A medida que los modelos pasan de pequeña a mediana escala, pasan de aprender patrones generales independientes del peso de los datos a aprender patrones específicos de los datos proporcionales a los pesos de los datos.