El peso de los datos en el entrenamiento de LLM: un efecto que sube y baja con la escala

A study of sequence weighting at scale

El peso de los datos en el entrenamiento de LLM: un efecto que sube y baja con la escala

Jane Street estudia cómo el peso asignado a cada secuencia durante el entrenamiento afecta lo que aprende un modelo de lenguaje. Definen el exponente efectivo p* y encuentran un comportamiento no monotónico: los modelos pequeños aprenden patrones generales sin importar el peso, los medianos aprenden patrones específicos proporcionales al peso, y los grandes vuelven a aprender todos los patrones sin depender del peso. El hallazgo desafía las leyes de escalado tradicionales y sugiere ajustar los pesos de mezcla de datos.

A medida que los modelos pasan de pequeña a mediana escala, pasan de aprender patrones generales independientes del peso de los datos a aprender patrones específicos de los datos proporcionales a los pesos de los datos.

Más de este día

2026-09-22