NVFP4 RL: el equilibrio entre estabilidad y rendimiento
The 4-Bitter Lesson: Balancing Stability and Performance in NVFP4 RL

El entrenamiento de modelos de lenguaje con RL en precisión NVFP4 ofrece grandes ganancias de rendimiento, pero introduce inestabilidades que no se observan en el preentrenamiento. En este artículo, el equipo de humans& presenta una receta de bajo precisión para RL que mantiene la estabilidad del entrenamiento. Abordan los errores de cuantización en el pase hacia adelante, los desajustes de gradiente en el pase hacia atrás y la sensibilidad de ciertos pesos. Entre las técnicas destacan el escalado por token, el backward des-cuantizado y el mantenimiento de ciertas capas en BF16. Validan su enfoque con Qwen3-30B-A3B en DAPO-math-17k, logrando una estabilidad comparable a la de BF16 síncrono con una velocidad 2.9× mayor.
La esencia del RL es enseñar a un modelo a través de la acción y la consecuencia; en humans&, usamos RL para entrenar modelos que comprenden los impactos a largo plazo de sus interacciones con las personas.