NVFP4 im RL: Wie wir Stabilität und Performance in Einklang bringen

The 4-Bitter Lesson: Balancing Stability and Performance in NVFP4 RL

NVFP4 im RL: Wie wir Stabilität und Performance in Einklang bringen

In diesem Beitrag stellt humans& ein Rezept für stabiles Reinforcement Learning mit NVFP4-Quantisierung vor. Die Autoren zeigen, wie sie die typischen Instabilitäten von RL-Training in 4-Bit-Präzision beheben: Per-Token-Skalierung für Aktivierungen, dequantisierter Backward-Pass und selektive Hochpräzisionsschichten. Das Ergebnis ist eine 2,9-fache Beschleunigung gegenüber synchronem BF16-Training bei stabiler Konvergenz. Die Implementierung ist Open Source und umfasst Beiträge zu TransformerEngine, cuDNN, FlashInfer und SGLang.

Die Kernaussage: Quantisierungsrauschen muss klein genug sein, um das wahre Policy-Gradient-Signal pro Update nicht zu verschlechtern – Unvoreingenommenheit allein reicht im RL nicht aus.

Mehr von diesem Tag

2026-07-13