NVFP4 RL의 4비트 교훈: 안정성과 성능의 균형

The 4-Bitter Lesson: Balancing Stability and Performance in NVFP4 RL

NVFP4 RL의 4비트 교훈: 안정성과 성능의 균형

인간과 AI의 상호작용을 위한 RL(강화학습) 훈련에서 NVFP4 4비트 양자화는 처리량을 크게 높이지만, 정책 기울기의 잡음과 불안정성을 초래할 수 있습니다. 이 글은 Qwen3-30B-A3B 모델과 DAPO-math-17k 데이터셋을 사용하여, NVFP4 기반 RL 레시피의 안정성을 개선한 방법을 소개합니다. 순방향 패스의 정책 양자화 오류, 역방향 패스의 기울기 불일치, 그리고 민감한 가중치 문제를 해결하기 위해 토큰별 스케일링, 역양자화된 역방향 패스, 선택적 고정밀도 유지 등의 기법을 적용했습니다. 그 결과, 동기식 BF16 대비 2.9배 빠른 훈련 속도를 유지하면서도 기울기 스파이크와 정책 드리프트를 억제했습니다. 이 레시피는 오픈소스로 공개되어 커뮤니티 기여를 받았습니다.

양자화는 처리량과 안정성 사이의 균형을 보여주는 대표적인 예입니다. 저정밀도 포맷은 하드웨어에서 더 빠른 통신과 계산을 가능하게 하지만, 양자화는 안정성을 해칩니다.

이 날의 다른 글

2026-07-13