NVIDIA의 cuda-checkpoint 내부를 역공학하여 콜드 스타트를 70배 빠르게

Reverse-engineering Nvidia's CUDA-checkpoint for faster cold starts

NVIDIA의 cuda-checkpoint 내부를 역공학하여 콜드 스타트를 70배 빠르게

NVIDIA의 폐쇄형 드라이버에 포함된 잘 알려지지 않은 기능인 cuda-checkpoint는 실행 중인 CUDA 프로세스를 동결하고 GPU 상태를 호스트 메모리에 직렬화한 후 나중에 GPU에 복원할 수 있습니다. Doubleword는 이 기능을 사용하여 SGLang 서버 시작 시간을 최대 70배 단축했습니다. 그러나 체크포인트 전송이 PCIe 대역폭을 거의 활용하지 못하는 이유는 불분명했습니다. 이 게시물에서는 역공학을 통해 그 메커니즘을 밝혀냅니다. 체크포인트는 프로세스 내부의 전용 서비스 스레드가 수행하며, 일반적인 리소스 관리자 ioctl을 사용하여 컨텍스트를 해체하고 호스트 메모리에 이미지를 생성합니다. 저자들은 이 지식을 활용하여 애플리케이션이나 드라이버를 수정하지 않고도 체크포인트/복원 속도를 높이는 방법을 제시합니다.

체크포인트 이미지는 우리가 소유한 프로세스의 평범한 익명 메모리일 뿐입니다.

이 날의 다른 글

2026-07-09