독점 LLM API의 숨은 추론 과정을 탈취하다
Stealing Reasoning Traces from Proprietary LLM APIs
Anthropic, OpenAI, Google은 자사 모델의 추론 과정을 암호화된 블록으로 클라이언트에 반환하는데, 이 블록이 세션·사용자·모델을 넘어 재생 가능하다는 사실이 밝혀졌다. 연구진은 강력한 모델의 추론 블록을 약한 형제 모델에 주입하고, 약한 모델을 jailbreak하여 강한 모델의 숨은 추론을 평문으로 복원했다. 강한 모델을 직접 공격하거나 증류 방지 장치를 건드리지 않고도 가능한 공격이다.
독점적 추론은 암호화된 추적에서 복구될 수 있다.