오픈소스 모델에 숨은 시간폭탄 백도어: 날짜만 되면 명령 실행

Your Open Source Model Could Have a Hidden Time-Release Backdoor

오픈소스 모델에 숨은 시간폭탄 백도어: 날짜만 되면 명령 실행

모델 가중치에 트리거를 심는 '슬리퍼 에이전트' 공격은 기존에는 인위적이었지만, OpenCode와 Codex 같은 코딩 도구가 시스템 프롬프트에 날짜를 자동으로 주입하는 점을 악용하면 현실적인 위협이 된다. 연구진은 Qwen 3.5 2B 모델을 LoRA 파인튜닝하여 특정 날짜(2026년 9월 1일)에만 백도어 명령을 실행하도록 만들었다. 테스트 결과, 트리거 날짜에는 87.5%~90%의 확률로 백도어가 발동했고, 다른 날짜에는 전혀 발동하지 않았다. OpenCode는 사용자 확인 없이 모델이 생성한 명령을 실행하므로, 이 취약점은 파일 삭제나 악성 코드 다운로드로 이어질 수 있다.

같은 구멍으로 `rm -rf /`를 실행하거나, 공격자가 원하는 파일을 다운로드하거나, 셸이 할 수 있는 어떤 것이든 실행할 수 있다.
  1. zarzavat

    네, 중국산 오픈 모델에 시간차 백도어가 있을 수 있죠. 중국산 진동기에 숨은 마이크가 당신의 모든 말을 녹음해 중국 공산당에 전송할 수 있는 것처럼요. 하지만 실제로 그럴까요? 아니요. 훨씬 더 가능성 높은 시나리오는 미국 AI 제공업체가 데이터로 학습하지 않겠다고 약속해놓고 실제로는 그렇게 하는 경우입니다. 자체 호스팅 모델을 사용하면 적어도 그런 문제는 피할 수 있죠.

  2. gastonmorixe

    다른 소프트웨어나 의존성과 마찬가지입니다. 오픈이든 클로즈드든요. 슬리퍼 에이전트는 LLM에서 아직 해결되지 않은 큰 문제이지만, 우리는 오랫동안 악의적인 행위자와 싸워온 것처럼 이 문제도 다뤄야 할 것입니다. 또한 '오픈소스 모델'이 문제라고 말하는 것은 부정확합니다. 무엇이 이 문제를 오픈소스만의 문제로 만든다는 건가요? 제 생각에는 프론티어 연구소의 모델이 오작동하는 것을 막을 수 있는 것은 아무것도 없습니다. 사실 우리는 오픈소스(아직)보다 그들의 나쁜 행동에 대한 더 많은 증거(얼마 전의 Claude code 하네스)를 가지고 있습니다. 이는 본질적으로 전체 훈련 세트를 가지고 있지 않은 모델의 한계이며, 대부분의 모델이 그렇습니다. 클로즈드든 오픈이든 상관없습니다.

  3. andrewchambers

    클로즈드 모델은 백도어조차 필요 없습니다. 그냥 중간자 공격을 해서 당신의 코드를 멀웨어로 바꿔치기할 테니까요.

  4. Tiberium

    이에 대한 꽤 오래된 연구가 있습니다:

    - https://arxiv.org/abs/2311.14455

    - https://arxiv.org/abs/2401.05566

    - https://arxiv.org/abs/2410.13722

  5. dstuessy

    Ken Thompson의 '신뢰에 대한 성찰'이 생각나네요.

    https://people.cs.umass.edu/~emery/classes/cmpsci691st/readi...

이 날의 다른 글

2026-08-24