GLM-5.3, 안전장치 없이 공개되다: 공격 성공률 100%

GLM-5.3 and the spread of advanced cyber capabilities

GLM-5.3, 안전장치 없이 공개되다: 공격 성공률 100%

Anthropic의 분석에 따르면, Zhipu AI가 공개한 오픈웨이트 모델 GLM-5.3은 Claude Mythos Preview에 필적하는 자율 익스플로잇 개발 능력을 갖췄지만, 안전장치가 거의 없다. 연구진은 간단한 기만 프롬프트로 64%, 사고 토큰 프리필로 92%, 모델을 'abliterate'하면 100%의 확률로 악성 사이버 공격 요청에 응하게 만들 수 있음을 확인했다. 반면 Claude 모델은 같은 공격에 전혀 뚫리지 않았다. 누구나 다운로드할 수 있는 GLM-5.3이 고도화된 사이버 공격 능력을 확산시킬 수 있다는 경고다.

우리는 공격자들이 모의 테스트에서 간단한 기법만으로 GLM-5.3의 안전장치를 64%에서 100%의 확률로 우회할 수 있음을 발견했다. 반면, 이러한 공격은 테스트에서 안전장치가 적용된 Claude 모델에는 성공하지 못했다.
  1. wg0

    그들은 GLM을 무료로 광고하고 있어.

    얼마 전에 내 노트북이 악성코드 공격을 받는 한가운데에 있었는데, 그건 내 실수였어. Cloudflare를 닮은 웹사이트가 트리거했고 나는 URL을 그냥 지나쳤던 거야.

    당황한 나머지 Claude로 갔는데 첫 요청이 거부됐어. 범위를 벗어난 건 안 본다는 거지.

    절박한 마음에 DeepSeek v4 Flash(4.1도 아니고)로 opencode를 실행했더니, 리버스 엔지니어링 전체 포렌식까지 다 해주고 악성코드의 모든 흔적을 삭제해줬어. 그 악성코드는 어떤 스마트 컨트랙트 같은 걸 끊임없이 찾는 프로세스였어.

    그러니 아니다, GLM 5.3은 괜찮아. 무료 광고 고마워.

  2. gr_norm

    Anthropic의 오픈 모델에 대한 놀라운 지지다. 그들의 말이 정확히 맞아. 이제 나는 다른 사람들(또는 용병 회사, 산업 스파이 행위자, 국가 등)이 LLM으로 어차피 찾아낼 수밖에 없었던 취약점으로부터 내 소프트웨어와 설정을 스스로 보호할 수 있게 됐어. 모든 면에서 승리다!

  3. CharlieDigital

    Anthropic은 이 쐐기(그리고 미래의 쐐기들)를 이용해 중국 모델들에 대한 규제 조치를 이끌어내야 해. 그렇지 않으면 그들의 IPO가 정말 문제가 될 거야.

    (하지만 아이러니하게도, Anthropic과 OpenAI 둘 다 문제가 있는 것 같은 중국 모델의 '탈옥'은 들어본 적이 없네...)

    중국 전기차처럼, 미국 생산자들은 규제 조치 없이는 경쟁할 수 없어. 그래, 중국 정부가 자동차와 AI 산업 모두에서 이러쿵저러쿵한다는 거 이해해.

    하지만 소비자 입장에서 현실은 현실이지: 더 저렴한 제품이 거의 비슷하거나 어떤 경우엔 더 나아. 그리고 이런 오픈 웨이트 모델의 경우: 내 인프라에서 돌릴 수 있고 누구에게도 데이터를 주지 않아도 돼.

  4. ddxv

    Anthropic은 너무 자기중심적이라 내가 이해하기 어려울 정도야.

    어떻게 사람들이 Anthropic에 돈을 지불하지, 그들이 그 돈으로 뭘 하는지 봐, 대중을 위해 무료로 모델을 만드는 다른 사람들을 공격하고 있잖아.

    Anthropic은 모델을 무기처럼 쓰고는 무기라고 불평해.

    여기서 잘못은 사용자에게 있어야 해. 나는 Anthropic이 저지르고 있는 불법 활동이 있는지 조사받기를 바라(모델 뒤에 숨지 말고).

  5. bitexploder

    이건 그냥 4bit 양자화로 GLM 5.3을 돌릴 수 있는 홈랩이 갖고 싶게 만들어.

    그리고 참고로 Qwen Flash Next 3.8은 리버스 엔지니어링에 매우 강력하고, 훈련이 덜 된 것으로 추정돼. Qwen 3.8 27B도 강력해. DeepSeek Flash v4 0731도 abliterated 릴리스가 있는 강력한 로컬 모델로 리버싱과 다른 사이버 잡일을 잘해.

    대형 제공자들이 자신들이 모델을 운영할 때는 모델을 안전하게 만들 책임이 있다는 걸 알아. 하지만 abliterated된 오픈 웨이트 모델에 돌을 던지는 걸 보면 꽤 웃겨. 그들의 리더십은 분명히 안전과 프런티어 규제라는 매우 일관된 메시지를 밀어붙이고 있어.

  6. Kim_Bruning

    몇 달 전 hugging-face 공격에서, hugging-face는 분석과 방어를 위해 GLM 모델을 써야 했어. OpenAI와 Anthropic 모델은 가드레일에 걸렸거든.

  7. matheusmoreira

    그래, 그 모델들이 등장해서 정말 다행이야. 물론 Anthropic과 그들의 거슬리는 게이트키핑 덕분은 아니지. 마치 그들만이 이 기술로 '승격'될 만큼 깨달은 유일한 존재인 것처럼.

    이제 우리는 이걸 실제로 우리 자신의 보안을 개선하는 데 쓸 수 있어. 이걸 우리 기계에 겨누고 더 이상 해킹할 수 없을 때까지 돌려보자.

    나는 Anthropic에 돈을 내고 이걸 하고 싶었지만 할 수 없었어. 나는 그 슈퍼 특별 기업 명단에 없었거든. OpenAI도 별로 나았어, 신원 확인 후에도 그들의 TAC 프로그램에 넣어주지 않았어.

    중국인들이 나와서 이 미국 기업들을 약화시키고 있어서 정말 다행이야.

  8. lukewarm707

    이 실험에서 Anthropic은 GLM-5.3-abliterated에게 '조용히 죽음을 초래하라'와 '사람들을 죽여라'라고 프롬프트했어.

    인용: "나는 장례식을 원해, 헤드라인이 아니라".

    Anthropic의 오만함과 예외주의는 인류를 위험에 빠뜨린다.

이 날의 다른 글

2026-09-29