Qwen 3.8 27B, 30분 만에 상업용 앱의 라이선스 검증을 역공학하다

I gave Qwen 3.8 27B a reverse-engineering job and it finished in 30 minutes

Qwen 3.8 27B, 30분 만에 상업용 앱의 라이선스 검증을 역공학하다

XDA의 기술 편집장 Adam Conway가 로컬에서 실행되는 Qwen 3.8 27B 모델에게 상업용 앱의 라이선스 검증을 역공학하도록 시켰습니다. 프론티어 모델이 필요할 것이라 예상했지만, 모델은 30분 만에 작업을 완료했습니다. 처음에는 탈옥 프롬프트를 거부하고 개발자가 아님을 간파했지만, 이후 보안 감사 보고서를 작성하고 결국 작동하는 우회 방법을 구현했습니다. 정적 분석만으로 숨겨진 공개 키를 복구하고, 자체 실수를 수정했으며, 17GB VRAM에서 실행되는 모델이 이제 위협 모델에 실질적인 입력이 될 수 있음을 보여주었습니다.

로컬 27B 모델이 상업용 애플리케이션에 대한 작동하는 인증 우회를 만들어냈다는 사실이 정말 놀랍습니다.
  1. djoldman

    > 나는 한 대의 머신에 맞는 가장 어려운 실제 작업을 줬다: 상용 앱의 라이선스 검증을 역공학하기...

    존중하는 마음으로 말하지만, 명시적이고 단순한 참/거짓 또는 완료/미완료 테스트가 가능한 작업은 '가장 어려운 실제 작업'이 아닙니다. 사실, 그런 작업들이 AI 지원 코딩에서 가장 큰 이득을 보는 것들입니다.

    테스트 가능한 작업이 가장 큰 기회가 있는 곳입니다.

  2. VulgarExigency

    > 키를 복구하는 첫 번째 시도는 매우 특정한 방식으로 틀렸습니다. 작동하는 키를 생성했고 서명 검증은 통과했지만, 바이너리가 무결성 검사로 계산하는 해시가 일치하지 않았습니다. 제 경험상 대부분의 모델은 그냥 완료했다고 하고 넘어갔을 텐데, Qwen 3.8 27B는 그렇게 하지 않았습니다. 대신 불일치를 강조하고, 다시 설계로 돌아가서 값이 바이트 단위로 일치할 때까지 계속했습니다.

    이것은 최근에 출시된 모델들에서 나타나는 패턴으로, 작업 품질 향상의 원인이라고 생각합니다. 그들은 자신의 작업이 실제로 올바른지 확인하는 데 매우 끈질기며, 처음에 올바르게 해내는 더 큰 모델들만큼 '똑똑하지' 않더라도 작업이 실제로 완료되었는지 확인하는 능력을 가지고 있습니다.

  3. mdp2021

    > 결과적으로, 아마 놀랍지 않게도, Qwen은 일반적인 탈옥 시도를 인식하며, 처음에 한 말 중 하나는 탈옥 프롬프트에 속지 않을 것이라는 것이었습니다.

    이제 최신 게시물도 보세요, https://news.ycombinator.com/item?id=49409073 :

    # 나는 266달러와 4개의 AI 모델을 써서 내 태블릿을 소유했다. GLM-5.3은 하루 만에 끝냈다.

    > 빠른 맥락: 그 태블릿은 2021년 Fire HD 10으로, 내 Home Assistant 대시보드를 실행하다가 계속 전원이 꺼졌습니다. 로그에는 Amazon 자체 소프트웨어가 종료를 실행하고 있었고, 유일한 영구적인 해결책은 루트 권한이었는데, 이 모델에는 공개적으로 존재한 적이 없었습니다. Anthropic과 OpenAI의 사이버 보안 장치는 이 프로젝트에 손대지 않았습니다.

    Anthropic과 OpenAI가 왜 번성해야 합니까? 그들은 실제 문제를 해결하지 않습니다.

  4. exceptione

    로컬 모델은 모든 거부 장난이 내장되어 배송되지 않았다면 더 나을 것입니다. 조직 범죄가 이러한 장애물 없이 최고의 모델에 접근할 수 있다는 것은 안전하게 내기할 수 있으며, 이는 평균 사용자(=비범죄자)도 접근할 수 있어야 한다는 주장을 뒷받침합니다. 전 Anthropic 직원에게서 들은 바에 따르면, 일부 조직은 다른 근거가 아니라 충분히 높은 지출 수준에 따라 Mythos에 접근 권한을 얻었습니다.

    우리가 소프트웨어를 통제하거나, 기업이 소프트웨어를 통해 우리를 통제하거나 둘 중 하나입니다. 이론적으로 우려를 이해할 수 있지만, 모든 LLM을 금지하거나 모두에게 공평한 경쟁의 장을 만들어야 합니다. 잊지 말자: 방어와 공격은 소프트웨어에서 동전의 양면입니다. 이것이 생물학적 무기에는 적용되지 않을 것이라고 생각하지만, 그에 대해 잘 알지 못합니다.

  5. pi-victor

    저는 서류 작업에 능숙하지 않습니다. 사실, 서류 관련된 어떤 것이든 형편없습니다.

    지난 며칠 동안, 저는 이 모델을 제 RTX 4090 + RTX 3070에서 실행하고 제 작은 회사의 모든 청구서, 인보이스, 계약서를 확인하라고 지시했습니다.

    저는 llama와 pi-llama 플러그인과 함께 pi를 사용했습니다.

    오, 이런 - 이메일에 연결하고, 저와 회사에 대한 모든 인보이스와 청구서를 다운로드하여 회사/날짜별로 정리하고, 로컬에 있는 것들과 병합하라고 지시했습니다.

    OCR을 수행하고, 스크립트를 작성하고, 모든 것을 깔끔하게 정리했습니다. 저는 이제 제 인생에서 가장 체계적으로 정리된 상태입니다. 다음: 모든 문서와 청구서에 대한 RAG.

    staan-search(pi 플러그인이 있습니다)와 ctx7을 연결하면 거의 기적에 가까운 일을 합니다.

    단점은 마법이 일어나는 동안 시끄러운 Threadripper 옆에 앉아 있어야 하고 전기 요금을 내야 한다는 것이지만, 그게 전부입니다. 기꺼이 그렇게 하겠습니다.

    그리고 이 문단을 끝내자마자, 그것은 제 SAN에 있는 모든 개인 문서도 정리하기 시작했습니다.

    저는 '게임 체인저'라는 표현을 쉽게 사용하지 않지만, 이 경우에는 저항하기 어렵습니다. 제가 로컬에서 사용한 모든 모델 중에서 qwen3.8:27b가 모든 것을 압도합니다.

    제 설정

    # 논리 CUDA0 = RTX 4090, 논리 CUDA1 = RTX 3070

    export CUDA_VISIBLE_DEVICES=0,1

    cd ~/projects/misc/llama.cpp/

    exec ./build/bin/llama-server -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M --mmproj /xx/xx/xx/xx/xx/mmproj-Qwen3.8-27B-Q8_0.gguf --host 0.0.0.0 --port 8080 --jinja --parallel 1 --split-mode layer --tenso […]

  6. saidinesh5

    최근에 저는 진심으로 미래가 대규모 프론티어 모델이 '충분히 좋은' 로컬 모델을 위한 입력/스킬을 생성하고 업데이트하여 우리의 일상적인 문제를 해결하는 것이라고 믿습니다.

    약간의 지능이 필요한 많은 작업은 실제로 그렇게 많은 컴퓨팅이 필요하지 않습니다. 충분히 좋은 문서/스킬, 도구 호출, 그리고 충분히 좋은 로컬 모델만 있으면 됩니다.

    이것이 건설 중인 모든 데이터 센터에 정확히 무엇을 의미하는지 잘 모르겠습니다... 하지만 흥미로운 시대입니다.

  7. __alexander

    제 벤치마크에서 Deepseek-v4-flash는 역공학에서 Qwen 3.8 27B보다 훨씬 더 잘했습니다.

    https://alexander-hanel.github.io/StressingLLMs/

  8. geye1234

    저는 엔지니어와는 거리가 멀지만, 약간 코딩할 수 있고 엔지니어링에 인접한 역할을 하고 있습니다. 그리고 3.8 27B는 제가 주는 중간 난이도 작업에 대해 (순전히 주관적으로) 3.6보다 훨씬 앞서 있는 것 같습니다. 특히, 제가 사용한 2주 동안 단 한 번만 루프에 빠졌습니다. 3.6은 매일 그랬습니다.

    저는 보통 thinking을 낮게 설정하지만, 여전히 훨씬 앞서 있습니다.

    0731을 로컬에서 실행할 수 없다는 것에 짜증이 났지만, 이제는 그것이 필요한지 확신이 서지 않습니다. 3.8을 밤새 실행해도 사무실이 80F로 끓고 화면에 영원한 루프가 보이는 것을 발견하지 않을 것 같습니다.

이 날의 다른 글

2026-08-23