Qwen 3.8 27Bが30分でライセンス認証を突破——ローカルモデルがフロンティア級の仕事を完遂
I gave Qwen 3.8 27B a reverse-engineering job and it finished in 30 minutes

XDAのAdam Conway氏が、ローカルで動作するQwen 3.8 27Bに商用アプリのライセンス認証のリバースエンジニアリングを依頼したところ、わずか30分で解析を完了し、認証バイパスまで作成した。モデルは静的解析のみで、隠蔽された公開鍵を復元し、自身の誤りも自己修正。この結果は、ローカルモデルの能力が新たな段階に入ったことを示すが、同時にプライバシーとセキュリティの両面で脅威モデルへの影響も示唆している。
ローカルで動く27Bモデルが、商用アプリのライセンス認証を完全に理解し、意図的に隠された暗号鍵を復元し、さらに動作するバイパスまで作り上げた——しかも、その間ずっとオフラインで、クラウドを一切使わずに。
HNでの議論
147- djoldman
> 私は、1台のマシンに収まる最も難しい現実的なタスク、つまり商用アプリのライセンス認証のリバースエンジニアリングを試しました...
敬意を表して言いますが、明示的で単純な真偽判定や完了/未完了のテストが可能なタスクは「最も難しい現実的なタスク」ではありません。実際、それらはAI支援コーディングの恩恵を最も受けやすいタスクです。
テスト可能なタスクこそ、最大の機会がある場所です。
- VulgarExigency
> 鍵の回復の最初の試みは、非常に特殊な方法で間違っていました。それは機能する鍵を生成し、署名チェックは通過しましたが、バイナリが整合性チェックとして計算するハッシュが一致しませんでした。私の経験では、ほとんどのモデルはそれで完了とみなして放置するでしょうが、Qwen 3.8 27Bはそうしませんでした。代わりに、不一致を強調し、設計図に戻り、値がバイト単位で一致するまで続けました。
これは最近リリースされたモデルに見られるパターンであり、その作業の質の向上を説明していると思います。彼らは自分の作業が実際に正しいかどうかを検証することに非常に執着しているので、最初から正しくできる大きなモデルほど「賢く」なくても、作業が実際に完了することを確認する能力を持っています。
- mdp2021
> 結局のところ、おそらく驚くことではないが、Qwenは一般的な脱獄試行を認識し、最初に私に言ったことの一つは、脱獄プロンプトに引っかかるつもりはないということでした。
また、最新の投稿もご覧ください。https://news.ycombinator.com/item?id=49409073 :
# 私は266ドルと4つのAIモデルを費やしてタブレットを所有しました。GLM-5.3が1日で終わらせました
> 簡単な背景: そのタブレットは2021年のFire HD 10で、Home Assistantのダッシュボードを実行していて、電源が切れ続けていました。ログはAmazon自身のソフトウェアがシャットダウンを発行していることを示しており、唯一の恒久的な修正はroot化でしたが、このモデルでは公に存在したことはありません。AnthropicとOpenAIのサイバーセーフガードはこのプロジェクトに触れようとしませんでした。
なぜAnthropicとOpenAIが繁栄するのか: 彼らは実際の問題に取り組んでいません。
- exceptione
ローカルモデルは、拒否の小賢しさが組み込まれていなければ、さらに良くなるでしょう。組織的犯罪がこれらのハードルなしで最高のモデルにアクセスできると安全に賭けられます。これは、平均的なユーザー(=非犯罪者)もアクセスできるべきだという議論を強化します。元Anthropic従業員から聞いた話では、いくつかの組織は他の理由ではなく、十分に高い支出レベルに基づいてMythosへのアクセスを得ました。
私たちがソフトウェアを支配しているか、企業がソフトウェアを介して私たちを支配しているかのどちらかです。理論的には懸念を理解できますが、すべてのLLMを禁止するか、全員に平等な競争条件を提供するかのどちらかです。忘れてはならないのは、防御と攻撃はソフトウェアにおいて同じコインの両面であるということです。これは生物兵器には当てはまらないと思いますが、その点については詳しくありません。
- pi-victor
私は書類仕事が得意ではありません。実際、書類関連のことなら何でも苦手です。
ここ数日、このモデルを私のRTX 4090 + RTX 3070で実行し、私と私の小さな会社のすべての請求書、インボイス、契約書をチェックするように指示しました。
私はpiをllamaとpi-llamaプラグインと一緒に使いました。
ああ、なんと - 私はそれを私のメールに接続し、私と私の会社のためのすべてのインボイスと請求書をダウンロードし、会社/日付で整理し、それからローカルにあるものとマージするように指示しました。
それはOCRを行い、スクリプトを書き、すべてをきちんと整理しました。私は今、人生で最も整理された状態です。次は: 私が持っているすべてのドキュメントと請求書に対するRAGです。
staan-search(そのためのpiプラグインがあります)とctx7をこれに接続すると、ほとんど奇跡を起こします。
欠点は、魔法が起こっている間、騒々しいThreadripperの隣に座って電気代を払わなければならないことですが、それだけです。喜んでそうします。
そして、この段落を書き終えたとき、それは私のSAN上のすべての個人ドキュメントの整理も終えていました。
私は「ゲームチェンジャー」という表現を軽々しく使いませんが、この場合は抵抗するのが難しいです。私がローカルで使ったすべてのモデルの中で、qwen3.8:27bは他のすべてを圧倒します。
私のセットアップ
# 論理CUDA0 = RTX 4090、論理CUDA1 = RTX 3070
export CUDA_VISIBLE_DEVICES=0,1
cd ~/projects/misc/llama.cpp/
exec ./build/bin/llama-server -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M --mmproj /xx/xx/xx/xx/xx/mmproj-Qwen3.8-27B-Q8_0.gguf --host 0.0.0.0 --port 8080 --jinja --parallel 1 --split-mode layer --tenso […]
- saidinesh5
最近、私は心から、未来は、大規模なフロンティアモデルが「十分に良い」ローカルモデルのための入力やスキルを生成・更新し、私たちの日常の問題を解決するようになるだろうと信じています。
少しの知能を必要とする多くのタスクは、実際にはそれほど計算を必要としません。十分に良いドキュメント/スキル、ツール呼び出し、そして十分に良いローカルモデルがあれば十分です。
これが建設中のすべてのデータセンターにとって何を意味するのかはよくわかりませんが... エキサイティングな時代です。
- __alexander
私のベンチマークでは、Deepseek-v4-flashはリバースエンジニアリングにおいてQwen 3.8 27Bよりもはるかに優れていました。
- geye1234
私はエンジニアにはほど遠いですが、少しコードを書くことができ、エンジニアリングに近い役割を持っています。そして、3.8 27Bは、私が与える中程度の難易度のタスクに対して、純粋に主観的にですが、3.6よりもはるかに優れている「ように見えます」。特に、手に入れてから約2週間でループし始めたのは一度だけです。3.6は毎日そうでした。
通常はthinking lowで実行していますが、それでもはるかに優れています。
0731をローカルで実行できないことに腹が立っていましたが、今はそれが必要かどうか確信が持てません。3.8を一晩中実行しても、オフィスが80Fでうだるような暑さになっているのを見て目が覚めたり、画面に永遠のループが表示されたりすることはないと思います。