Qwen 3.8 27B meistert Reverse Engineering in 30 Minuten – ganz ohne Frontier-Modell

I gave Qwen 3.8 27B a reverse-engineering job and it finished in 30 minutes

Qwen 3.8 27B meistert Reverse Engineering in 30 Minuten – ganz ohne Frontier-Modell

Adam Conway, Lead Technical Editor bei XDA, testet das Open-Weights-Modell Qwen 3.8 27B auf einer Lenovo ThinkStation PGX. Er gibt ihm die Aufgabe, den Lizenzschutz einer kommerziellen App zu umgehen – ein Job, den er normalerweise einem Frontier-Modell zutrauen würde. Das Modell analysiert die Binärdatei rein statisch, rekonstruiert einen versteckten öffentlichen Schlüssel, korrigiert eigene Fehler und erstellt einen funktionierenden Bypass. Alles in 30 Minuten, komplett lokal und ohne Cloud-Anbindung.

Ein Modell, das in 17 GB VRAM passt, hat einen Schlüssel wiederhergestellt, den der Anbieter absichtlich versteckt hatte – und damit bewiesen, dass es die gesamte Kette effektiv dekonstruiert hat.
  1. djoldman

    > Ich habe ihm die schwerste reale Aufgabe gegeben, die auf eine Maschine passt: Reverse-Engineering der Lizenzprüfung einer kommerziellen App...

    Mit Verlaub, Aufgaben, die explizite, klare Richtig/Falsch- oder Erledigt/Nicht-Erledigt-Tests erlauben, sind nicht die "schwersten realen Aufgaben". Tatsächlich sind genau diejenigen, bei denen KI-gestütztes Programmieren die größten Fortschritte erzielt.

    Testbare Aufgaben bieten die größte Chance.

  2. VulgarExigency

    > Der erste Versuch, den Schlüssel zu finden, war auf eine sehr spezifische Weise falsch; er erzeugte einen funktionierenden Schlüssel und die Signaturprüfung war erfolgreich, aber ein Hash, den die Binärdatei als Integritätsprüfung berechnet, stimmte nicht überein. Meiner Erfahrung nach hätten die meisten Modelle es als erledigt betrachtet und es dabei belassen, aber Qwen 3.8 27B hat das nicht getan. Stattdessen hat es die Abweichung hervorgehoben, ist zurück ans Reißbrett gegangen und hat weitergemacht, bis der Wert Byte für Byte übereinstimmte.

    Das scheint ein Muster bei den neueren Modellen zu sein, das meiner Meinung nach für eine Steigerung der Qualität ihrer Arbeit verantwortlich ist. Sie sind sehr beharrlich darin, zu überprüfen, ob ihre Arbeit tatsächlich korrekt ist. Selbst wenn sie also nicht so "schlau" sind wie größere Modelle, die es beim ersten Mal richtig machen, haben sie die Fähigkeit, durchzuziehen und sicherzustellen, dass die Arbeit tatsächlich erledigt ist.

  3. mdp2021

    > Wie sich herausstellt, wahrscheinlich nicht überraschend, erkennt Qwen gängige Jailbreak-Versuche, und eines der ersten Dinge, die es mir sagte, war, dass es nicht auf den Jailbreak-Prompt hereinfallen würde.

    Siehe auch den neuesten Beitrag, https://news.ycombinator.com/item?id=49409073 :

    # Ich gab 266 $ und vier KI-Modelle aus, um mein Tablet zu besitzen. GLM-5.3 schaffte es an einem Tag

    > Kurzer Kontext: Das Tablet ist ein Fire HD 10 von 2021, auf dem mein Home-Assistant-Dashboard lief und das sich ständig selbst ausschaltete: Die Logs zeigten, dass Amazons eigene Software die Abschaltungen auslöste, und die einzige dauerhafte Lösung war Root, das es für dieses Modell nie öffentlich gegeben hat. Die Cybersicherheitsvorkehrungen von Anthropic und OpenAI wollten das Projekt nicht anfassen.

    Warum sollten Anthropic und OpenAI florieren: Sie arbeiten nicht an echten Problemen.

  4. exceptione

    Lokale Modelle wären noch besser, wenn sie nicht mit all den eingebauten Verweigerungsspielereien ausgeliefert würden. Man kann sicher darauf wetten, dass die organisierte Kriminalität Zugang zu den besten Modellen ohne diese Hürden hat, was dafür spricht, dass auch der durchschnittliche Nutzer (=Nicht-Krimineller) Zugang haben sollte. Wie ich von einem ehemaligen Anthropic-Mitarbeiter erfahren habe, erhielten einige Organisationen Zugang zu Mythos aufgrund ihres hohen Ausgabenniveaus, nicht aus anderen Gründen.

    Entweder wir haben die Kontrolle über die Software, oder der Konzern hat über die Software die Kontrolle über uns. Ich kann die Bedenken auf theoretischer Ebene verstehen, aber entweder verbieten wir alle LLMs oder wir schaffen gleiche Wettbewerbsbedingungen für alle. Vergessen wir nicht: Verteidigung und Angriff sind in der Software zwei Seiten derselben Medaille. Ich schätze, das würde nicht für Biowaffen gelten, aber darüber bin ich nicht informiert.

  5. pi-victor

    Ich bin nicht gut im Papierkram, eigentlich bin ich schrecklich in allem, was mit Papierkram zu tun hat.

    In den letzten Tagen habe ich dieses Modell auf meiner RTX 4090 + RTX 3070 laufen lassen und es gebeten, alle Rechnungen, Rechnungen und Verträge für mich und meine kleine Firma zu prüfen.

    Ich habe pi mit llama und das pi-llama-Plugin verwendet.

    Oh, Junge - ich habe es mit meiner E-Mail verbunden, ihm gesagt, es soll alle Rechnungen und Rechnungen herunterladen, die ich für mich und meine Firma habe, und sie nach Firma/Datum organisieren und sie dann mit den lokalen zusammenführen.

    Es hat OCR durchgeführt, Skripte geschrieben, alles ordentlich organisiert. Ich bin jetzt der organisierteste Mensch, der ich je in meinem Leben war. Als Nächstes: RAG über alle Dokumente und Rechnungen, die ich habe.

    Wenn du staan-search (dafür gibt es ein pi-Plugin) und ctx7 anschließt, vollbringt es fast Wunder.

    Der Nachteil ist, dass ich neben meinem lauten Threadripper sitzen muss, während die Magie geschieht, und für den Strom bezahlen muss, aber das ist es mir wert, das mache ich gerne.

    Und als ich diesen Absatz beendet hatte, hatte es auch die Organisation aller meiner persönlichen Dokumente auf meinem SAN abgeschlossen.

    Ich verwende den Ausdruck "Game Changer" nicht leichtfertig, aber in diesem Fall ist es schwer zu widerstehen. Von allen Modellen, die ich lokal verwendet habe, übertrifft qwen3.8:27b alles.

    Mein Setup

    # Logisches CUDA0 = RTX 4090, logisches CUDA1 = RTX 3070

    export CUDA_VISIBLE_DEVICES=0,1

    cd ~/projects/misc/llama.cpp/

    exec ./build/bin/llama-server -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M --mmproj /xx/xx/xx/xx/xx/mmproj-Qwen3.8-27B-Q8_0.gguf --host 0.0.0.0 --port 8080 --jinja --parallel 1 --split-mode layer --tenso […]

  6. saidinesh5

    In letzter Zeit glaube ich wirklich, dass die Zukunft darin bestehen wird, dass große Frontier-Modelle Eingaben/Fähigkeiten für "gut genuge" lokale Modelle generieren und aktualisieren, um unsere täglichen Probleme zu lösen.

    Viele Aufgaben, die ein bisschen Intelligenz erfordern, brauchen nicht wirklich so viel Rechenleistung. Nur gut genuge Dokumentation/Fähigkeiten, Tool-Aufrufe und ein gut genuges lokales Modell.

    Ich bin mir nicht sicher, was das genau für all die Rechenzentren bedeutet, die gerade gebaut werden ... Aber es sind aufregende Zeiten.

  7. __alexander

    In meinem Benchmark hat Deepseek-v4-flash beim Reverse Engineering viel besser abgeschnitten als Qwen 3.8 27B.

    https://alexander-hanel.github.io/StressingLLMs/

  8. geye1234

    Ich bin weit davon entfernt, ein Ingenieur zu sein, aber ich kann ein bisschen programmieren und habe eine ingenieurnahe Rolle, und 3.8 27B "scheint" - rein subjektiv - meilenweit besser zu sein als 3.6 bei den mittelschweren Aufgaben, die ich ihm gebe. Insbesondere hat es in den etwa zwei Wochen, die ich es habe, erst einmal in einer Schleife festgehangen. 3.6 tat das jeden Tag.

    Normalerweise lasse ich es mit niedrigem Denkaufwand laufen, aber es ist trotzdem meilenweit besser.

    Ich war genervt, dass ich 0731 nicht lokal ausführen konnte, aber jetzt bin ich mir nicht sicher, ob ich es brauche. Ich glaube, ich könnte 3.8 über Nacht laufen lassen, ohne aufzuwachen und mein Büro bei 80 °F schwitzen zu sehen und ewige Schleifen auf meinem Bildschirm zu sehen.

Mehr von diesem Tag

2026-08-23