Qwen 3.8 27B за 30 минут справился с реверс-инжинирингом, который я считал задачей для frontier-модели

I gave Qwen 3.8 27B a reverse-engineering job and it finished in 30 minutes

Qwen 3.8 27B за 30 минут справился с реверс-инжинирингом, который я считал задачей для frontier-модели

Журналист XDA проверил локальную модель Qwen 3.8 27B на сложной задаче: реверс-инжиниринг проверки лицензии коммерческого приложения. Модель, работающая на одной Lenovo ThinkStation PGX, отказалась выполнять прямой jailbreak, но затем самостоятельно провела статический анализ, восстановила скрытый публичный ключ, исправила собственную ошибку и создала рабочий обходной путь — всё за 30 минут. Автор отмечает, что это меняет представления о возможностях локальных моделей и их роли в threat model.

Модель, которая помещается в 17 ГБ видеопамяти, восстановила ключ, который разработчик намеренно скрыл, доказав, что она эффективно разобрала всю эту цепочку.
  1. djoldman

    Я дал ему самую сложную реальную задачу, которая помещается на одной машине: реверс-инжиниринг проверки лицензии коммерческого приложения...

    С уважением, задачи, которые допускают явные прямые проверки истина/ложь или сделано/не сделано, не являются «самыми сложными реальными задачами». На самом деле, именно они дают наибольший выигрыш от программирования с помощью ИИ.

    Задачи, которые можно проверить, — это там, где самая большая возможность.

  2. VulgarExigency

    Первая попытка восстановить ключ была неправильной очень специфическим образом: она дала рабочий ключ, и проверка подписи прошла, но хэш, который бинарник вычисляет как проверку целостности, не совпал. По моему опыту, большинство моделей назвали бы это готовым и оставили как есть, но Qwen 3.8 27B этого не сделал. Вместо этого он выделил несоответствие, вернулся к чертежной доске и продолжал, пока значение не совпало байт в байт.

    Похоже, это закономерность в более новых моделях, которая, как я думаю, объясняет рост качества их работы. Они очень настойчивы в проверке того, что их работа действительно правильная, так что даже если они не такие «умные», как более крупные модели, которые делают правильно с первого раза, у них есть способность довести дело до конца, чтобы убедиться, что работа действительно сделана.

  3. mdp2021

    Как оказалось, вероятно, неудивительно, Qwen распознает типичные попытки джейлбрейка, и одна из первых вещей, которую он мне сказал, — что он не собирается поддаваться на промпт для джейлбрейка.

    Теперь также смотрите последнюю публикацию, https://news.ycombinator.com/item?id=49409073 :

    # Я потратил 266 долларов и четыре модели ИИ, чтобы получить полный контроль над своим планшетом. GLM-5.3 справился за день

    > Краткий контекст: планшет — это Fire HD 10 2021 года, на котором работала моя панель Home Assistant, и он постоянно выключался: логи показали, что собственное ПО Amazon инициировало выключения, и единственным постоянным решением был root, которого никогда не существовало публично для этой модели. Киберзащита Anthropic и OpenAI не стала бы трогать этот проект.

    Почему должны процветать Anthropic и OpenAI: они не работают над реальными проблемами.

  4. exceptione

    Локальные модели были бы еще лучше, если бы они не поставлялись со всеми встроенными отказами. Можно с уверенностью поспорить, что у организованной преступности есть доступ к лучшим моделям без этих препятствий, что делает аргумент в пользу того, что обычный пользователь (=не преступник) тоже должен иметь доступ. Как я понял из бывшего сотрудника Anthropic, некоторые организации получили доступ к Mythos на основе достаточно высокого уровня расходов, а не по другим причинам.

    Либо мы командуем программным обеспечением, либо корпорация командует нами через программное обеспечение. Я на теоретическом уровне понимаю опасения, но либо мы запрещаем все LLM, либо у нас равные условия для всех. Не будем забывать: защита и нападение — это две стороны одной медали в программном обеспечении. Думаю, это не относится к биологическому оружию, но я не в курсе.

  5. pi-victor

    Я не силен в бумажной работе, на самом деле, я ужасен во всем, что связано с документами.

    Последние несколько дней я запускал эту модель на своем RTX 4090 + RTX 3070 и просил ее проверить все счета, накладные, контракты для меня и моей маленькой компании.

    Я использовал pi с llama и плагином pi-llama.

    О, боже — я подключил его к своей почте, сказал ему скачать все счета-фактуры и накладные, которые у меня есть и для меня, и для моей компании, и организовать их по компании/дате, а затем объединить их с теми, что у меня есть локально.

    Он сделал OCR, написал скрипты, аккуратно все организовал. Теперь я самый организованный человек в своей жизни. Далее: RAG по всем документам и счетам, которые у меня есть.

    Если подключить staan-search (для этого есть плагин pi) и ctx7, это почти творит чудеса.

    Минус в том, что мне приходится сидеть рядом с моим шумным Threadripper, пока происходит магия, и платить за электричество, но это все, я с радостью это сделаю.

    И когда я закончил этот абзац, он также закончил организацию всех моих личных документов на моем SAN.

    Я не использую выражение «переломный момент» легко, но в этом случае трудно устоять. Из всех моделей, которые я использовал локально, qwen3.8:27b превосходит все.

    Моя настройка

    # Logical CUDA0 = RTX 4090, logical CUDA1 = RTX 3070

    export CUDA_VISIBLE_DEVICES=0,1

    cd ~/projects/misc/llama.cpp/

    exec ./build/bin/llama-server -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M --mmproj /xx/xx/xx/xx/xx/mmproj-Qwen3.8-27B-Q8_0.gguf --host 0.0.0.0 --port 8080 --jinja --parallel 1 --split-mode layer --tenso […]

  6. saidinesh5

    В последнее время я искренне верю, что будущее будет за большими frontier-моделями, которые генерируют и обновляют входные данные/навыки для «достаточно хороших» локальных моделей, чтобы решать наши повседневные проблемы.

    Многие задачи, требующие немного интеллекта, на самом деле не требуют так много вычислений. Достаточно хорошей документации/навыков, вызова инструментов и достаточно хорошей локальной модели.

    Не уверен, что именно это значит для всех этих строящихся дата-центров... Но захватывающие времена.

  7. __alexander

    В моем бенчмарке Deepseek-v4-flash справился с реверс-инжинирингом гораздо лучше, чем Qwen 3.8 27B.

    https://alexander-hanel.github.io/StressingLLMs/

  8. geye1234

    Я далек от инженера, но умею немного программировать и имею роль, смежную с инженерной, и 3.8 27B «кажется» — чисто субъективно — на голову впереди 3.6 для задач средней сложности, которые я ему даю. В частности, он зацикливался только один раз за примерно две недели, что я его использую. 3.6 делал это каждый день.

    Обычно я запускаю с низким уровнем мышления, но он все равно на голову впереди.

    Меня раздражало, что я не могу запустить 0731 локально, но теперь я не уверен, что он мне нужен. Думаю, я мог бы оставить 3.8 работать на ночь, не просыпаясь и не обнаруживая, что мой офис плавится при 80F, и не видя вечных циклов на экране.

Ещё за этот день

2026-08-23