Qwen 3.8 27B за 30 минут справился с реверс-инжинирингом, который я считал задачей для frontier-модели
I gave Qwen 3.8 27B a reverse-engineering job and it finished in 30 minutes

Журналист XDA проверил локальную модель Qwen 3.8 27B на сложной задаче: реверс-инжиниринг проверки лицензии коммерческого приложения. Модель, работающая на одной Lenovo ThinkStation PGX, отказалась выполнять прямой jailbreak, но затем самостоятельно провела статический анализ, восстановила скрытый публичный ключ, исправила собственную ошибку и создала рабочий обходной путь — всё за 30 минут. Автор отмечает, что это меняет представления о возможностях локальных моделей и их роли в threat model.
Модель, которая помещается в 17 ГБ видеопамяти, восстановила ключ, который разработчик намеренно скрыл, доказав, что она эффективно разобрала всю эту цепочку.
- djoldman
Я дал ему самую сложную реальную задачу, которая помещается на одной машине: реверс-инжиниринг проверки лицензии коммерческого приложения...
С уважением, задачи, которые допускают явные прямые проверки истина/ложь или сделано/не сделано, не являются «самыми сложными реальными задачами». На самом деле, именно они дают наибольший выигрыш от программирования с помощью ИИ.
Задачи, которые можно проверить, — это там, где самая большая возможность.
- VulgarExigency
Первая попытка восстановить ключ была неправильной очень специфическим образом: она дала рабочий ключ, и проверка подписи прошла, но хэш, который бинарник вычисляет как проверку целостности, не совпал. По моему опыту, большинство моделей назвали бы это готовым и оставили как есть, но Qwen 3.8 27B этого не сделал. Вместо этого он выделил несоответствие, вернулся к чертежной доске и продолжал, пока значение не совпало байт в байт.
Похоже, это закономерность в более новых моделях, которая, как я думаю, объясняет рост качества их работы. Они очень настойчивы в проверке того, что их работа действительно правильная, так что даже если они не такие «умные», как более крупные модели, которые делают правильно с первого раза, у них есть способность довести дело до конца, чтобы убедиться, что работа действительно сделана.
- mdp2021
Как оказалось, вероятно, неудивительно, Qwen распознает типичные попытки джейлбрейка, и одна из первых вещей, которую он мне сказал, — что он не собирается поддаваться на промпт для джейлбрейка.
Теперь также смотрите последнюю публикацию, https://news.ycombinator.com/item?id=49409073 :
# Я потратил 266 долларов и четыре модели ИИ, чтобы получить полный контроль над своим планшетом. GLM-5.3 справился за день
> Краткий контекст: планшет — это Fire HD 10 2021 года, на котором работала моя панель Home Assistant, и он постоянно выключался: логи показали, что собственное ПО Amazon инициировало выключения, и единственным постоянным решением был root, которого никогда не существовало публично для этой модели. Киберзащита Anthropic и OpenAI не стала бы трогать этот проект.
Почему должны процветать Anthropic и OpenAI: они не работают над реальными проблемами.
- exceptione
Локальные модели были бы еще лучше, если бы они не поставлялись со всеми встроенными отказами. Можно с уверенностью поспорить, что у организованной преступности есть доступ к лучшим моделям без этих препятствий, что делает аргумент в пользу того, что обычный пользователь (=не преступник) тоже должен иметь доступ. Как я понял из бывшего сотрудника Anthropic, некоторые организации получили доступ к Mythos на основе достаточно высокого уровня расходов, а не по другим причинам.
Либо мы командуем программным обеспечением, либо корпорация командует нами через программное обеспечение. Я на теоретическом уровне понимаю опасения, но либо мы запрещаем все LLM, либо у нас равные условия для всех. Не будем забывать: защита и нападение — это две стороны одной медали в программном обеспечении. Думаю, это не относится к биологическому оружию, но я не в курсе.
- pi-victor
Я не силен в бумажной работе, на самом деле, я ужасен во всем, что связано с документами.
Последние несколько дней я запускал эту модель на своем RTX 4090 + RTX 3070 и просил ее проверить все счета, накладные, контракты для меня и моей маленькой компании.
Я использовал pi с llama и плагином pi-llama.
О, боже — я подключил его к своей почте, сказал ему скачать все счета-фактуры и накладные, которые у меня есть и для меня, и для моей компании, и организовать их по компании/дате, а затем объединить их с теми, что у меня есть локально.
Он сделал OCR, написал скрипты, аккуратно все организовал. Теперь я самый организованный человек в своей жизни. Далее: RAG по всем документам и счетам, которые у меня есть.
Если подключить staan-search (для этого есть плагин pi) и ctx7, это почти творит чудеса.
Минус в том, что мне приходится сидеть рядом с моим шумным Threadripper, пока происходит магия, и платить за электричество, но это все, я с радостью это сделаю.
И когда я закончил этот абзац, он также закончил организацию всех моих личных документов на моем SAN.
Я не использую выражение «переломный момент» легко, но в этом случае трудно устоять. Из всех моделей, которые я использовал локально, qwen3.8:27b превосходит все.
Моя настройка
# Logical CUDA0 = RTX 4090, logical CUDA1 = RTX 3070
export CUDA_VISIBLE_DEVICES=0,1
cd ~/projects/misc/llama.cpp/
exec ./build/bin/llama-server -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M --mmproj /xx/xx/xx/xx/xx/mmproj-Qwen3.8-27B-Q8_0.gguf --host 0.0.0.0 --port 8080 --jinja --parallel 1 --split-mode layer --tenso […]
- saidinesh5
В последнее время я искренне верю, что будущее будет за большими frontier-моделями, которые генерируют и обновляют входные данные/навыки для «достаточно хороших» локальных моделей, чтобы решать наши повседневные проблемы.
Многие задачи, требующие немного интеллекта, на самом деле не требуют так много вычислений. Достаточно хорошей документации/навыков, вызова инструментов и достаточно хорошей локальной модели.
Не уверен, что именно это значит для всех этих строящихся дата-центров... Но захватывающие времена.
- __alexander
В моем бенчмарке Deepseek-v4-flash справился с реверс-инжинирингом гораздо лучше, чем Qwen 3.8 27B.
- geye1234
Я далек от инженера, но умею немного программировать и имею роль, смежную с инженерной, и 3.8 27B «кажется» — чисто субъективно — на голову впереди 3.6 для задач средней сложности, которые я ему даю. В частности, он зацикливался только один раз за примерно две недели, что я его использую. 3.6 делал это каждый день.
Обычно я запускаю с низким уровнем мышления, но он все равно на голову впереди.
Меня раздражало, что я не могу запустить 0731 локально, но теперь я не уверен, что он мне нужен. Думаю, я мог бы оставить 3.8 работать на ночь, не просыпаясь и не обнаруживая, что мой офис плавится при 80F, и не видя вечных циклов на экране.