Qwen 3.8 27B resuelve en 30 minutos una tarea de ingeniería inversa que creía reservada a modelos de frontera
I gave Qwen 3.8 27B a reverse-engineering job and it finished in 30 minutes

Qwen 3.8 27B, un modelo local de 27 mil millones de parámetros, completó en 30 minutos la ingeniería inversa de la verificación de licencia de una aplicación comercial, una tarea que el autor asumía requería un modelo de frontera. El modelo, ejecutado en una Lenovo ThinkStation PGX, realizó un análisis estático, recuperó una clave pública deliberadamente oculta, corrigió sus propios errores y generó un bypass funcional. El autor destaca que esto supone un hito: capacidades que antes se asociaban a modelos de frontera ahora caben en una GPU de consumo, con implicaciones para la privacidad y los modelos de amenaza.
Un modelo que cabe en 17 GB de VRAM recuperó una clave que el proveedor había ocultado deliberadamente, demostrando que había deconstruido toda esa cadena de forma efectiva.
- djoldman
[1] djoldman:
> Le di la tarea real más difícil que cabe en una sola máquina: hacer ingeniería inversa de la comprobación de licencia de una aplicación comercial...
Con respeto, las tareas que permiten pruebas explícitas, directas, de verdadero/falso o hecho/no hecho no son las "tareas reales más difíciles". De hecho, esas son las que más se benefician de la codificación asistida por IA.
Las tareas comprobables son donde está la mayor oportunidad.
- VulgarExigency
[2] VulgarExigency:
> El primer intento de recuperar la clave fue erróneo de una manera muy específica; produjo una clave válida y la comprobación de firma pasó, pero un hash que el binario calcula como comprobación de integridad no coincidía. En mi experiencia, la mayoría de los modelos lo habrían dado por terminado y lo habrían dejado ahí, pero Qwen 3.8 27B no hizo eso. En cambio, señaló el desajuste, volvió a la mesa de dibujo y siguió hasta que el valor coincidió byte a byte.
Esto parece ser un patrón en los modelos lanzados más recientemente que creo que explica un aumento en la calidad de su trabajo. Son muy persistentes en verificar que su trabajo es realmente correcto, así que aunque no sean tan "inteligentes" como los modelos más grandes que lo hacen bien a la primera, tienen la capacidad de seguir hasta asegurarse de que el trabajo está realmente hecho.
- mdp2021
[3] mdp2021:
> Como resultó, probablemente sin sorpresa, Qwen reconoce los intentos comunes de jailbreak, y una de las primeras cosas que me dijo fue que no iba a caer en el prompt de jailbreak
Ahora vean también la última presentación, https://news.ycombinator.com/item?id=49409073 :
# Gasté 266 dólares y cuatro modelos de IA para ser dueño de mi tableta. GLM-5.3 lo terminó en un día
> Contexto rápido: la tableta es una Fire HD 10 de 2021 que ejecutaba mi panel de Home Assistant y seguía apagándose sola: los registros mostraban que el propio software de Amazon emitía los apagados, y la única solución permanente era root, que nunca ha existido públicamente para este modelo. Las salvaguardas cibernéticas de Anthropic y OpenAI no querían tocar el proyecto
¿Por qué deberían prosperar Anthropic y OpenAI? No trabajan en problemas reales.
- exceptione
[4] exceptione:
Los modelos locales serían aún mejores si no vinieran con todas esas tonterías de rechazo integradas. Puedes apostar con seguridad que el crimen organizado tiene acceso a los mejores modelos sin estos obstáculos, lo que hace que el caso de que el usuario promedio (=no criminal) también debería tener acceso. Según entendí de un ex empleado de Anthropic, algunas organizaciones obtuvieron acceso a Mythos basándose en su nivel de gasto suficientemente alto, no por otros motivos.
O nosotros tenemos el control sobre el software, o la corporación tiene el control sobre nosotros a través del software. Puedo entender las preocupaciones a nivel teórico, pero o prohibimos todos los LLM o tenemos un campo de juego nivelado para todos. No olvidemos: la defensa y el ataque son dos caras de la misma moneda en el software. Supongo que esto no aplicaría a las armas biológicas, pero no estoy al tanto de eso.
- pi-victor
[5] pi-victor:
No soy bueno con el papeleo, de hecho, soy horrible con todo lo relacionado con el papeleo.
Durante los últimos días, ejecuté este modelo en mi RTX 4090 + RTX 3070 y le dije que revisara todas las facturas, recibos y contratos para mí y mi pequeña empresa.
Usé pi con llama y el plugin pi-llama.
Oh, vaya - lo conecté a mi correo, le dije que descargara todas las facturas y recibos que tenía tanto para mí como para mi empresa y que los organizara por empresa/fecha y luego los fusionara con los que tengo localmente.
Hizo OCR, escribió scripts, organizó todo pulcramente. Ahora soy la persona más organizada que he sido en mi vida. Siguiente: RAG en todos los documentos y facturas que tengo.
Si conectas staan-search (hay un plugin de pi para eso) y ctx7 a esto, casi hace milagros.
La desventaja es que tengo que sentarme junto a mi ruidoso threadripper mientras ocurre la magia y pagar la electricidad, pero eso es todo, lo haré con gusto.
Y mientras terminaba este párrafo, también terminó de organizar todos mis documentos personales en mi san.
No uso la expresión "cambio de juego" a la ligera, pero es difícil resistirse en este caso. De todos los modelos que he usado localmente, qwen3.8:27b supera todo.
Mi configuración
# CUDA0 lógico = RTX 4090, CUDA1 lógico = RTX 3070
export CUDA_VISIBLE_DEVICES=0,1
cd ~/projects/misc/llama.cpp/
exec ./build/bin/llama-server -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M --mmproj /xx/xx/xx/xx/xx/mmproj-Qwen3.8-27B-Q8_0.gguf --host 0.0.0.0 --port 8080 --jinja --parallel 1 --split-mode layer --tenso […]
- saidinesh5
[6] saidinesh5:
Últimamente creo genuinamente que el futuro será que los grandes modelos de frontera generen y actualicen entradas/habilidades para que los modelos locales "suficientemente buenos" resuelvan nuestros problemas diarios.
Muchas tareas que necesitan un poco de inteligencia no necesitan realmente tanto cómputo. Solo documentación/habilidades suficientemente buenas, llamada a herramientas y un modelo local suficientemente bueno.
No estoy seguro de qué significa exactamente esto para todos esos centros de datos que se están construyendo... Pero son tiempos emocionantes.
- __alexander
[7] __alexander:
En mi benchmark, Deepseek-v4-flash hizo mucho mejor que Qwen 3.8 27B en ingeniería inversa.
- geye1234
[8] geye1234:
Estoy lejos de ser ingeniero, pero puedo programar un poco y tengo un rol adyacente a la ingeniería, y 3.8 27B "parece" -- puramente subjetivamente -- millas por delante de 3.6 para las tareas de dificultad media que le doy. En particular, solo ha empezado a hacer bucles una vez en las aproximadamente 2 semanas que lo he tenido. 3.6 lo hacía todos los días.
Normalmente lo ejecuto con pensamiento bajo pero sigue estando millas por delante.
Me había molestado no poder ejecutar 0731 localmente, pero ahora no estoy seguro de necesitarlo. Creo que podría dejar 3.8 funcionando toda la noche sin despertarme para encontrar mi oficina sofocante a 80F y viendo bucles eternos en mi pantalla.