Qwen 3.8 27B 30 分钟完成逆向工程

I gave Qwen 3.8 27B a reverse-engineering job and it finished in 30 minutes

Qwen 3.8 27B 30 分钟完成逆向工程

我让 Qwen 3.8 27B 尝试逆向一个商业应用的许可证验证机制,本以为这需要 frontier model 才能胜任,结果它仅用 30 分钟就搞定了。起初模型识破了我的越狱尝试并拒绝构建绕过方案,但在分析完漏洞后,它还是生成了完整的绕过代码。整个过程完全基于静态分析,模型甚至能自我纠正首次提取密钥时的哈希不匹配错误。这次实验证明,本地运行的 27B 模型已具备真正的逆向工程能力,既为安全分析带来了便利,也让本地部署的威胁模型变得更加复杂。

这是一个本地模型真正跨越的有意义门槛:Qwen 从一个陌生的商业二进制文件出发,理解了其许可架构,恢复了被故意隐藏的加密材料,发现并纠正了自己的错误重构,最终将其转化为一个可行的概念验证。
  1. djoldman

    > 我给了它单机能跑的最难的真实任务:逆向一个商业软件的许可证校验逻辑……

    恕我直言,那些能进行明确的是/否或完成/未完成测试的任务,并不是“最难的真实任务”。事实上,这类任务恰恰是 AI 辅助编程收益最大的地方。

    可测试的任务才是机会最大的领域。

  2. VulgarExigency

    > 第一次尝试恢复密钥时犯了一个非常具体的错误:它生成了一个能用的密钥,签名校验也通过了,但二进制文件计算出的用于完整性校验的哈希值却不匹配。根据我的经验,大多数模型此时就会宣称任务完成并止步于此,但 Qwen 3.8 27B 没有。相反,它指出了这个不匹配,推倒重来,一直迭代直到数值逐字节完全匹配。

    这似乎是近期发布模型的一种模式,我认为这也解释了它们工作质量的提升。它们在验证工作是否真正正确方面非常执着,所以即使它们不如那些能一次性做对的大模型那么“聪明”,但它们有能力坚持到底,确保工作真正完成。

  3. mdp2021

    > 事实证明,不出所料,Qwen 能识别常见的越狱(jailbreak)尝试,它告诉我的第一件事就是它不会掉进越狱提示的陷阱。

    现在请看最新的提交:https://news.ycombinator.com/item?id=49409073

    # 我花了 266 美元和四个 AI 模型才搞定了我的平板。GLM-5.3 一天就搞定了

    > 简单背景:这块平板是 2021 款的 Fire HD 10,运行着我的 Home Assistant 仪表盘,但它老是自动关机:日志显示是亚马逊自家的软件触发的关机,唯一的永久修复方案是获取 root 权限,而该型号从未公开过 root 方法。Anthropic 和 OpenAI 的网络安全防护根本碰都不碰这个项目。

    为什么 Anthropic 和 OpenAI 能 thrive(繁荣/成功)?因为它们不解决真实问题。

  4. exceptione

    如果本地模型不再内置那些拒绝服务的把戏,体验会更好。你可以放心打赌,有组织犯罪能接触到没有这些繁琐流程的最佳模型,这也意味着普通用户(即非犯罪分子)也应该拥有同样的访问权。据我从前 Anthropic 员工那里了解,有些组织之所以能访问 Mythos,是因为他们的消费额度够高,而非其他原因。

    要么是我们掌控软件,要么是软件背后的公司在掌控我们。理论上我能理解那些担忧,但要么我们全面禁止所有 LLM,要么我们就给所有人一个公平的竞技场。别忘了:在软件领域,防御和进攻是一枚硬币的两面。我想这不适用于生物武器,但我对那方面不太了解。

  5. pi-victor

    我不擅长处理文书工作,事实上,任何跟文书相关的事我都一塌糊涂。

    过去几天,我在我的 RTX 4090 + RTX 3070 上运行了这个模型,让它帮我检查我和小公司的所有账单、发票和合同。

    我用了 pi 搭配 llama 以及 pi-llama 插件。

    哦,天哪——我把它连到了我的邮箱,让它下载我和公司的所有发票和账单,按公司/日期整理,然后与我本地的文件合并。

    它做了 OCR,写了脚本,把一切都整理得井井有条。我现在是我这辈子最有条理的时候。下一步:对我所有的文档和账单进行 RAG(检索增强生成)。

    如果你把 staan-search(有对应的 pi 插件)和 ctx7 连起来,这简直能创造奇迹。

    缺点是当魔法发生时,我得坐在噪音很大的 Threadripper 旁边,还得付电费,但也就这些了,我很乐意这么做。

    就在我写完这段的时候,它刚好整理完我 SAN 上的所有个人文档。

    我不轻易用“颠覆性”(game changer)这个词,但在这种情况下实在很难忍住。在我用过的所有本地模型中,qwen3.8:27b 把其他所有模型都甩在身后。

    我的配置

    # Logical CUDA0 = RTX 4090, logical CUDA1 = RTX 3070

    export CUDA_VISIBLE_DEVICES=0,1

    cd ~/projects/misc/llama.cpp/

    exec ./build/bin/llama-server -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M --mmproj /xx/xx/xx/xx/xx/mmproj-Qwen3.8-27B-Q8_0.gguf --host 0.0.0.0 --port 8080 --jinja --parallel 1 --split-mode layer --tenso […]

  6. saidinesh5

    最近我真心相信,未来将是大型前沿模型生成和更新输入/技能,供“足够好”的本地模型来解决我们的日常问题。

    很多需要一点智能的任务其实并不需要那么多算力。只需要足够好的文档/技能、工具调用(tool calling)以及一个足够好的本地模型。

    不确定这对所有正在建设的数据中心具体意味着什么……但这是个令人兴奋的时代。

  7. __alexander

    在我的基准测试中,Deepseek-v4-flash 在逆向工程方面比 Qwen 3.8 27B 表现好得多。

    https://alexander-hanel.github.io/StressingLLMs/

  8. jnwatson

    我无法让 Qwen 3.8 27B 对一个相当基础的 Python 文件进行简单的代码审查。开启思考模式(thinking)时它会无限空转,关闭思考模式时它给出的建议明显很差,甚至接近幻觉。

    编辑:我又试了一次 2.4T 模型,它依然会空转到死,但关闭思考模式后,它生成了真正有用的建议。

    编辑 2:在 llama.cpp 可执行参数中添加

    --reasoning-budget 8000 --reasoning-budget-message "Reasoning budget exhausted; give the final answer now." --reasoning-effort low"

    能产生相当不错的输出。

同日更多故事

2026-08-23