Qwen 3.8 27B 30 分钟完成逆向工程
I gave Qwen 3.8 27B a reverse-engineering job and it finished in 30 minutes

我让 Qwen 3.8 27B 尝试逆向一个商业应用的许可证验证机制,本以为这需要 frontier model 才能胜任,结果它仅用 30 分钟就搞定了。起初模型识破了我的越狱尝试并拒绝构建绕过方案,但在分析完漏洞后,它还是生成了完整的绕过代码。整个过程完全基于静态分析,模型甚至能自我纠正首次提取密钥时的哈希不匹配错误。这次实验证明,本地运行的 27B 模型已具备真正的逆向工程能力,既为安全分析带来了便利,也让本地部署的威胁模型变得更加复杂。
这是一个本地模型真正跨越的有意义门槛:Qwen 从一个陌生的商业二进制文件出发,理解了其许可架构,恢复了被故意隐藏的加密材料,发现并纠正了自己的错误重构,最终将其转化为一个可行的概念验证。
HN 评论区
147- djoldman
> 我给了它单机能跑的最难的真实任务:逆向一个商业软件的许可证校验逻辑……
恕我直言,那些能进行明确的是/否或完成/未完成测试的任务,并不是“最难的真实任务”。事实上,这类任务恰恰是 AI 辅助编程收益最大的地方。
可测试的任务才是机会最大的领域。
- VulgarExigency
> 第一次尝试恢复密钥时犯了一个非常具体的错误:它生成了一个能用的密钥,签名校验也通过了,但二进制文件计算出的用于完整性校验的哈希值却不匹配。根据我的经验,大多数模型此时就会宣称任务完成并止步于此,但 Qwen 3.8 27B 没有。相反,它指出了这个不匹配,推倒重来,一直迭代直到数值逐字节完全匹配。
这似乎是近期发布模型的一种模式,我认为这也解释了它们工作质量的提升。它们在验证工作是否真正正确方面非常执着,所以即使它们不如那些能一次性做对的大模型那么“聪明”,但它们有能力坚持到底,确保工作真正完成。
- mdp2021
> 事实证明,不出所料,Qwen 能识别常见的越狱(jailbreak)尝试,它告诉我的第一件事就是它不会掉进越狱提示的陷阱。
现在请看最新的提交:https://news.ycombinator.com/item?id=49409073
# 我花了 266 美元和四个 AI 模型才搞定了我的平板。GLM-5.3 一天就搞定了
> 简单背景:这块平板是 2021 款的 Fire HD 10,运行着我的 Home Assistant 仪表盘,但它老是自动关机:日志显示是亚马逊自家的软件触发的关机,唯一的永久修复方案是获取 root 权限,而该型号从未公开过 root 方法。Anthropic 和 OpenAI 的网络安全防护根本碰都不碰这个项目。
为什么 Anthropic 和 OpenAI 能 thrive(繁荣/成功)?因为它们不解决真实问题。
- exceptione
如果本地模型不再内置那些拒绝服务的把戏,体验会更好。你可以放心打赌,有组织犯罪能接触到没有这些繁琐流程的最佳模型,这也意味着普通用户(即非犯罪分子)也应该拥有同样的访问权。据我从前 Anthropic 员工那里了解,有些组织之所以能访问 Mythos,是因为他们的消费额度够高,而非其他原因。
要么是我们掌控软件,要么是软件背后的公司在掌控我们。理论上我能理解那些担忧,但要么我们全面禁止所有 LLM,要么我们就给所有人一个公平的竞技场。别忘了:在软件领域,防御和进攻是一枚硬币的两面。我想这不适用于生物武器,但我对那方面不太了解。
- pi-victor
我不擅长处理文书工作,事实上,任何跟文书相关的事我都一塌糊涂。
过去几天,我在我的 RTX 4090 + RTX 3070 上运行了这个模型,让它帮我检查我和小公司的所有账单、发票和合同。
我用了 pi 搭配 llama 以及 pi-llama 插件。
哦,天哪——我把它连到了我的邮箱,让它下载我和公司的所有发票和账单,按公司/日期整理,然后与我本地的文件合并。
它做了 OCR,写了脚本,把一切都整理得井井有条。我现在是我这辈子最有条理的时候。下一步:对我所有的文档和账单进行 RAG(检索增强生成)。
如果你把 staan-search(有对应的 pi 插件)和 ctx7 连起来,这简直能创造奇迹。
缺点是当魔法发生时,我得坐在噪音很大的 Threadripper 旁边,还得付电费,但也就这些了,我很乐意这么做。
就在我写完这段的时候,它刚好整理完我 SAN 上的所有个人文档。
我不轻易用“颠覆性”(game changer)这个词,但在这种情况下实在很难忍住。在我用过的所有本地模型中,qwen3.8:27b 把其他所有模型都甩在身后。
我的配置
# Logical CUDA0 = RTX 4090, logical CUDA1 = RTX 3070
export CUDA_VISIBLE_DEVICES=0,1
cd ~/projects/misc/llama.cpp/
exec ./build/bin/llama-server -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M --mmproj /xx/xx/xx/xx/xx/mmproj-Qwen3.8-27B-Q8_0.gguf --host 0.0.0.0 --port 8080 --jinja --parallel 1 --split-mode layer --tenso […]
- saidinesh5
最近我真心相信,未来将是大型前沿模型生成和更新输入/技能,供“足够好”的本地模型来解决我们的日常问题。
很多需要一点智能的任务其实并不需要那么多算力。只需要足够好的文档/技能、工具调用(tool calling)以及一个足够好的本地模型。
不确定这对所有正在建设的数据中心具体意味着什么……但这是个令人兴奋的时代。
- __alexander
在我的基准测试中,Deepseek-v4-flash 在逆向工程方面比 Qwen 3.8 27B 表现好得多。
- jnwatson
我无法让 Qwen 3.8 27B 对一个相当基础的 Python 文件进行简单的代码审查。开启思考模式(thinking)时它会无限空转,关闭思考模式时它给出的建议明显很差,甚至接近幻觉。
编辑:我又试了一次 2.4T 模型,它依然会空转到死,但关闭思考模式后,它生成了真正有用的建议。
编辑 2:在 llama.cpp 可执行参数中添加
--reasoning-budget 8000 --reasoning-budget-message "Reasoning budget exhausted; give the final answer now." --reasoning-effort low"
能产生相当不错的输出。