9 款编码工具在本地模型下的真实表现
Nine coding harnesses vs. your laptop

如果你曾尝试用本地模型替换 API 调用,可能已经失望过。本文通过实测对比了 9 款主流 coding harness 在 MacBook Pro 上运行 Qwen 3.8 27B 的表现。问题不在于模型本身,而在于大多数工具并非为本地环境设计:过长的系统提示词、庞大的 tool schemas 以及频繁的 side requests 导致预填充时间长达数分钟。测试显示,像 opencode 和 crush 这类工具在本地几乎不可用,而 pi、mini-swe-agent 和专为 Apple silicon 优化的 chad 则表现稳定。关键在于精简上下文和减少不必要的请求,才能真正释放本地 LLM 的潜力。
在数据中心 GPU 上你可能察觉不到差异,但在你的笔记本上,这却是 22 秒与 226 秒的天壤之别。
HN 评论区
30- OleksandrC
如果你在寻找一款能完美适配资源受限环境(例如笔记本电脑、微型 VPS 服务器或微型单板计算机等)的编码智能体,并且希望它能与本地模型配合得非常好,那么你可能也会喜欢 hax(https://usehax.dev/)。这是一个 0.7 MB 的动态链接原生 C 二进制文件,运行时仅占用几 MB 内存,能自动发现正在运行的 local llama-server 的配置,并采用极简的系统提示词和工具集以实现轻量级的上下文使用。
- julesrms
HN 上似乎最近一直在涌现各种智能体框架的基准测试。每次看到这些,我都会好奇:那些设计测试的人在决定测试哪些框架时,到底在看哪里?因为目前似乎没人愿意测试我的框架!(https://juggler.studio)
我知道 Juggler 非常新,但这个领域的变动实在太快了,很难知道该往哪个方向发力。很难猜测 Juggler 的优势在像这样的特定测试中是会表现出色还是显得糟糕。在我决定优化方向时,任何关于大家感兴趣参数的反馈都非常有用。
- alex_john_m
这句话到底是什么意思?
'它在不同夜晚之间的波动高达 50%,因此 lean arms 之间的差异算不上发现。'
- toasty228
有点跑题,因为我没用本地模型,但我最近针对我的工作负载对 codex、pi 和 omp 进行了基准测试,发现 codex 在速度和 token 效率上都优于 pi 和 omp。没有任何一种情况是 pi 更快或更便宜的。
- larodi
我注意到一个模式:很多人都在 Apple Silicon 和 x86 平台上使用 Qwen 3.8 27B 进行本地推理。考虑到这么多人的意见都汇聚到了这个模型上,这暗示该模型一定非常出色。