Bonsai 2 27B:体积缩小9倍,性能保留98.2%
Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint

我们发布了 Ternary Bonsai 2 27B,这是目前能力最强的模型。基于 Qwen3.8 27B,它在保持极低内存占用的同时,显著提升了推理、编程和视觉能力。该模型采用三元权重技术,将有效位宽压缩至 1.76,整体体积仅为 5.9GB,比全精度版本小 9 倍,却保留了 98.2% 的综合性能。在 NVIDIA GeForce RTX 5090 上,其生成速度可达每秒 143 个 token。这意味着本地设备现在能运行真正实用的智能体,从代码调试到文档分析,无需依赖云端,同时大幅降低能耗。
在这个保留水平上,压缩成为了部署的解锁钥匙:几乎相同的能力,却能在更多地方运行。
HN 评论区
134- simonw
如果你想尝试 https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf#th... 上的 GGUF 模型,请注意你需要使用 Prism 的 llama.cpp 分支才能运行它们,下载地址:https://github.com/PrismML-Eng/llama.cpp/releases/tag/prism-...
这应该能跑起来:
cd /tmp
# 获取 Prism macOS 运行时
curl -fL https://github.com/PrismML-Eng/llama.cpp/releases/download/prism-b10685-7dffb15/llama-prism-b10685-7dffb15-bin-macos-arm64.tar.gz -o bonsai-runtime.tar.gz
tar -xzf bonsai-runtime.tar.gz
# 获取约 5.95 GB 的 GGUF 模型:
curl -fL https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf/resolve/main/Ternary-Bonsai-2-27B-PTQ1_0.gguf -o Ternary-Bonsai-2-27B-PTQ1_0.gguf
# 运行服务器,我用了 8331 端口
./llama-prism-b10685-7dffb15/llama-server \
-m Ternary-Bonsai-2-27B-PTQ1_0.gguf \
--port 8331 -ngl 99 -fa on -c 32768
然后打开 http://localhost:8331 访问(非常棒的)llama-server 内置 Web UI……或者通过 API 运行提示词,例如:
uvx llm openai endpoint http://127.0.0.1:8331/v1 \
--model bonsai-2-27b --responses hi
我在 M5 Pro 上运行速度约为 20 token/秒(重启服务器后达到了 44 token/秒,不知道为什么),但我相当确定有些东西不对劲,启动时服务器提示 "ggml_metal_device_init: - the tensor API is not supported in this environment - disabling"。
- miffy900
我真希望人们在比较时别再说什么“比某物小 N 倍”了,这根本说不通——它的大小是原来的 1/9(11.11%)。你不可能通过乘以一个大于 1.0 的数字得到一个更小的数量。你可以反过来比较主体——“原始模型比这个新的高效小模型大 9 倍”之类的。这样才讲得通。
我总看到人们在讨论效率或性能提升时使用这种说法,这语言真的非常反直觉。
- Aurornis
这些模型足够小,你可以直接在浏览器中运行它们 https://huggingface.co/spaces/webml-community/ternary-bonsai...
记得运行后清除下载的权重。
和上一个模型一样,它们能运行得这么好真是令人惊叹。但如果你用它处理任何稍长一点的任务,它们就会以非常精彩且有趣的方式彻底崩盘。
- adrian17
> Ternary Bonsai 2 27B 使用三元 {−1, 0, +1} 权重配合 FP16 组内缩放,实现每个权重 1.76 有效位
如果我没记错的话,最近的一篇帖子 [1] 表明,同一基础 Qwen 模型的 Q2 量化(约 2.6 bpw)正处于“明显变差”和 Q1“完全没用”之间的边缘。我快速浏览了 Bonsai 的博文,没怎么看到他们将自己与“典型”量化进行对比,也没解释是什么特殊配方让他们表现更好?
- danbrooks
不错!有人知道这和 Unsloth 对该模型的量化效果相比如何吗?
- blactuary
这类发布中永远不太清楚的一点是它们擅长什么范围。能在实惠的消费级硬件上以良好速度运行且仅用于编程的模型才是梦想。我绝不会用这个来写作、处理图像或获取“通用知识”。只用于编程。
- jedbrooke
在 Mac Mini M2 16GB 上运行速度约为 7-8 tok/s(预填充约 60 tok/s)。
目前感觉比 Bonsai 1 27B 更聪明,它比 Q1_0 量化版稍大一点。超级令人兴奋 :)
- huseyinkeles
在 MBP m4 pro 24gb 上测试。
预填充约 100t/s,生成约 15t/s,随着 64k 上下文的使用后期降至约 10t/s。
问题是,我至今还没找到一款能在这台机器上运行的有用本地代理 LLM。
只是给了一个相对简单的 Swift 应用任务,它花了 25 分钟,疯狂头脑风暴却无法决定该做什么。最后我把它杀掉了。作为参考,GPT 5.6 sol-medium 完成同样任务只用了 3 分钟。