自托管 Kimi K3:硬件贵 20%,任务解决率更高
Self-hosting Kimi K3: 20% more hardware cost, 20% better task resolution

今年 AI 代币账单飙升,许多团队开始考虑自托管。我们测试了 Kimi K3,发现虽然硬件成本比 GLM-5.2 高出 20%,吞吐量低 30%,但任务解决率高达 86.4%,远超其他模型。关键在于利用率:企业 GPU 平均利用率仅 15-22%,而自托管需为峰值负载买单。如果团队并发高、任务复杂,自托管可能更划算。
当硬件所有权摆在桌面上时,你需要理解租用或拥有 GPU 实际上能给你带来什么回报。
HN 评论区
47- walrus01
引用原文:
> 在我们的测试中,K3 支持 16 个并发会话(GLM-5.2 支持 24 个)。聚合 token 吞吐量低约 30%(16 用户下分别为 122 和 170 tok/s),中位任务时间长约 50%(38 分钟对 26 分钟)。这使得 K3 的速度大约比我们基于 Claude Code 的基准慢 8 倍。然而,K3 在质量上弥补了这一点,解决了 86.4% 的任务,比 GLM-5.2 和 Opus 4.8(两者均为 62.5%)高出 24 个百分点。
我认为自托管 Kimi K3 这样规模的模型有一些难以量化的优势,无法用 token/s 或问题解决率这样的具体数字来衡量。例如:
a) 数据隐私/主权,涵盖从医疗到个人,再到“我们不能让数据传到美国”的加拿大和欧洲用户的各种视角。
b) 能够向其下达信息安全/网络安全任务和红队演练场景,而不会触发 Claude 或 OpenAI 的拒绝响应。
c) 能够向其下达信息安全/网络安全任务,且完全不用担心账号被 Anthropic 或 OpenAI 封禁或调查。
- ktosobcy
最近我开始玩 LM Studio 和本地模型,发现 `gemma-4-26b-a4b` 的能力令人惊讶。我不需要那种“创建一个完整的 App 来做 X”或者“重构数亿行代码的代码库”的复杂任务,而是“如何着手做 X”或者用于语言学习(解释短语动词的细微差别或其他语言词汇的微妙之处),结果相当不错(以至于我现在主要用它)。
- Lord-Jobo
> 买哪台盒子
……
> spark,成本比一次出差开会还低。
我知道列出具体价格会让文章在地区和时间上变得局限,毕竟价格波动太大。但如果没有具体价格,分析“买什么”几乎毫无意义。
总体而言,这是一篇好文章,很高兴看到真正可实现的真实部署案例,而不仅仅是订阅三大厂商的 token 套餐。
- joshstrange
背景噪音太大,让我完全无法集中注意力阅读这篇文章。页眉部分就很烦人,往下翻也一直在响。如果你想在营销页面上这么干,请便;但如果是博客/新闻风格的页面?只有开启阅读模式才能恢复理智。
- michalpleban
我很想看到这类对比,但希望是针对量化版本的,因为量化允许在更小的硬件上运行模型,尽管会有一定质量损失。我在一块原本闲置的 A6000 显卡上运行了量化为 int4 的 Qwen3.6-35B-A3B,效果尚可,但我非常希望能看到不同模型不同量化版本的基准测试对比,尤其是质量方面。这是决定购买 GPU 是否值得的重要维度,而这篇(否则相当全面)的文章中却缺失了这一点。