使用开源模型竟意外地令人愉悦
Using an open model feels surprisingly good
我使用 Claude 和 ChatGPT 已有两年,从未对开源软件特别热衷。但最近,当我在本地成功部署 opencode 并连接到自己管理的 Modal 推理端点时,那种感觉意外地好。数据直接从我的笔记本电脑流向端点再返回,一切仿佛真正属于我。这种掌控感让我感到前所未有的自由。就像从繁琐的大型编辑器切换到 vim 一样清爽,仿佛切断了与其他服务商的束缚,得以自由呼吸。这种体验既奇怪又令人惊喜,也让我决定记录下来。
这种感觉就像在折腾了各种大型花哨编辑器后打开 vim,或者像是切断了捆绑我的那些服务商的触须,让我能自由呼吸。
HN 评论区
142- wps
Claude Code 之所以如此流行,是因为它特别擅长处理那种超级模糊的人类自然语言提示,比如“Claude,给我造个价值百万美元的 SaaS”这类指令,然后吐出成千上万行代码,覆盖大量表面层的边缘情况,构建大量功能等等。
小型/开源模型在这方面没那么强。但这并不是软件开发的正确方式。你不会提示出一个完整的应用然后就万事大吉。如果你把它当作传统软件开发的辅助工具,针对小型、具体的功能进行迭代,GLM 的表现和 Claude 一样好,甚至更好。Anthropic 是冲着低质量提示来的。如果你用 GLM 进行“橡皮鸭调试”(rubber duck),在大多数情况下,你会得到绝对完美的输出。
- arjie
说实话,我对 DeepSeek V4 Flash 的表现感到惊讶。我平时大部分时间都用 Claude Code 和 Codex,跑在 Claude 5 Opus 和 GPT-5.6 Sol 上,但当我用 DS V4 Flash 时,感觉它其实也没那么差。配合 oh-my-pi 或者单纯的 pi,效果相当不错。老实说,前沿模型在工具调用(tool calling)方面确实强得多,所以在助手工作流中它们表现更好。但我做了件蠢事,为了适配模型而优化了 harness(工具框架),重写了工具以匹配模型的猜测,结果 DS V4 Flash 也能应付自如。
小模型的 TTFT(首字延迟)和 tok/s(每秒 token 数)要高得多,这让它在很多场景下都很有竞争力。这种感觉就像去年年底时的旧版 Sonnet,说实话,那玩意儿相当好用。
- loufe
这明显是一篇披着薄纱的广告。不过没关系,反正我本来就对这种配置很感兴趣。
如果有成本指标就好了。我很好奇我愿意花多少溢价,来避免这些公司把我的对话直接传给 NSA。也许只是某些对话?据我所知,Claude 和 OpenAI 都获得了巨额补贴,所以 Kimi K3 在私有端点上最终的成本可能会更高,也可能更低——这正是我想知道的。
- mbanerjeepalmer
这就是广告。
我知道作者在这里资历很深,我也相信这篇帖子是真实的感受。但发布“我用了自己的产品,感觉真好”这种内容,除了自我推销还能是什么?
- m_ke
GLM 5.2 的感觉比 Opus 更好,K3 的表现和 Fable 不相上下。
现在我迫不及待想看到有人把 K3 蒸馏成 Qwen 3.6 27b 或 Poolside S 2.1 这样大小的模型,以此打造一个真正的、快速的本地版 Composer 2.5 替代品。
- wxw
> 我能想到的最好的描述是:就像在折腾了一大堆花哨的大编辑器之后,终于打开了 vim。
抛开 harness 不谈,当我从大型前沿模型切换到像 Composer 这样更灵活的工具时,我有时也会有这种感觉。
用快速模型,我能进入更好的思考和问答循环,就像用 vim 浏览文件时那种行云流水的感觉一样。
- sudo_cowsay
我也喜欢 OpenCode 及其那种留白的感觉。干净、轻量、手动。这与我们在互联网上习惯的东西(非常酷但很慢)相比,是一种很好的节奏变化。另外,能把那个模态计划(modal plan)发我一下吗?XD
- nottorp
抛开这是广告不谈,这个模型是真正干活了,还是仅仅让你感觉良好?