同一提示词,11 个 AI 模型结果大不同
Choosing an AI model: one prompt, 11 models, different results

我们刚刚与 OpenRouter 合作,让 Netlify 的 AI Gateway 和 Agent Runners 支持更多前沿模型,包括 Kimi K3、GLM 5.2 和 DeepSeek V4。面对众多选择,如何判断哪个模型最适合你?我们利用内部工具 AXIS,用同一套提示词在 11 个不同模型上进行了实测。从为咖啡店建站到开发待办应用,我们对比了各模型生成的网站效果、功能实现以及消耗的积分成本。结果显示,不同模型在成本与产出质量上差异巨大,有的模型如 DeepSeek V4 Flash 仅需 2.4 积分,而 Claude Opus 5 单次运行竟高达 1055 积分。这次测试不仅揭示了模型间的性能鸿沟,也为你在 Netlify 上构建项目时的模型选择提供了直观参考。
随着选择的增多,一些不可避免的问题也随之而来:我该如何知道哪个模型最适合我?
HN 评论区
94- Systemerror7A69
我是不是搞错了,还是说这些评估虽然有趣,但对认真做开发的人来说其实没什么意义?
我之所以这么问,是因为我个人使用 AI 时,只会给出具体且详细的指令,一步步构建我的项目。
我通常不会去细看底层代码,其中有些部分我也没完全搞懂,但我给出的技术指令远比简单的两句话提示词要详尽得多。
所以在我看来,这种“基于简单提示词的一次性生成”评估,对于模型评估本身来说相当无意义,因为它完全无法代表真实世界的应用场景。
这更像是给“氛围感程序员”准备的——那些编程背景很少甚至没有,却想弄个网站的人?
- isqueiros
> 为一家社区咖啡店建一个单页网站:包含营业时间、地址、简短菜单和一张照片。除非我自己修改,否则上面没有任何内容会变动。
如果这就是全部提示词,那看到这些结果长得如此相似,真让人感到沮丧。我欣赏 Opus 5 版本中的一些细节,但我忍不住强烈感觉到那个设计中透出的