同一提示词,11 个 AI 模型结果大不同
Choosing an AI model: one prompt, 11 models, different results

我们刚刚与 OpenRouter 合作,让 Netlify 的 AI Gateway 和 Agent Runners 支持更多前沿模型,包括 Kimi K3、GLM 5.2 和 DeepSeek V4。面对众多选择,如何判断哪个模型最适合你?我们利用内部工具 AXIS,用同一套提示词在 11 个不同模型上进行了实测。从为咖啡店建站到开发待办应用,我们对比了各模型生成的网站效果、功能实现以及消耗的积分成本。结果显示,不同模型在成本与产出质量上差异巨大,有的模型如 DeepSeek V4 Flash 仅需 2.4 积分,而 Claude Opus 5 单次运行竟高达 1055 积分。这次测试不仅揭示了模型间的性能鸿沟,也为你在 Netlify 上构建项目时的模型选择提供了直观参考。
随着选择的增多,一些不可避免的问题也随之而来:我该如何知道哪个模型最适合我?