Grok 4.5、GPT-5.5 与 Claude 同题大比拼

We made Grok 4.5, GPT-5.5, and Claude build the same apps

Grok 4.5、GPT-5.5 与 Claude 同题大比拼

我们让 Grok 4.5、GPT-5.5、Claude Opus 4.8 和 Claude Fable 5 用完全相同的提示词,从零构建三个独立应用:3D 魔方、粒子引力沙盒和打砖块游戏。结果令人意外:Claude 系列在复杂的 3D 魔方任务中首试即胜,GPT-5.5 的粒子效果最迷幻,而 Grok 4.5 虽然魔方首秀翻车,但在速度和成本上完胜全场。数据显示,Grok 4.5 的响应速度是其他模型的近两倍,且价格最低。这场对决揭示了一个真相:在追求极致性价比的代码生成场景下,Grok 4.5 是当之无愧的怪兽,而 Claude 和 GPT 则在复杂逻辑和视觉美感上更胜一筹。

Grok 4.5 是速度与价值的怪兽,它构建了出色的打砖块游戏和炫酷的引力模拟,流式传输速度约为其他模型的两倍,且运行成本最低。
  • 多位亲历者实测指出 Grok 在多次打乱魔方后无法正确复原,而 Opus 能成功解决,质疑其作为软件开发工具的可靠性。
  • 有评论者认为 Grok 代码生成的合理性体现在对物理规则的尊重(如 Breakout 游戏中砖块厚度),优于其他模型的渲染效果。
  • 针对文章主观性过强的批评,部分用户建议引入盲测机制,并指出 GPT-5.5 与 Fable 或 Opus 的对比存在版本不对等的问题。
  • 有开发者分享了利用 Subagents 架构的低成本实践,通过让 Codex 调用 ChatGPT 网页版作为子代理,以每月 20 美元的成本高效处理大规模数据集。
  • 关于模型风格差异的争论中,有人将 AI 生成的特定英语表达归因于肯尼亚 RLHF 数据的影响,也有人反驳称 Transformer 本质是预测机器而非平均机器。

同日更多故事

2026-07-09