12 大模型大乱斗:GPT-5.6 与 Muse Spark 对决
GPT-5.6, Grok 4.5, Claude, and Muse Spark build the same 4 apps
继上次评测引发热议后,我们听取了反馈,将规模扩大至 12 款模型,包括 GPT-5.6 的 Sol、Terra、Luna 三档版本,以及 Meta 新推出的 Muse Spark 1.1,还有 Grok 4.5、Claude 系列和多款开源模型。我们让它们在 Doom 风格迷宫、3D 魔方和计算器这四个任务中各尝试五次。结果令人意外:GPT 系列在迷宫任务中表现统治级,但魔方任务中却不如预期;Claude Fable 5 在魔方上完美通关,而 Opus 却全军覆没;Muse Spark 1.1 虽不稳定,但成功时表现惊艳。所有原始构建代码和演示视频均已公开,数据透明,结论由你说了算。
我们生成的是一堆庞大的构建产物,并全部公开,你可以自己形成判断。
- 有评论者指出当前基准测试存在严重的 arenamaxxing 现象,模型针对 Arena 中常见的 one-shot 游戏生成任务进行了过度优化,导致评分无法反映处理复杂遗留代码库的真实能力。
- 一位从业者强调,更有价值的评估方向是模型如何将 10 万 token 的现有代码库和工具调用转化为 100 token 的精准指令,而非单纯测试从少量提示生成大量代码的能力。
- 针对 Anthropic 模型频繁使用 'Honestly' 一词的现象,有用户推测这可能源于 Canva 等特定数据集的训练偏差,并认为这种机械化的修辞暴露了模型缺乏人类自然的语调变化。
- 关于 AI 生成内容的风格争议,有观点反驳了'AI 写作单调乏味'的论调,认为人类写作同样充满陈词滥调,而 AI 至少提供了客观的度量标准,优于仅凭主观感觉(vibes)的评判。