GPT-5.6 与 Claude 联手“画”蒙娜丽莎
"Drawing" the Mona Lisa with GPT-5.6, Claude, Gemini, and Grok
我们搭建了一个绘画竞技场,让 GPT-5.6 Sol、Claude Fable 5、Grok 4.5 和 Gemini 3.6 Flash 四款模型手持彩色铅笔工具,在空白画布上挑战绘制《蒙娜丽莎》和《星月夜》。结果令人深思:Claude Fable 5 虽然耗时最长、花费高达 160 美元,但输出效果反而更差;Grok 4.5 在基础绘图任务上表现粗糙,而开源模型甚至直接返回空白画布。更有趣的是,模型在反复查看画布后,最终得分往往低于中途的最佳状态。这场实验不仅揭示了不同模型在长任务中的真实成本与能力差距,也打破了“越贵越好”的迷思,让我们看到 AI 在创造性任务中的真实边界。
在全部八次目标绘图任务中,最终成画的得分都低于模型在运行中途达到的最佳分数。
HN 评论区
103- NichoPaolucci
几个月前,我们有一个生成 SVG 的需求,于是添加了这项技能:https://github.com/upbrew-tech/svg-creator-skill
我觉得用这个技能,Claude 画出来的效果比帖子里给的示例要好。https://claude.ai/share/bc0867dc-034f-4865-bb71-acb83bfa36a1
- jnathsf
起初我浏览这些图片时,完全无感。但随后我开始想,这些画看起来有点……“幼稚”。
这种幼稚是指……一个刚入门的艺术家在画概念,而不是光影或形态(随着对绘画理解的加深,艺术家通常会转向后者)。
特别是花瓶里的玫瑰——有些模型理解那里应该有阴影、反射,甚至折射的概念;而另一些模型只是简单地画了“蓝色=玻璃”、“绿色=茎”、“红色=玫瑰”。
这真的很奇怪,因为如果我看到人类小孩画的任何一幅这样的画,我都会说“干得漂亮,伙计”,然后把它贴在冰箱上。我期待随着模型的提升,这些作品也会变得更好,或许艺术的进步也会随之而来……
- ksd482
GPT 5.6 Sol 画出了最好的两幅图(玫瑰和星夜),但更令人印象深刻的是它在成本/时间/Token 方面的效率,远超 Fable(340 万 vs 1460 万 / 7.74 美元 vs 161 美元!)。OpenAI 在推理方面进行了低调的创新——这将成为一个日益显著的差异化优势,即便是面对开源模型也是如此。