Pelican-bicycle alternatives: 2026多模型SVG生成能力横向评测

Show HN: Pelican-bicycle alternatives (updated for 2026)

这是一个专为开发者设计的SVG生成能力对比平台,旨在探索大语言模型在复杂视觉指令下的表现。项目通过“章鱼演奏管风琴”、“长颈鹿组装座钟”等充满想象力的提示词,对GPT-6 Astra、Claude Fable 5.1、Gemini 3.8 Flash、DeepSeek V4 Pro等主流模型进行了2026年最新版本的实测。不仅展示了各模型生成的SVG图像,还详细记录了生成耗时与成本,并提供了与2025年旧版模型(如GPT-5.1、Claude Sonnet 4.5)的历史数据对比。无论是寻找高性价比的SVG生成方案,还是观察AI绘图技术的演进,这里都是不可多得的参考资源。

通过让AI绘制‘海星驾驶推土机’或‘火烈鸟修理望远镜’,我们直观地看到了不同模型在理解复杂场景与生成矢量图形时的巨大差异。
  1. svcrunch

    我想提一下 Little Dorrit Benchmark [1],这个评测我已经运行了好几年了。它有几个不错的特点:

    1. 它在单一任务中同时测试了视觉推理和结构化输出能力。

    2. 它似乎能正确地对通用智能的进步进行排序。举个反例,如果我没记错的话,artificialanalysis.ai 最近对其评测基准做了一些调整,因为 Astra 的排名低于几个旧模型。

    3. 尽管过去两年模型有了显著提升,但顶尖模型的 F1 分数仍停留在 0.78,说明该测试尚未饱和。作为参考,当我刚开始时,顶尖模型的分数在 [0.1, 0.2] 区间。

  2. vova_hn2

    网站看起来非常酷,Fable 那只章鱼指挥家看起来很可爱,但我觉得这个基准测试(根据简短且略带荒谬的描述生成 SVG)总体上已经完全被古德哈特定律 [0] 玩坏了。

    我认为它们只是在训练集中加入了一大堆类似的任务,所以我们再也无法判断模型真正的涌现能力了。

  3. theshrike79

    我觉得有趣的是,SVG 版本并没有像生成的图片那样严重存在“AI 图像生成讨厌留白”的问题。它们能紧扣主题,不会用某种图案填满每一个空白区域。

  4. samayashar

    现在所有模型生成这类图像的能力都相当不错。回想当年,我记得尝试过那些鹈鹕图片,大多数模型都无法让腿和车轮对齐。即便现在,GPT 也搞砸了,它把章鱼的一条腿画成了从乐器里长出来的,而不是从章鱼身上长出来的。

    我认为将两个实体(有生命的/无生命的)交织在一起仍然具有挑战性,但总体来说它们的表现已经相当扎实。

  5. outlore

    还有其他人对这些生成的图像看起来如此惊人地相似感到惊讶吗?所有这些模型都“独立”地归纳出:驼鹿应该大致站在同一个位置(左侧),或者长颈鹿应该拥有某种特定的配色方案。

同日更多故事

2026-09-14