Pelican-bicycle alternatives - LLM SVG生成能力の2026年最新比較

Show HN: Pelican-bicycle alternatives (updated for 2026)

Pelican-bicycle alternativesは、複数のLLMが生成するSVGを比較するベンチマークサイトです。2026年と2025年のモデルに「タコがパイプオルガンを演奏する」「キリンが祖父の時計を組み立てる」など8つの奇妙なプロンプトを与え、生成結果を並べて表示。GPT-6 Astra、Claude Fable 5.1、Gemini 3.8 Flash、DeepSeek V4 Pro、Qwen3.8 Max、Fugu Ultra v2などが参加し、生成時間とコストも記録されています。モデルごとの創造性や指示追従性の違いを視覚的に確認でき、最適なモデル選びの参考になります。

6モデルがタコにパイプオルガンを演奏させ、キリンに時計を組み立てさせる——その結果を一目で比較できる。
  1. svcrunch

    何年も前から走らせているLittle Dorrit Benchmark [1]について言及したいと思います。これにはいくつか良い特徴があります:

    1. 視覚的推論と構造化出力を単一のタスクでテストします。

    2. 一般的知能の進歩に正しくソートされるようです。反例として、記憶違いでなければ、Astraがいくつかの古いモデルより下にランクされた後、artificialanalysis.aiが最近ベンチマークにいくつかの変更を加えました。

    3. 過去2年間でモデルは大幅に改善しましたが、トップモデルは依然として0.78 F1であり、テストはまだ飽和していません。参考までに、私が始めたとき、トップモデルは[0.1, 0.2]の範囲でした。

    [1] https://dorrit.pairsys.ai/

  2. vova_hn2

    ウェブサイトはとてもクールに見えますし、Fableのタコのオルガン奏者はとても可愛いですが、このベンチマーク(短くて少しばかげた説明からSVGを生成する)は一般的に完全にGoodhart化されているように感じます[0]。

    みんな似たようなタスクを訓練セットに大量に追加しただけなので、モデルの真の創発的能力をもはや判断できません。

    [0] https://en.wikipedia.org/wiki/Goodhart%27s_law

  3. outlore

    生成結果が驚くほど似ていることに驚いた人は他にいますか?これらのモデルはすべて「独立に」、ヘラジカはほぼ同じ位置(左)に立つべきだとか、キリンは特定の色調を持つべきだとかを一般化しているのです。

  4. samayashar

    今ではすべてのモデルがこれらの画像を生成するのがかなり上手です。昔、ペリカンの画像を実験していたとき、ほとんどのモデルが脚を車輪に合わせられなかったのを覚えています。今でも、GPTはタコの脚をタコ自体からではなく楽器を通って始まるようにしてしまいました。

    生きているものと生きていないものという二つの実体を絡み合わせるのは依然として難しいと思いますが、全体的にはかなり堅実です。

  5. ianberdin

    https://playcode.io/blog/macbook-svg-benchmark

    SVGでのMacBook Pro 3Dは私にとって最も役立つものです。

この日のほかの記事

2026-09-14