Pelicanmaxxing: KI-Labore trainieren offenbar nicht auf Simon Willisons berühmtem Benchmark

Are AI Labs Pelicanmaxxing?

Pelicanmaxxing: KI-Labore trainieren offenbar nicht auf Simon Willisons berühmtem Benchmark

Simon Willisons Pelikan-auf-Fahrrad-Prompt ist zum inoffiziellen KI-Benchmark geworden. Dylan Castillo hat 1.008 SVGs von sieben Frontier-Modellen generieren lassen und mit einem LLM-Judge bewertet. Seine Analyse zeigt: Kein Labor schneidet bei der berühmten Kombination besser ab als bei anderen Tieren oder Fahrzeugen – selbst nach Korrektur für Schwierigkeit. Die Ergebnisse deuten darauf hin, dass Labs nicht auf diesen speziellen Benchmark trainieren.

Wenn Labs auf dem Benchmark trainiert hätten, würdest du Pelikane an der Spitze erwarten. Stattdessen sind sie in der unteren Hälfte.

Mehr von diesem Tag

2026-07-22