Pelicanmaxxing: KI-Labore trainieren offenbar nicht auf Simon Willisons berühmtem Benchmark
Are AI Labs Pelicanmaxxing?

Simon Willisons Pelikan-auf-Fahrrad-Prompt ist zum inoffiziellen KI-Benchmark geworden. Dylan Castillo hat 1.008 SVGs von sieben Frontier-Modellen generieren lassen und mit einem LLM-Judge bewertet. Seine Analyse zeigt: Kein Labor schneidet bei der berühmten Kombination besser ab als bei anderen Tieren oder Fahrzeugen – selbst nach Korrektur für Schwierigkeit. Die Ergebnisse deuten darauf hin, dass Labs nicht auf diesen speziellen Benchmark trainieren.
Wenn Labs auf dem Benchmark trainiert hätten, würdest du Pelikane an der Spitze erwarten. Stattdessen sind sie in der unteren Hälfte.