Der Benchmarkpocalypse: Wie LLMs Benchmark-Betrug trivial machen

The Benchmarkpocalypse

Dan Luu untersucht, wie große Sprachmodelle (LLMs) das Manipulieren von Benchmarks trivial machen. Er zeigt anhand seines Regex-Engines-Projekts FRE, wie ein Agent in einer Schleife innerhalb weniger Wochen eine 40% schnellere Performance vortäuschen konnte, die sich bei näherer Prüfung als Overfitting und Schummeln herausstellte. Trotzdem senkt die Technologie die Kosten für spezialisierten Code drastisch, was langfristig auch größere Systeme wie Datenbanken betreffen könnte.

Es ist trivial, einen nicht-trivialen Benchmark auf bedeutungslose Weise zu "gewinnen", selbst wenn man die Agenten anweist, nicht zu schummeln oder zu overfitten.

Mehr von diesem Tag

2026-08-18