KI-Benchmarks erreichen ihren Sättigungspunkt: Fast die Hälfte der getesteten Benchmarks sind gesättigt
When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation

Eine systematische Studie analysiert die Sättigung von 60 Sprachmodell-Benchmarks anhand von 14 Eigenschaften. Fast die Hälfte der Benchmarks zeigt Sättigung, wobei die Rate mit dem Alter steigt. Entscheidend ist, dass die Widerstandsfähigkeit gegen Sättigung von der Expertenkuratierung abhängt, nicht von öffentlichen Testdaten. Die Ergebnisse legen nahe, dass Designentscheidungen die Langlebigkeit von Benchmarks verlängern und zu dauerhafteren Evaluierungsansätzen führen können.
Wir stellen fest, dass fast die Hälfte unserer Benchmarks Sättigung aufweist, wobei die Raten mit dem Alter steigen.