Text-to-SQL-Benchmarks scheitern an der Realität echter Datenbanken
Any text-to-SQL benchmark should address difficulties of real-world data stores

Aktuelle Text-to-SQL-Benchmarks wie Spider oder BIRD testen hauptsächlich einfache Abfragen auf sauberen, gut dokumentierten Schemata. In der Praxis aber kämpfen Entwickler mit unvollständigen Metadaten, inkonsistenten Daten und komplexen Geschäftslogiken, die in SQL schwer abzubilden sind. Der Artikel argumentiert, dass neue Benchmarks diese realen Hürden abbilden müssen, um die tatsächliche Leistungsfähigkeit von LLM-basierten Systemen zu messen – und zeigt anhand konkreter Beispiele, warum aktuelle Modelle in realen Szenarien oft scheitern.
Ein Benchmark, der die Schwierigkeiten realer Datenspeicher nicht abbildet, misst lediglich die Fähigkeit, synthetische Probleme zu lösen.